꾸비데브

브라우저 에이전트란 무엇인가, Anthropic 컴퓨터 사용 설정 3단계와 주의점

AI가 웹사이트를 대신 클릭하고 입력한다는 브라우저 에이전트가 궁금한 분께 드리는 글입니다. 어떤 제품이 있는지, 컴퓨터 사용 도구를 켜는 순서, 한계와 주의점을 정리했습니다.

한 줄 요약

브라우저 에이전트는 AI가 화면을 읽고 클릭하고 입력해 웹 작업을 대신 처리하는 기능입니다. "최초"는 어느 회사 기준이냐에 따라 달라지므로, 순서보다 어떤 작업에 얼마나 안전하게 쓸 수 있는지가 중요합니다.

AI에게 이렇게 시키기
내가 브라우저 에이전트에게 맡기려는 작업은 <작업>이야.
아래 기준으로 맡겨도 되는지 판단해 줘.
- 결제나 로그인처럼 사람이 직접 확인해야 하는 단계가 있는지
- 완벽한 정밀도가 필요하거나 민감한 개인정보를 다루는지
- 팝업이나 예상 못 한 화면이 나오면 멈추고 나에게 물어보도록 지시문에 넣을 내용
사람이 확인해야 하는 단계는 표시해 줘.

브라우저 에이전트는 AI가 사람 대신 웹사이트를 직접 클릭하고 입력해 작업을 처리하는 기능입니다. 화면을 읽고, 마우스를 움직이고, 글자를 입력하는 것까지 AI가 맡습니다.

"최초"라는 표현을 붙이려면 기준이 필요한데, 조사해 보니 회사마다 발표 시점과 방식이 달라 하나로 특정하기 어려웠습니다.

어떤 제품이 있나요

이 이름표를 붙일 수 있는 제품이 여러 개 있습니다.

Anthropic은 2024년 10월 Claude 3.5 Sonnet에 "컴퓨터 사용(Computer Use)" 기능을 베타로 공개했습니다. 화면을 스크린샷으로 읽고 마우스와 키보드를 조작하는 방식입니다.

이후 2025년 1월 OpenAI가 "오퍼레이터(Operator)"를 내놓았고, 같은 해 7월 이를 "ChatGPT 에이전트"로 통합했습니다. 구글도 "Gemini in Chrome"을 워크스페이스 사용자에게 공개하며 합류했습니다.

이 밖에 Perplexity의 코멧, OpenAI의 아틀라스처럼 브라우저 자체가 에이전트 중심으로 설계된 제품도 있습니다. 이렇게 여러 회사가 비슷한 개념을 각자 다른 이름으로 내놓았기 때문에, "최초"는 어느 회사 기준으로 보느냐에 따라 달라집니다.

브라우저 에이전트 등장 순서기준에 따라 최초는 달라집니다12024년 10월Anthropic 컴퓨터 사용 베타22025년 1월OpenAI 오퍼레이터32025년 7월ChatGPT 에이전트로 통합4구글 합류Gemini in Chrome

설정 방법은 어떻게 되나요 (Anthropic 컴퓨터 사용 기준)

공식 문서에 따르면 컴퓨터 사용 도구는 Messages API 요청의 tools 배열에 컴퓨터 사용 도구 세트를 추가하는 방식으로 켭니다. 스크린샷, 클릭, 입력 같은 동작들을 하나의 도구 세트로 묶어 제공합니다.

STEP 1

API 요청에 도구 세트 추가하기

별도의 베타 헤더 없이 도구 배열에 넣으면 됩니다.

STEP 2

화면 접근 환경 준비하기

AI가 조작할 화면(가상 데스크톱 등)을 애플리케이션 쪽에서 마련해야 합니다.

STEP 3

작업 지시하기

AI가 스크린샷을 보고 다음 동작(클릭, 입력 등)을 스스로 판단해 이어갑니다.

실제로 써 본 결과는 어땠나요

저는 반복적인 웹 조회 작업에 브라우저 에이전트를 써 봤습니다. 화면이 예상대로 뜰 때는 잘 작동했지만, 팝업이나 예상 못 한 레이아웃이 나오면 헤매는 경우가 있었습니다.

공식 문서도 이런 상황을 대비해 "완벽한 정밀도가 필요한 작업이나 민감한 개인정보를 다루는 작업에는 사람 확인 없이 쓰지 말라"고 안내하고 있습니다.

사람이 확인해야 하는 작업이럴 땐 사람 확인 단계를 넣기결제로그인완벽한 정밀도가 필요한 작업민감한 개인정보를 다루는 작업

한계와 주의점

공식 문서는 스크린샷에서 프롬프트 인젝션(화면 속 텍스트가 AI에게 몰래 지시를 내리는 공격) 가능성이 있어 자동으로 분류기를 돌려 의심스러운 지시를 걸러낸다고 설명합니다.

그리고 컴퓨터 사용은 클라이언트 쪽 도구라서, 스크린샷과 조작 기록이 Anthropic이 아니라 사용하는 쪽 환경에 저장된다는 점도 명시돼 있습니다.

자주 하는 실수

사람만큼 정확히 이해한다고 믿음

저는 처음에 브라우저 에이전트가 사람만큼 화면을 정확히 이해한다고 생각했습니다. 실제로는 스크린샷 기반으로 판단하기 때문에, 화면이 조금만 달라져도 엉뚱한 곳을 클릭하는 경우가 있었습니다. 지금은 중요한 작업(결제, 로그인)은 사람이 직접 확인하는 단계를 꼭 넣습니다.

자주 묻는 질문

정말 이 제품이 세계 최초인가요?

확인하지 못했습니다. Anthropic이 2024년 10월로는 비교적 이른 시점에 공개했지만, "최초"를 어느 기준(공개 시점, 상용화 시점, 브라우저 자체 설계 여부)으로 볼지에 따라 답이 달라집니다.

브라우저 에이전트를 쓰면 로그인이 필요한 사이트도 대신 처리하나요?

가능은 하지만, 계정 정보를 AI에게 맡기는 것이라 위험이 따릅니다. 로그인이 필요하면 사람이 직접 하고 그 세션을 AI가 이어 쓰는 방식이 더 안전합니다.

모든 브라우저에서 쓸 수 있나요?

아닙니다. 제품마다 지원 브라우저와 환경이 다릅니다. Gemini in Chrome처럼 특정 브라우저 전용인 경우도 있습니다.

정리

"최초"라는 표현은 매력적이지만, 실제로는 여러 회사가 비슷한 시기에 각자 발표한 개념입니다. 중요한 건 순서보다 어떤 작업에 얼마나 안전하게 쓸 수 있는지입니다.

공식 자료

← BLOG 전체 보기무료자료 보기 →