본문 바로가기
카테고리 없음

제미나이 구글 2.5 정리해 봄

by Play__ 2026. 7. 13.
반응형
구글-제미나이-2-5-컴퓨터-사용-모델-뭐가-다르나-1-1773c26e.png
AI의 진짜 전환점은 더 똑똑한 답변이 아니라, 화면을 직접 움직이는 순간이다
구글-제미나이-2-5-컴퓨터-사용-모델-뭐가-다르나-2-2fef6271.png

말만 하던 AI가 직접 클릭한다고?
구글 딥마인드가 2025년 10월 7일 공개한 Gemini 2.5 Computer Use 모델은 기존 챗봇과 결정적으로 다릅니다. 일반 AI는 텍스트로 답을 줄 뿐이지만, 이 모델은 화면 스크린샷을 보고 클릭·입력·스크롤·드롭다운 선택 같은 UI 조작을 함수 호출로 직접 제안합니다. 말이 아니라 행동으로 넘어간 겁니다.

구글-제미나이-2-5-컴퓨터-사용-모델-뭐가-다르나-3-0b7dba2d.png

어떻게 작동하는지, 루프 구조가 핵심입니다
작동 방식은 반복 루프입니다. 사용자가 '쇼핑몰에서 조건에 맞는 상품을 장바구니에 담아줘'라고 요청하면, 모델은 현재 화면 스크린샷과 최근 행동 기록을 받아 다음 행동을 결정합니다. 개발자 코드가 그 클릭이나 입력을 실제 브라우저에서 실행하고, 새 스크린샷을 다시 모델에 보내는 방식으로 작업이 완료될 때까지 반복됩니다.


벤치마크 수치, 경쟁 모델과 비교하면
모델 카드 기준으로 Gemini 2.5 Computer Use는 Online-Mind2Web 69.0%, WebVoyager 88.9%, Android World 69.7%를 기록했습니다. 같은 표에서 OpenAI의 Computer Using Agent는 Online-Mind2Web 61.3%, WebVoyager 87.0%로 제시됐습니다. 단, 벤치마크는 테스트 환경과 지시문에 민감하므로 절대 성능으로 단정하면 안 됩니다.


웹 자동화엔 강하지만, 데스크톱 전체 제어는 아닙니다
구글은 이 모델이 웹 브라우저 자동화에 최적화됐고 모바일 UI에도 가능성을 보였다고 밝혔습니다. 하지만 데스크톱 OS 전체를 제어하는 데는 최적화되지 않았다고 공식 문서에서 명확히 선을 그었습니다. 고객지원, 폼 입력, 예약, CRM 정리, UI 테스트 같은 반복 사무 자동화가 주요 타깃입니다.


구매·송금엔 사람 확인이 필수입니다
AI가 직접 클릭하는 만큼 위험도 커집니다. 프롬프트 인젝션, 잘못된 클릭, 구매·송금·약관 동의 같은 고위험 행동이 문제가 됩니다. 그래서 구글은 파일 다운로드, 메시지 전송, 결제 등 돌이키기 어려운 행동에는 반드시 사용자 확인 단계를 넣도록 안전장치를 강조합니다. 자동화 편의와 통제권 사이의 균형이 핵심입니다.


지금 확인할 것, 2.5가 아니라 3.5 Flash입니다
2026년 6월 24일부터 Gemini 3.5 Flash에 컴퓨터 사용 기능이 내장되면서 3.5 Flash가 공식 권장 모델로 올라섰습니다. Gemini 2.5 Computer Use는 현재 레거시 프리뷰로 분류됩니다. 단독 특화 모델에서 범용 모델 안에 컴퓨터 제어가 흡수되는 방향이 뚜렷합니다. Gemini API·AI Studio·Vertex AI에서 3.5 Flash의 컴퓨터 사용 기능을 직접 테스트해보는 것이 지금 시점의 올바른 선택입니다.

#구글제미나이 #제미나이컴퓨터사용 #GeminiComputerUse #AI에이전트 #브라우저자동화 #제미나이2.5 #제미나이3.5Flash #AI자동화 #컴퓨터유스모델 #구글딥마인드 #AI업무자동화 #GeminiAPI #웹자동화

반응형