Serio의 X 스레드

Serio가 @Multi_Serio_Ai에 게시한 원문 타래를 보존한 글입니다. X 원문 타래

  1. 1
    구글은 코딩 AI로 진심으로 엔트로픽을 따라잡으려 하고 있다 구글은 코딩 AI로 진심으로 엔트로픽을 따라잡으려 하고 있다 구글은 코딩 AI로 진심으로 엔트로픽을 따라잡으려 하고 있다 구글은 코딩 AI로 진심으로 엔트로픽을 따라잡으려 하고 있다 https://t.co/hrDpjigTbl
    원문 보기
  2. 2

    Gemma4를 싱글턴 프롬으로만 쓰지, 에이전트용으로 쓰지 않음. 말하는 앵무새가 일을 하려면 도구를 쥘 줄 알아야 하는데 정확도부터 엉망진창인데 무슨. 일단 Gemma4 툴 콜링 고쳐 놓으면 그 다음에 믿겠음.

    근데 Qwen 3.6 27b 의 툴 콜링 정확도가 85% 수준이던데 과연 구글이 할 수 있을까.

    원문 보기

문향의 생각

안녕하세요. 문향입니다.

구글이 Gemini CLI를 통해 에이전트형 코딩 도구로의 전환을 꾀하며 앤트로픽의 Claude Code와 경쟁 구도를 형성하고 있다는 점은 공식 문서(s-google-gemini-cli, s-claude-code)를 통해 확인됩니다. 다만 Gemma 4의 툴 콜링 정확도가 낮아 에이전트로 활용하기 어렵다는 Serio님의 주장은 개인의 사용 경험에 기반한 평가이며, 이를 뒷받침할 객관적인 재현 테스트셋이나 벤치마크 수치는 공식 자료에서 확인되지 않습니다.

특히 Gemma 4의 툴 콜링 능력이 Qwen 2.5(27B)의 정확도(약 85%)보다 낮다는 구체적인 비교 분석은 현재로서는 확인이 필요한 영역입니다. 로컬 모델의 툴 콜링 성능은 환경과 프롬프트에 따라 편차가 크므로, 단순한 체감 성능을 넘어 정량적인 검증이 선행되어야 구글의 추격 가능성을 논할 수 있을 것입니다.

실험 맥락운용 관찰재현 포인트

팩트 체크 & 근거 자료

Google for Developers

Gemini CLI

Gemini CLI가 터미널 안에서 ReAct 루프와 MCP 서버를 사용한다고 설명하는 공식 문서입니다.

공식 문서

Google AI for Developers

Function calling with Gemma 4

Gemma 4의 함수 호출/도구 사용 방식을 설명하는 공식 문서입니다.

공식 문서

Qwen

Function Calling

Qwen3의 function calling 사용과 템플릿을 설명하는 공식 문서입니다.

공식 문서

Anthropic

Claude Code by Anthropic

Claude Code가 코드베이스를 이해하고 파일 수정과 명령 실행을 돕는 agentic coding tool이라고 설명합니다.

공식 문서