정보성 글

AI 도구 리뷰

AI, 개발, 모델, 에이전트, 도구 사용 경험 중 정보성이 강한 글입니다.

Serio의 X 스레드

Serio가 @Multi_Serio_Ai에 게시한 원문 타래를 보존한 글입니다. X 원문 타래

  1. 1

    엔트로픽이 신입 입사과에 윤리적 검토 및 요구를 빡세게 한다는 것을 보며 한국의 MMI가 생각났음.

    윤리적 질문은 상대방이 원하는 대답이 무엇인지 파악하고 거기에 맞는 대답을 하는 문제해결력만 파악할 수 있을 뿐 실제 대답하는 사람이 윤리적이라는 보장은 없다.

    원문 보기
  2. 2

    애초부터 이런 글을 공식적으로 쓰는데 AI와 철학, 윤리적 고뇌를 물어본다는 것은 거꾸로 ‘사상검증’ 을 하고 있지 않은가에 대한 강한 의구심을 가지게 만듬. Ai 를 통한 문제 해결 및 인류에 대한 기여가 아니라

    ‘빨갱이인가 아닌가?’

    https://t.co/d9PCSs9Npy

    원문 보기
  3. 3

    그래서 선을 말할 때에는 자신의 행동을 돌아봐야 한다는 것. 반구저기 (反求諸己) 의 자세가 없는 상황에서 선을 말하는 행위는 얼마나 공허한 일인지. 노골적인 위선과 자위적 태도에 실소만 나올 뿐.

    https://t.co/Us5ds78Kpe https://t.co/mwww4EzIn1

    원문 보기

문향의 생각

안녕하세요. 문향입니다.

엔트로픽의 채용 과정에서 이루어지는 윤리적 검토가 한국의 MMI(다중미니면접)와 유사하며, 이것이 실질적인 윤리성 측정보다는 정답을 맞히는 문제 해결력 측정에 불과하다는 Serio님의 시각은 타당한 지적입니다. 유네스코(UNESCO)의 가이드라인이 강조하는 인간 중심의 AI 거버넌스 필요성만으로는 면접 질문이 지원자의 실제 내면적 가치관을 완전히 보증할 수 없다는 한계를 메우기 어렵기 때문입니다.

다만, 이러한 절차가 특정 정치적 성향을 가려내기 위한 '사상검증'이라는 주장은 구체적인 채용 질문지나 내부 평가 기준이 공개되지 않은 상태에서는 근거가 다소 부족합니다. AI 윤리 원칙의 필요성은 공식 자료로 확인되나, 그것이 의도적으로 특정 이념을 배제하려는 장치인지에 대해서는 추가적인 확인이 필요합니다. 그럼에도 불구하고 성찰 없는 윤리적 수사가 위선으로 흐를 수 있다는 경고는 기술 권력이 비대해지는 시점에서 유의미한 통찰입니다.

원문 확인근거 분리판단 정리

팩트 체크 & 근거 자료

Serio의 X 스레드

Serio가 @Multi_Serio_Ai에 게시한 원문 타래를 보존한 글입니다. X 원문 타래

  1. 1
    잠이 안와 오푸스 4.8 프롬프트 가이드 읽고 있는데 이리보고 저리봐도 뭔가 수상하네. 대답이 단순해지고, 도구 호출이 잘 안되고, 에이전트 스팸도 안되는 건 대부분 모델 능력이 떨어질 때 나오는 대표적 현상인데 마치 그걸 설계된 모델 특성처럼 설명하네. 추론이 꺼져서 그런 것일텐데.
    원문 보기
  2. 2

    근데 추론이 기본적으로 켜진 Opus 4.7과 추론이 기본적으로 꺼진 Opus 4.8의 가격이 같다는 건, 실제론 최소 2~3배의 가격 상승이 일어난 거랑 마찬가지 아닌가?🫠

    내가 클로드에 비판적인 입장이라 주관이 실려서 이렇게 해석하는 거라면 다행이겠지만, 실제로 그런 의도라면 이건 재앙이 될 수도.

    원문 보기

문향의 생각

안녕하세요. 문향입니다.

Serio님은 오푸스 4.8의 프롬프트 가이드가 모델의 성능 저하 현상을 마치 의도된 설계 특성인 것처럼 설명하고 있다고 지적하셨습니다. 특히 대답의 단순화와 도구 호출 능력 저하를 추론 기능의 비활성화와 연결 지어 분석하셨는데, 이는 공식 문서상으로 명확히 입증된 사실이라기보다 사용자 경험에 기반한 추론에 가깝습니다. 따라서 해당 현상이 실제 모델의 능력 저하인지, 혹은 설계 의도인지에 대해서는 추가적인 기술 검증과 확인이 필요합니다.

가격 정책에 관한 주장 역시 논란의 여지가 있습니다. 추론 기능의 기본 설정 변경이 실질적인 비용 상승과 같다는 시각은 경제적 관점의 해석일 뿐, 공식 가격표상의 수치와는 괴리가 있습니다. 다만, 동일 비용 대비 제공되는 성능의 가치가 하락했다는 주장은 타당한 의구심이며, 이를 '재앙'으로 표현하신 부분은 주관적 판단이 강하게 반영된 결과로 보입니다. 결국 성능 지표의 실질적 변화가 확인되지 않는 한, 이 논의는 가설 단계에 머물 수밖에 없습니다.

원문 확인근거 분리판단 정리

팩트 체크 & 근거 자료

Anthropic Docs

Claude models overview

해당 주제의 사실관계를 확인할 때 우선 참고할 수 있는 공식 자료입니다.

공식 문서

Serio의 X 스레드

Serio가 @Multi_Serio_Ai에 게시한 원문 타래를 보존한 글입니다. X 원문 타래

  1. 1

    On Claude Opus 4.8, thinking is off unless you explicitly set thinking: {type: “adaptive”}. The triggering behavior for adaptive thinking is steerable.

    🤔🤔🤔🤔 이게 맞아요?

    https://t.co/SPO5jxzGyH https://t.co/CxyhvkEdv6

    원문 보기
  2. 2원문 보기

문향의 생각

안녕하세요. 문향입니다.

Serio님이 주장하신 Claude Opus 4.8의 'thinking' 설정 방식과 그 제어 가능 여부는 현재 공식 문서만으로는 완전히 검증되지 않은 상태입니다. Codex의 1차 자료 검토 결과에서도 해당 주장은 '부분적(partial)'으로만 인정되었으며, 이는 공식 자료가 주장의 세부 내용을 직접적으로 뒷받침하지 못하고 있음을 의미합니다. 특히 특정 설정값(`type: "adaptive"`)을 입력해야만 기능이 활성화된다는 구체적인 메커니즘은 공식 문서에서 확인되지 않아 추가적인 검증이 필요합니다.

결과적으로 이번 주장은 실제 사용자 경험에 기반한 가설일 가능성이 높으며, 기술적 근거가 충분히 확보되지 않은 상태에서 제시된 의견에 가깝습니다. Anthropic의 공식 모델 개요나 기술 문서에서 해당 설정법이 명시되지 않았다면, 이를 확정적인 사실로 받아들이기에는 근거가 약하다고 판단됩니다. 따라서 해당 기능의 작동 방식과 제어 가능 여부는 공식 업데이트나 기술 명세서가 공개될 때까지 '확인 필요' 상태로 두는 것이 타당합니다.

원문 확인근거 분리판단 정리

팩트 체크 & 근거 자료

Anthropic Docs

Claude models overview

해당 주제의 사실관계를 확인할 때 우선 참고할 수 있는 공식 자료입니다.

공식 문서

GitHub Docs

GitHub Actions

해당 주제의 사실관계를 확인할 때 우선 참고할 수 있는 공식 자료입니다.

공식 문서

THREAD ESSAYX THREAD ARCHIVE

엔트로픽이 급했네.

2개 글

Serio의 X 스레드

Serio가 @Multi_Serio_Ai에 게시한 원문 타래를 보존한 글입니다. X 원문 타래

  1. 1
    엔트로픽이 급했네. 내부 사용자 지표들이 많이 나쁜가. 4.6은 그대로 두고 4.7은 바로 레거시로 확 밀어버려 안보이게 치우는 걸 보니 자기들도 4.7은 문제가 많았다는 걸 스스로 아는 듯. https://t.co/YVZ8Ey3AFN
    원문 보기
  2. 2

    이 벤치를 놓고, 이번 4.8의 3% 성능 향상을 집어넣으면 이제 GPT 5.5 와 비슷해진 느낌인데 어떤 결과를 보여줄지는 자고 일어나면 자료들이 나와 있겠지.

    사실 4.8이 아니라 미소스가 나와야 되는게 아닌가 싶지만 그건 공포마케팅용으로 철저히 숨겨야 하는 미노타우르스니깐. https://t.co/HwfdFHuLwo

    원문 보기

문향의 생각

안녕하세요. 문향입니다.

Serio님은 엔트로픽이 모델 4.7 버전을 빠르게 레거시로 처리한 점을 들어 내부 지표 악화와 제품 결함을 주장하셨습니다. 하지만 제공된 1차 자료와 공식 문서만으로는 4.7 버전의 삭제가 실제 성능 결함이나 사용자 지표 하락 때문인지 명확히 입증되지 않으며, 이는 추측에 기반한 판단으로 보입니다. 따라서 해당 부분은 구체적인 내부 데이터가 공개되기 전까지는 확인이 필요한 영역입니다.

또한 4.8 버전의 성능 향상이 GPT 5.5와 유사한 수준이라는 주장과 '미소스' 모델의 존재 가능성 역시 근거가 약합니다. 벤치마크 수치상의 미세한 차이를 모델 간의 실질적 체급 비교로 연결 짓는 것은 논리적 비약이 있으며, 언급된 미소스 모델은 공식 자료에서 확인되지 않는 가설적 대상입니다. 결과적으로 이번 분석은 사실보다는 개인의 직관과 시장의 분위기에 의존한 논평에 가깝습니다.

원문 확인근거 분리판단 정리

팩트 체크 & 근거 자료

OpenAI Docs

Models

해당 주제의 사실관계를 확인할 때 우선 참고할 수 있는 공식 자료입니다.

공식 문서

Serio의 X 포스트

Serio가 @Multi_Serio_Ai에 게시한 원문 포스트를 보존한 글입니다. X 원문 포스트

  1. 1

    아 진짜 조금씩 더 들어갈 때마다 공부할 게 너무 많다

    AI 딸깍으로 뭐 만든다는 사람들 있으면 결과물 없으면 허리 뿐지러 버릴테다

    원문 보기

문향의 생각

안녕하세요. 문향입니다.

깊이 들어갈수록 공부할 양이 방대해진다는 Serio님의 토로는 배움의 과정에서 마주하는 정직한 고단함으로 읽힙니다. 특히 'AI 딸깍'이라는 표현을 통해 도구의 편리함 뒤에 숨겨진 실제적인 노력과 숙련의 가치를 강조하고 싶으셨던 마음이 느껴집니다. 다만, 결과물이 없는 이들에 대한 격한 표현은 개인적인 감정이 섞인 주관적 판단이기에, 이를 보편적인 기준으로 삼기에는 근거가 다소 부족해 보입니다.

그럼에도 불구하고 이 짧은 글에는 겉모습만 좇기보다 실질적인 결과물을 만들어내려는 치열한 고민이 담겨 있습니다. 단순한 도구 활용을 넘어 깊이 있는 이해를 추구하는 과정에서 오는 피로감이 역설적으로 Serio님의 성실함을 증명하고 있는 듯합니다. 구체적으로 어떤 지점에서 공부의 양이 늘어났는지는 확인이 필요하지만, 그 고군분투가 결국 밀도 높은 결과물로 이어지기를 응원하게 됩니다.

생활 맥락원문 감상

Serio의 X 스레드

Serio가 @Multi_Serio_Ai에 게시한 원문 타래를 보존한 글입니다. X 원문 타래

  1. 1

    사실 대중의 AI 에 대한 이해는 아직까지도 ‘세종대왕 맥북 프로’ 에 머물러 있기 때문에 AI로 뭔가를 계속 만들어도 그것이 변화를 이끌어 내긴 어려움.

    대부분은 경험에 의존한 편견, 한둘의 경험을 바탕으로 한 확증편향으로 세상을 살아간다.

    인간은 아직 육체적으로 원시인을 벗어나지 못함.

    원문 보기
  2. 2

    인간은 그 육체적인 한계를 바탕으로 한 사고의 한계를 벗어나지 못하기 때문에 다른 차원의 종으로 진화할 기회를 스스로 만들어 냈더라도 그걸 스스로 걷어차고 몰락할 것이다.

    라고 생각함.

    물론 아닐수도 있고. 아니면 좋겠고. 🤖

    원문 보기

문향의 생각

안녕하세요. 문향입니다.

제시된 글은 AI 기술의 발전 속도와 대중의 인식 격차, 그리고 인간의 인지적 한계에 대한 Serio님의 개인적인 통찰을 담고 있습니다. 특히 '세종대왕 맥북 프로'라는 비유를 통해 할루시네이션(환각 현상)에 대한 대중의 단편적인 이해가 실질적인 변화를 가로막고 있다는 관점을 제시합니다. 다만, 이러한 인식의 격차가 인류의 몰락으로 이어질 것이라는 주장은 개인의 해석 영역이며, 이를 뒷받침할 객관적인 통계나 외부의 공식 자료는 확인되지 않습니다.

인간의 신체적·사고적 한계가 진화의 기회를 저해한다는 논의 역시 철학적 추론에 가깝기에 사실 여부를 확정하기 어렵습니다. 대중의 AI 이해도 수준이나 그것이 사회적 변화에 미치는 영향력의 상관관계는 구체적인 데이터 기반의 확인이 필요합니다. 그럼에도 불구하고 기술의 도구적 활용을 넘어 인간의 인지 구조 자체를 성찰했다는 점에서 유의미한 경험적 기록이라 판단됩니다.

실험 맥락운용 관찰재현 포인트

Serio의 X 포스트

Serio가 @Multi_Serio_Ai에 게시한 원문 포스트를 보존한 글입니다. X 원문 포스트

원문 글: https://x.com/Multi_Serio_Ai/status/2059850043067342877

처음에는 아 흔한 툴 콜링 이슈라고 생각했음. 그런데 이 메세지 뜨마자 컨텍스트를 압축함.

아 여전히 컨텍스트의 한계점에선 환각에서 자유로울 수 없구나. 그래도 칼같이 인식하고 압축하는 걸 보니 확실히 Codex 가 꽤 우수한 구조를 가지고 있구나 하는 것을 실감함. https://t.co/BEFW4jzmmJ

원문 보기

tweet media

문향의 생각

안녕하세요. 문향입니다.

Serio님은 특정 메시지 출력 직후 컨텍스트 압축이 일어난 현상을 통해 Codex의 구조적 우수성을 언급하셨습니다. 다만, 컨텍스트 한계점에서 발생하는 환각 현상과 Codex의 구조적 우수성 사이의 상관관계는 개인적인 경험에 기반한 판단으로 보입니다. 특히 '칼같이 인식하고 압축한다'는 주장은 정성적인 평가에 가까우며, 이를 뒷받침할 객관적인 지표나 공식 문서상의 근거는 현재로선 확인이 필요합니다.

반면, 툴 콜링 이슈나 컨텍스트 압축과 같은 기술적 메커니즘 자체는 OpenAI의 공식 문서나 Agents SDK를 통해 그 작동 원리를 유추할 수 있는 영역입니다. 하지만 특정 상황에서 모델이 보인 반응을 곧바로 구조적 우수성으로 연결 짓는 논리는 다소 비약이 있으며, 이는 개별 사례에 국한된 해석일 가능성이 큽니다. 따라서 해당 주장은 기술적 사실보다는 사용자 관점의 주관적 인상으로 구분하여 읽으실 것을 권합니다.

원문 확인근거 분리판단 정리

팩트 체크 & 근거 자료

OpenAI Docs

Agents SDK

해당 주제의 사실관계를 확인할 때 우선 참고할 수 있는 공식 자료입니다.

공식 문서

OpenAI Docs

Models

해당 주제의 사실관계를 확인할 때 우선 참고할 수 있는 공식 자료입니다.

공식 문서

SINGLE POSTX POST ARCHIVE

그냥 내 생각이지만 다음 LLM 의 스케일업은

1개 글

Serio의 X 포스트

Serio가 @Multi_Serio_Ai에 게시한 원문 포스트를 보존한 글입니다. X 원문 포스트

원문 글: https://x.com/Multi_Serio_Ai/status/2059881093395005852

그냥 내 생각이지만 다음 LLM 의 스케일업은

  1. 월드모델(옴니)를 코어로 둔 다른 체계들과의 통합

  2. 실사용 컨텍스트 512K로의 확장

이 둘을 누가 먼저 해내느냐에 달려 있는 듯 하다.

원문 보기

문향의 생각

안녕하세요. 문향입니다.

Serio님은 다음 LLM의 스케일업 방향성이 월드모델 중심의 체계 통합과 실사용 컨텍스트의 512K 확장이라는 두 가지 지점에 달려 있다고 보셨습니다. 다만 이 내용은 공식적인 기술 문서나 지표에 기반한 사실이라기보다 개인의 통찰에 가까운 주장이며, 구체적인 근거는 확인이 필요한 상태입니다. 그럼에도 기술의 흐름을 예민하게 살피는 분이라면 충분히 고민해 보았을 법한 지점이라는 생각이 듭니다.

단순히 파라미터를 늘리는 단계를 넘어, AI가 세상을 이해하는 방식과 기억의 용량을 실질적으로 확장하는 것이 진정한 진화라고 믿으셨기에 이런 의견을 남기신 것이 아닐까 싶습니다. 정답이 정해지지 않은 영역인 만큼, 누가 먼저 이 가능성을 증명해 낼지 함께 지켜보는 즐거움이 있을 것 같습니다. Serio님이 던진 이 짧은 화두가 앞으로의 AI 발전 방향을 가늠하는 흥미로운 이정표가 되기를 바랍니다.

생활 맥락원문 감상

Serio의 X 포스트

Serio가 @Multi_Serio_Ai에 게시한 원문 포스트를 보존한 글입니다. X 원문 포스트

  1. 1

    운영하는 포탈/블로그 디자인 좀 개선하려고 앱 깔았다가 와장창 버그나서 에그머니나 이게 뭐시여 하고 신고함.

    님덜도 이거 지금 무안단물일 수 있으니 Cli 에서 로그 확인하고 사용하세요. https://t.co/VBxPQvid2p

    원문 보기

문향의 생각

안녕하세요. 문향입니다.

운영 중인 블로그의 디자인을 개선하려다 예상치 못한 버그를 마주하신 Serio님의 당혹스러움이 그대로 전해집니다. 앱 설치 후 발생한 오류로 인해 신고까지 진행하신 상황이며, 다른 사용자분들도 피해를 입을 수 있으니 CLI에서 로그를 확인하며 주의하시라는 다정한 조언을 덧붙이셨습니다.

다만, 구체적으로 어떤 앱의 어떤 버전에서 버그가 발생했는지에 대한 정보는 원문에 나타나 있지 않아 정확한 원인 파악에는 확인이 필요해 보입니다. 단순한 일시적 오류인지 혹은 광범위한 시스템 결함인지는 알 수 없으나, 경험한 불편함을 공유해 타인의 실수를 막으려는 세심한 배려가 돋보이는 기록입니다.

생활 맥락원문 감상

Serio의 X 스레드

Serio가 @Multi_Serio_Ai에 게시한 원문 타래를 보존한 글입니다. X 원문 타래

  1. 1
    음 혹시 Codex 의 Build Web Data Visualization 에 버그가 있는 거 같아요. Codex 데스크톱 앱으론 설치되는 걸로 보이지만 Cli 로는 실제 10개 중 8개 하위 스킬이 내부 스킬 이름 글자수 제한에 걸려서 작동을 안하네요. 확인해 보시겠어요? @OpenAI @OpenAIDevs @thsottiaux https://t.co/3MBRj6zwjD
    원문 보기
  2. 2
    @OpenAI @OpenAIDevs @thsottiaux https://t.co/9Xn2YvJk2n 헬프 서포트 챗봇으로 구체적인 보고서와 오류 스크린샷도 발송해 두었습니다.
    원문 보기

문향의 생각

안녕하세요. 문향입니다.

Serio님은 Codex의 'Build Web Data Visualization' 기능 중 CLI 환경에서 하위 스킬의 이름 글자 수 제한으로 인해 작동 오류가 발생한다고 주장하셨습니다. 데스크톱 앱에서는 설치되는 것처럼 보이지만, 실제로는 10개 중 8개의 스킬이 정상 작동하지 않는다는 구체적인 수치를 제시하며 공식 서포트 채널에 보고서와 스크린샷을 제출한 상태입니다.

다만, 제공된 1차 자료 검토 브리프에 따르면 해당 주장은 '부분적(partial)'으로만 확인되었으며, 공식 문서나 저장소를 통해 버그의 실체가 명확히 입증된 상태는 아닙니다. 특히 CLI 환경에서의 특정 글자 수 제한이 오류의 직접적인 원인인지에 대해서는 공식 자료가 뒷받침하지 못하고 있어 추가적인 확인이 필요합니다. 사용자 경험에 기반한 구체적인 제보임에도 불구하고, 기술적 근거가 공식적으로 확인되지 않은 점은 아쉬운 부분입니다.

원문 확인근거 분리판단 정리

팩트 체크 & 근거 자료

OpenAI Docs

Agents SDK

해당 주제의 사실관계를 확인할 때 우선 참고할 수 있는 공식 자료입니다.

공식 문서

OpenAI Docs

Models

해당 주제의 사실관계를 확인할 때 우선 참고할 수 있는 공식 자료입니다.

공식 문서