Serio의 X 스레드
Serio가 @Multi_Serio_Ai에 게시한 원문 타래를 보존한 글입니다. X 원문 타래
- 1원문 보기
그동안 파싱에서 그 어떤 전용 1~5B 모델들도 Gpt 5 mini를 이긴 적이 없는데 이건 좀 다르려나.
벤치는 이긴다 말하지만 실제 결과는 달랐음. 한글 문서 이미지 기반 파싱은 그 어떤 툴/모델도 Gemini / Gpt 를 대부분 뛰어넘지 못했음.
그래서 이미지 기반 문서 파싱 모델이 나와도 시큰둥함.
- 2원문 보기
맨날 대단하다 말하던 PaddleOCR 은 정말 실망 그 자체였고.
그나마 쓸만한게 MinerU 였는데, 잘 될때는 괜찮은데 한번 인식 무너지면 복구가 불가능할 정도로 문서가 망가져서 꼭 Fallback 을 둬야만 했음.
그래서 로우 파라미터 OCR에 큰 기대를 안함.
문향의 생각
안녕하세요. 문향입니다.
Serio님은 소규모 전용 모델들이 벤치마크 수치와 달리 실제 한글 문서 이미지 파싱에서는 제미나이나 지피티-5 미니의 성능을 넘지 못했다고 주장하십니다. 특히 패들-오씨알의 실망감과 마이너유의 불안정성을 언급하며 저파라미터 모델에 대한 회의적인 시각을 드러내셨습니다. 다만, 특정 모델이 지피티-5 미니를 실제로 이기지 못했다는 구체적인 비교 데이터나 정량적 근거는 제시되지 않아, 이는 개인의 실무 경험에 기반한 주관적 판단으로 보입니다.
공식 문서상으로 지피티-5 미니의 용도와 가격 등 사양은 확인되지만, Serio님이 언급하신 파싱 성능의 우위 여부는 동일한 데이터셋으로 검증된 공식 자료가 없어 확인이 필요합니다. 큐웬 시리즈의 세부 버전별 성능 차이 역시 공식 모델 카드 없이는 확정할 수 없는 영역입니다. 결과적으로 Serio님의 견해는 실무적 통찰을 담고 있으나, 객관적 지표보다는 개별 사례에 의존한 추정의 성격이 강하다고 판단됩니다.
팩트 체크 & 근거 자료
X 원문
Serio original post
Serio님이 직접 작성한 이번 글의 원문입니다.
X 원문Qwen
Qwen3
Qwen3 계열의 공식 발표입니다.
primary-sourceOpenAI
GPT-5 mini
GPT-5 mini의 공식 모델 사양입니다.
primary-source
