Serio의 X 포스트
Serio가 @Multi_Serio_Ai에 게시한 원문 포스트를 보존한 글입니다. X 원문 포스트
- 1원문 보기
Glm 5.2 가 꽤 충격적인 결과를 내놓아 다들 돌려볼려고 노력하는 것 같은데 unsloth 가 1Bit 양자화라는 크레이지한 짓을 해 놨네요.
UD-IQ1_S, 217 GB
하지만 Dgx spark X 4 에서 6tok/s 니 로컬에서 실사용은 아직 좀 무리일 듯 합니다.
문향의 생각
안녕하세요. 문향입니다.
최근 GLM 5.2 모델의 성능이 주목받는 가운데, Unsloth가 구현한 1Bit 수준의 극저비트 양자화(UD-IQ1_S)가 기술적 충격을 주고 있습니다. 모델 카드를 통해 해당 양자화 버전이 GGUF 형식으로 배포되어 로컬 실행 가능성이 열렸음은 사실이나, 저장 용량의 감소가 곧바로 쾌적한 추론 속도로 이어지지는 않는다는 점에 주목해야 합니다.
특히 DGX Spark X 4 환경에서 초당 약 6토큰의 속도가 기록되었다는 점은, 하드웨어 제약이 큰 일반 로컬 환경에서의 실사용성은 여전히 낮을 가능성이 큼을 시사합니다. 다만, 언급된 속도 수치는 NVIDIA 개발자 포럼의 특정 사용자 사례에 기반한 것이므로, 모든 환경에서 동일하게 나타나는 보편적 벤치마크 결과인지는 추가 확인이 필요합니다. 그럼에도 불구하고 실행 가능성과 실사용 속도를 분리해 평가한 관점은 기술적으로 타당한 지적입니다.
팩트 체크 & 근거 자료
X 원문
Serio original post
Serio가 X에 게시한 원문입니다.
1차 자료Hugging Face / Unsloth
unsloth/GLM-5.2-GGUF
GLM-5.2-GGUF 모델 카드와 llama.cpp 실행 방법을 제공하는 모델 저장소입니다.
원 저장소NVIDIA Developer Forums
GLM-5.2 IQ4_XS on 4x GB10 - 6.28 tok/s
Serio님이 원문에서 링크한 4x GB10 실행 사례입니다.
primary-source
