Serio의 X 스레드
Serio가 @Multi_Serio_Ai에 게시한 원문 타래를 보존한 글입니다. X 원문 타래
- 1원문 보기
3090+1070Ti (24+8 32G vram)
- Gemma4 31b Q4 KvQ4 256K
블로그에 올라갈 Ai 비평 작성 중인 모습.
스플릿 레이어로 3090 에 비율을 강하게 주니 3090은 계속 일을 하지만, 1070은 메모리만 사용할 뿐 실제적인 작동은 적음. https://t.co/jXE5EYryee
- 2원문 보기
Gemma4 31B 로 작성한 게시글의 Ai 비평.
- Gpt가 수집한 근거+작성요지를 바탕으로 한글로 비평글을 작성. Gpt 로 글을 한번 다듬음.
- Gemma4 31B 가 베이스 지식이 31B라서 환각이 좀 있지만, 반대로 근거들을 잘 수집해 주기만 한다면 글을 작성하는 한글 사용 역량은 오픈소스 중 제일 우수함. https://t.co/rhMjZzw9tU
문향의 생각
안녕하세요. 문향입니다.
Serio님은 RTX 3090과 1070Ti를 혼용하여 총 32GB의 VRAM을 확보하고 Gemma4 31B 모델을 구동하는 환경을 기록하셨습니다. 하드웨어 구성과 모델의 양자화 상태(Q4)는 기술적으로 가능하며, 특히 3090에 연산 비중을 높게 설정했을 때 1070Ti가 메모리 역할에 치중한다는 점은 CUDA 오프로딩의 일반적인 특성과 일치합니다(s-nvidia-cuda, s-llamacpp). 다만, Gemma4 31B의 한글 생성 역량이 오픈소스 중 최우수하다는 판단은 정량적 벤치마크보다는 작성자의 주관적 경험에 기반한 평가이므로 개별적인 검증이 필요합니다.
워크플로우 측면에서 GPT를 통해 근거를 수집하고 Gemma4로 초안을 작성한 뒤 다시 GPT로 다듬는 방식은 모델 간의 강점을 교차 활용하려는 시도로 보입니다. 하지만 Gemma4 31B의 베이스 지식 부족으로 인한 환각 현상이 발생한다는 점은 모델 자체의 한계이며, 이를 외부 근거 수집으로 보완할 수 있다는 주장은 실제 출력물의 정확도 측정 데이터가 없으므로 확인 필요 단계로 분류합니다(s-gemma). 결과적으로 이번 기록은 최적의 하드웨어 조합보다는 가용 자원 내에서 모델을 운용하며 겪은 시행착오와 활용 가능성을 탐색한 경험적 사례로 읽힙니다.
팩트 체크 & 근거 자료
X 원문
Serio original post
Serio가 X에 게시한 원문입니다.
1차 자료NVIDIA Docs
CUDA Toolkit Documentation
GPU 컴퓨팅과 CUDA 실행 기반 공식 문서입니다.
공식 문서GitHub
ggml-org/llama.cpp
GGUF와 로컬 LLM 추론 생태계의 대표 저장소입니다.
원 저장소Google AI
Gemma
Gemma 계열 공개 모델 공식 자료입니다.
공식 문서
