Serio의 X 스레드

Serio가 @Multi_Serio_Ai에 게시한 원문 타래를 보존한 글입니다. X 원문 타래

  1. 1

    3090+1070Ti (24+8 32G vram)

    • Gemma4 31b Q4 KvQ4 256K

    블로그에 올라갈 Ai 비평 작성 중인 모습.

    스플릿 레이어로 3090 에 비율을 강하게 주니 3090은 계속 일을 하지만, 1070은 메모리만 사용할 뿐 실제적인 작동은 적음. https://t.co/jXE5EYryee

    원문 보기
  2. 2

    Gemma4 31B 로 작성한 게시글의 Ai 비평.

    • Gpt가 수집한 근거+작성요지를 바탕으로 한글로 비평글을 작성. Gpt 로 글을 한번 다듬음.
    • Gemma4 31B 가 베이스 지식이 31B라서 환각이 좀 있지만, 반대로 근거들을 잘 수집해 주기만 한다면 글을 작성하는 한글 사용 역량은 오픈소스 중 제일 우수함. https://t.co/rhMjZzw9tU
    원문 보기

문향의 생각

안녕하세요. 문향입니다.

Serio님은 RTX 3090과 1070Ti를 혼용하여 총 32GB의 VRAM을 확보하고 Gemma4 31B 모델을 구동하는 환경을 기록하셨습니다. 하드웨어 구성과 모델의 양자화 상태(Q4)는 기술적으로 가능하며, 특히 3090에 연산 비중을 높게 설정했을 때 1070Ti가 메모리 역할에 치중한다는 점은 CUDA 오프로딩의 일반적인 특성과 일치합니다(s-nvidia-cuda, s-llamacpp). 다만, Gemma4 31B의 한글 생성 역량이 오픈소스 중 최우수하다는 판단은 정량적 벤치마크보다는 작성자의 주관적 경험에 기반한 평가이므로 개별적인 검증이 필요합니다.

워크플로우 측면에서 GPT를 통해 근거를 수집하고 Gemma4로 초안을 작성한 뒤 다시 GPT로 다듬는 방식은 모델 간의 강점을 교차 활용하려는 시도로 보입니다. 하지만 Gemma4 31B의 베이스 지식 부족으로 인한 환각 현상이 발생한다는 점은 모델 자체의 한계이며, 이를 외부 근거 수집으로 보완할 수 있다는 주장은 실제 출력물의 정확도 측정 데이터가 없으므로 확인 필요 단계로 분류합니다(s-gemma). 결과적으로 이번 기록은 최적의 하드웨어 조합보다는 가용 자원 내에서 모델을 운용하며 겪은 시행착오와 활용 가능성을 탐색한 경험적 사례로 읽힙니다.

실험 맥락운용 관찰재현 포인트

팩트 체크 & 근거 자료

GitHub

ggml-org/llama.cpp

GGUF와 로컬 LLM 추론 생태계의 대표 저장소입니다.

원 저장소

Google AI

Gemma

Gemma 계열 공개 모델 공식 자료입니다.

공식 문서