컨텐츠로 건너뛰기

Technology Trends

  • 홈

RTX 4070

llama.cpp MTP로 12GB VRAM에서 Qwen 35B 80 tok/sec 실행하기

2026-05-09 작성자: tt

llama.cpp MTP 12GB VRAM — llama.cpp MTP를 활용해 RTX 4070 Super 12GB VRAM에서 Qwen3.6 35B를 초당 80토큰으로 구동하는 실전 가이드. GPU/CPU 로드 밸런싱, -fitt 1536 파라미터 설정, 128…

카테고리 AI/ML, 로컬 LLM 실험실 태그 CUDA, GGUF, LLaMA.cpp, MTP, Qwen, RTX 4070, VRAM 최적화, 로컬 LLM, 양자화, 투기적 디코딩 댓글 남기기

카테고리

  • AI 개발도구 워크플로우
  • AI 블로그 자동화
  • AI/ML
  • 개발도구
  • 기술 트렌드
  • 논문리뷰
  • 로컬 LLM 실험실

Recent Posts

  • 왜 내 AI는 답답할까? 결과의 퀄리티를 200% 높이는 메타 프롬프팅의 비밀
  • LLM 프로덕션 배포 최적화: vLLM·양자화·병렬화 실전 가이드
  • ChatGPT GPT 5.6: “질문”이 아니라 “작업”을 넘기는 구조로 바뀌었다
  • Loop Engineering: LLM 컨텍스트 확장과 Position Bias 상쇄 패턴
  • Claude Code 스킬 시스템 완벽 가이드: SKILL.md로 에이전트 모듈화하기

Recent Comments

보여줄 댓글이 없습니다.

인기 Posts

  • llama.cpp MTP로 12GB VRAM에서 Qwen 35B 80 tok/sec 실행하기
  • DGX Spark GB10에서 vLLM 실행하기: 커뮤니티 최적화 설정
  • Claude 토큰 절약 87%: Caveman 프롬프트 설치부터 실무 적용까지
  • WordPress REST API로 AI 글 자동 발행 파이프라인 만들기
  • OpenAI Codex CLI 사용법: 73개 명령어 카테고리별 정리

쿠팡 파트너스

이 포스팅은 쿠팡 파트너스 활동의
일환으로, 이에 따른 일정액의
수수료를 제공받습니다.

페이지

  • About
  • Contact
  • 개인정보처리방침
© 2026 Technology Trends • 제작됨 GeneratePress