
이미지: METAL
요약
- 레딧 이용자가 DeepSeek-V4-Flash-0731을 로컬 환경에서 구동하며 100K+ 토큰 컨텍스트에서 생성이 멈추는 현상을 보고했다
- OpenCode에서 'resume' 명령을 입력하면 정상적으로 작업을 이어간다고 밝혔다
- 원인이 모델 자체인지, 추론 엔진이나 OpenCode 쪽 문제인지는 확인되지 않았다
- 대상 모델
- DeepSeek-V4-Flash-0731
- 실행 환경
- Unsloth Studio Q8_K_XL GGUF + OpenCode
- 증상
- 약 100K 토큰 이상 컨텍스트에서 생성 중단
- 임시 대응
- 'resume' 명령 입력 시 정상 재개
- 보고 출처
- r/LocalLLaMA 커뮤니티 게시글
긴 작업 중 갑자기 멈춘다는 보고
한 레딧 이용자가 r/LocalLLaMA에 DeepSeek-V4-Flash-0731을 로컬에서 구동하다 겪은 현상을 공유했다. Unsloth Studio에서 배포한 Q8_K_XL GGUF 버전을 OpenCode와 연동해 장시간 에이전틱 코딩 작업을 진행하던 중, 컨텍스트가 약 10만 토큰을 넘어서면 모델이 작업 도중 별다른 오류 메시지 없이 생성을 멈추는 현상이 발생했다고 밝혔다.
작성자는 이 현상이 매번 일어나지는 않지만 반복적으로 관찰됐다고 전했다. 패턴은 "컨텍스트 10만 토큰 이상 도달 → 생성 중단 → resume 입력 → 정상 작업 재개 → 다시 컨텍스트 증가 → 재중단"의 순서로 나타난다고 설명했다.
원인은 아직 불명확
작성자는 "resume 명령을 입력하면 즉시 정상 작동하기 때문에 모델이 완전히 멈추거나 크래시한 것 같지는 않다"고 밝혔다. 다만 이 문제가 모델 자체, llama.cpp 등 추론 엔진, 컨텍스트 처리 방식, 프롬프트 캐싱, 툴 호출, 혹은 OpenCode 자체 중 어디에서 비롯된 것인지는 특정하지 못했다고 전했다. 서버에서 tmux 세션을 통해 OpenCode를 직접 실행하는 구성이라는 점도 함께 언급했다.
이 사례는 아직 커뮤니티 차원의 개별 보고에 그치며, 딥시크(DeepSeek)나 Unsloth 측의 공식 확인은 없는 것으로 알려졌다. 동일 증상을 겪은 다른 이용자가 있는지는 추가 확인이 필요하다.





댓글