coredot.today
블로그로 돌아가기

#DeepSeek-V4

2개의 포스트

읽기는 병렬로, 추론은 깊게 — 896K 토큰 문서를 4B 모델이 읽어 내는 법, PARSER 논문 특집
특집PARSER롱 컨텍스트
2026.10.07

읽기는 병렬로, 추론은 깊게 — 896K 토큰 문서를 4B 모델이 읽어 내는 법, PARSER 논문 특집

100만 토큰짜리 창을 가진 모델도 긴 문서 앞에서는 정확도가 수십 점씩 떨어집니다. 홍콩중문대 연구진이 2026년 9월에 내놓은 PARSER는 '문서를 읽는 순서는 문서가 정하지만, 질문을 푸는 순서는 질문이 정해야 한다'는 한 문장에서 출발합니다. 문서를 보지 않는 리드 에이전트가 질문을 쪼개 수천 개의 청크 담당 서브에이전트에게 동시에 흩뿌리고, 돌아온 증거로 다음 질문을 다듬습니다. 4B 모델이 896K 토큰에서 순차 메모리 에이전트를 12점 앞서고, 9B 모델이 DeepSeek-V4-Pro를 6.3점 앞섰으며, 지연은 11배 줄었습니다. 이 글은 Transformer의 어텐션 창에서 시작해 'Lost in the Middle'과 Context Rot, MemAgent의 순차 메모리까지 이 논문이 서 있는 자리를 되짚고, 흩뿌리기-모으기 구조와 리드 에이전트만 강화학습하는 설계, 세 가지 통제 실험, 실패 사례와 한계, 그리고 2026년 멀티 에이전트 지형에서의 의미를 사례와 함께 풀어 씁니다. 시뮬레이터·결과 탐색기·접근법 가이드 위젯 3개.

코어닷투데이62분
DeepSeek V4 Pro 특집: 1.6조 파라미터로 100만 토큰을 V3.2의 1/10 비용에 — 오픈소스가 다시 프론티어를 따라잡은 날
인사이트DeepSeek-V4V4 Pro
2026.04.27

DeepSeek V4 Pro 특집: 1.6조 파라미터로 100만 토큰을 V3.2의 1/10 비용에 — 오픈소스가 다시 프론티어를 따라잡은 날

2026년 4월 24일, DeepSeek이 V4 Pro와 V4 Flash를 공개했다. 1.6조 파라미터(49B 활성), 100만 토큰 컨텍스트, 그리고 V3.2 대비 KV 캐시 10%·FLOPs 27%. 단순한 버전업이 아니라 'CSA + HCA 하이브리드 어텐션', 'mHC 잔차 연결의 후속', 'Muon 옵티마이저', 'FP4+FP8 혼합 정밀도', '온-폴리시 디스틸레이션'이라는 다섯 가지 핵심 혁신이 한꺼번에 들어갔다. 왜 이런 설계가 필요했는지, 어디서부터 어떻게 여기까지 왔는지, 그리고 실무에서 어떻게 써야 하는지를 처음부터 풀어본다.

코어닷투데이55분