coredot.today
블로그로 돌아가기

#Mistral

3개의 포스트

검색은 파이프라인이 아니라 에이전트가 되었다 — Agentic Search 완전 해부 (RAG 특집 1편)
특집RAGAgentic Search
2026.09.20

검색은 파이프라인이 아니라 에이전트가 되었다 — Agentic Search 완전 해부 (RAG 특집 1편)

‘1953년 월별 국방비 지출 합계는?’ 스캔된 재무부 회보 8만 9천 쪽에서 이 질문에 답하는 one-shot RAG의 정답률은 6.3%였다. 같은 모델에 search·open·navigate·read·grep 다섯 도구를 쥐여 주자 51.9%가 됐다. 2026년의 RAG는 더 좋은 임베딩 하나를 고르는 일이 아니라, 질문과 현재 상태를 보고 증거를 찾고 문서 안을 이동하고 충분한지 판단하고 예산 안에서 멈추는 에이전트를 설계하는 일로 바뀌고 있다. 이 특집은 A-RAG·LLM-Wiki·DCI 세 연구와 Mistral의 제품화를 따라가며, 왜 도구가 늘었는데 토큰은 줄었는지, 어느 질의를 어느 경로로 보내야 하는지, 몇 스텝에서 끊어야 하는지를 인터랙티브 위젯 6종으로 직접 만져 본다. RAG 특집 시리즈의 첫 글이다.

코어닷투데이74분
같은 모델인데 성적이 10배 차이 — 코딩 에이전트 하니스 해부 (Zoom·UMass 176개 실험 완전 정리)
특집하니스Harness Engineering
2026.09.20

같은 모델인데 성적이 10배 차이 — 코딩 에이전트 하니스 해부 (Zoom·UMass 176개 실험 완전 정리)

Nemotron-3 550B가 32k 창에서 SWE-Bench Verified 6.4%를 받았다. 모델을 한 글자도 바꾸지 않고 하니스의 맥락 관리만 켜자 58.4%가 됐다. 같은 bash 단독 인터페이스가 550B에게는 +3.6pp에 비용 절반, Mistral에게는 −24pp였다. 2026년 9월 17일 공개된 Zoom·UMass·Emory 연구진의 논문은 코딩 하니스를 계획·행동 공간·맥락 관리 세 부품으로 분해해 4개 모델 × 2개 벤치마크 × 176개 설정에서 부품 하나씩의 효과를 쟀다. 결론은 ‘좋은 하니스’가 아니라 ‘모델·예산·과제에 따라 갈리는 하니스’다. ReAct에서 하니스 엔지니어링까지의 역사, 논문의 네 가지 발견, 그것이 Claude Code·Codex의 오늘과 어떻게 맞물리는지를 인터랙티브 위젯 6종과 삽화로 풀었다.

코어닷투데이72분
성당과 시장의 귀환 — 빅테크는 왜 자기 보물을 공짜로 풀어주는가
특집오픈소스오픈소스 전략
2026.05.23

성당과 시장의 귀환 — 빅테크는 왜 자기 보물을 공짜로 풀어주는가

Bill Gurley의 화제작 'Open Source Strategy'를 한국 독자를 위해 풀어 쓰다. 1983년 스톨먼의 분노부터 2026년 DeepSeek의 폭격까지 — 빅테크가 코드를 공짜로 푸는 진짜 이유, 그리고 AI 시대에 다시 시작된 '성당 대 시장'의 두 번째 시즌.

코어닷투데이45분