coredot.today
블로그로 돌아가기

#환각

6개의 포스트

임베딩은 '아니다'를 못 읽는다 — Jev를 RAG 환각 검문소에 세우다 (한국어 검색 스택 7편)
튜토리얼TypeSafeJev
2026.10.07

임베딩은 '아니다'를 못 읽는다 — Jev를 RAG 환각 검문소에 세우다 (한국어 검색 스택 7편)

임베딩 모델은 '매출이 30% 늘었다'와 '매출이 30% 줄었다'를 거의 같은 문장으로 봅니다. 검색에는 맞는 판단이지만, RAG 답변의 마지막 관문에서는 치명적입니다. 이 글은 6편에 이어 TypeSafe의 Jev를 한국어 검색 파이프라인의 새 자리, 답변 뒤의 '환각 검문소'에 세웁니다. 이 블로그 문단 87개로 참 주장 257개와 숫자·방향·주체를 바꾸거나 없는 사실을 덧붙인 거짓 주장 344개를 만들고, 임베딩 둘·크로스 인코더·NLI 모델·로컬 LLM 둘·Jev에게 같은 601쌍을 판정시켰습니다. 참 주장의 90%를 통과시키는 임계값에서 BGE-M3 코사인은 숫자를 바꾼 거짓의 3%만 잡았고, Jev는 100%를 잡았습니다(AUROC 0.995). 0.3B NLI 모델이 의외의 복병이었고(0.959), 숫자를 1만 바꿔도 잡던 Jev는 문서의 숫자로 계산해야 하는 주장에서 약해졌습니다. 601번 검문에 0.021달러. 인터랙티브 7개와 삽화 8장.

코어닷투데이36분
[특집] AI 때문에 두 번째 뇌를 만들었다 — '이해를 위임하지 마라'의 역사, 과학, 그리고 2026년
특집특집세컨드 브레인
2026.09.26

[특집] AI 때문에 두 번째 뇌를 만들었다 — '이해를 위임하지 마라'의 역사, 과학, 그리고 2026년

AI 회의론자인 한 개발자가 챗봇에게 '2>&1이었나 2&>1이었나'를 묻다가, 존재하지 않는 플래그를 자신 있게 알려 주는 답을 받고 개인 노트 볼트를 만들기로 결심했습니다. 2026년 9월 화제가 된 글 'Clankers Made Me Build a Second Brain'을 출발점으로, 플라톤의 『파이드로스』에서 1945년 메멕스, 9만 장의 카드를 남긴 루만의 제텔카스텐, 2026년 카파시의 LLM 위키까지 '생각을 밖에 적어 두는 2,400년의 역사'를 따라가고, 생성 효과·구글 효과·인지 부채 연구로 '왜 직접 써야 남는가'를 따져 봅니다. 두 번째 뇌가 생산성 연극으로 변하는 순간과, AI와 함께 쓰되 이해만은 넘기지 않는 방법까지 정리했습니다.

코어닷투데이60분
AI는 왜 미해결 수학은 풀면서 환불 처리는 못 맡기나 — RLHF 다음은 무엇인가
특집RLHFRLVR
2026.09.23

AI는 왜 미해결 수학은 풀면서 환불 처리는 못 맡기나 — RLHF 다음은 무엇인가

InstructGPT를 만든 사람이 18분 동안 무대에서 한 이야기는 이것이다. 'AI가 벤치마크를 다 부수는데 왜 고객센터는 아직 사람이 결정하나?' 그의 답은 난이도가 아니라 목표에 있다 — 오늘의 AI는 전부 사람의 선호를 최적화하도록 만들어졌고, 그래서 사람 옆에서는 경이롭지만 사람 없이는 못 미덥다. 이 글은 그 논리를 처음부터 끝까지 따라가고, GPT-4 기술 보고서가 남긴 결정적 증거(후학습이 보정을 10배 망가뜨렸다)를 실측 수치로 다시 그린다. 인터랙티브 위젯 7종과 삽화 12장. 그리고 과장하면 안 되는 지점도 함께 짚는다.

코어닷투데이55분
AI가 실험실에 들어왔다 — 구글 Co-Scientist가 진짜 물질을 만들어낸 과정
기술Co-ScientistGemini
2026.09.01

AI가 실험실에 들어왔다 — 구글 Co-Scientist가 진짜 물질을 만들어낸 과정

AI가 논문을 '쓰는' 시대는 이미 왔다. 그런데 실제로 존재하지 않는 실험 결과를 쓰는 게 문제였다. 구글 딥마인드가 83쪽 논문으로 답한 것 — 화학 증착로를 직접 제어해 새 2D 결정을 만들고, 대장균 군집 모양을 예측하고, 스스로 발견한 의료 에이전트로 프런티어 모델 6종을 이겼다. 그리고 전문가 30명의 450건 리뷰로 '조작 90% → 4%'를 증명했다.

코어닷투데이78분
AI 사서 7명이 협업한다 — Google의 Agentic RAG가 '믿을 수 있는 답'을 만드는 법
특집Agentic RAGGemini Enterprise
2026.06.18

AI 사서 7명이 협업한다 — Google의 Agentic RAG가 '믿을 수 있는 답'을 만드는 법

한 번 검색하고 답하는 RAG는 여러 데이터베이스에 흩어진 질문 앞에서 무너진다. Google이 Gemini Enterprise에 넣은 Agentic RAG는 7명의 전문 에이전트가 '계획 → 검색 → 충분성 검증 → 재검색 → 합성'을 반복해 답을 만든다. 왜 이 구조가 나왔는지 ReAct부터의 역사와 논문, 병원·기업 사례, FRAMES 벤치마크(정확도 34%↑)로 쉽고 자세하게 풀었다.

코어닷투데이40분
RAG 완전 이해: LLM은 왜 거짓말을 하고, 검색은 어떻게 이를 바로잡는가
기술RAGLLM
2026.03.04

RAG 완전 이해: LLM은 왜 거짓말을 하고, 검색은 어떻게 이를 바로잡는가

1000권을 외운 천재가 왜 어제 환율을 틀리는지, 그리고 '답하기 전에 먼저 찾아봐'라는 단순한 아이디어가 어떻게 AI의 가장 중요한 아키텍처 패턴이 되었는지를 논문과 사례로 풀어본다.

코어닷투데이35분