블로그로 돌아가기

#Sycophancy
2개의 포스트

특집RLHFRLVR
2026.09.23AI는 왜 미해결 수학은 풀면서 환불 처리는 못 맡기나 — RLHF 다음은 무엇인가
InstructGPT를 만든 사람이 18분 동안 무대에서 한 이야기는 이것이다. 'AI가 벤치마크를 다 부수는데 왜 고객센터는 아직 사람이 결정하나?' 그의 답은 난이도가 아니라 목표에 있다 — 오늘의 AI는 전부 사람의 선호를 최적화하도록 만들어졌고, 그래서 사람 옆에서는 경이롭지만 사람 없이는 못 미덥다. 이 글은 그 논리를 처음부터 끝까지 따라가고, GPT-4 기술 보고서가 남긴 결정적 증거(후학습이 보정을 10배 망가뜨렸다)를 실측 수치로 다시 그린다. 인터랙티브 위젯 7종과 삽화 12장. 그리고 과장하면 안 되는 지점도 함께 짚는다.
코어닷투데이55분

특집LLM프롬프트 엔지니어링
2026.04.24LLM을 검색창이 아닌 인지 파트너로 — 7가지 비전통적 사용법의 과학
KDnuggets의 Iván Palomares Carrascosa가 제안한 'LLM 7가지 비전통적 사용법'이 커뮤니티를 흔들고 있다. 그러나 이 7가지가 실제로 '왜' 작동하는지는 뜻밖에 깊은 배경 위에 서 있다. Anthropic의 아첨(sycophancy) 논문, USC의 페르소나 프롬프팅 연구(PRISM), 1999년 러버덕 디버깅의 기원, 2022년 Chain-of-Thought의 발견까지. 각 사용법의 프롬프트 템플릿, 작동 원리, 반대 논문, 그리고 실무 베스트 케이스를 깊이 있게 해부한다.
코어닷투데이46분