coredot.today
블로그로 돌아가기

#Constitutional AI

4개의 포스트

“달 착륙을 6살에게 설명해 줘” — 되묻기만 하던 AI는 어떻게 말귀를 알아듣게 됐나 (RLHF 특집)
특집RLHFInstructGPT
2026.09.21

“달 착륙을 6살에게 설명해 줘” — 되묻기만 하던 AI는 어떻게 말귀를 알아듣게 됐나 (RLHF 특집)

2022년 1월, OpenAI는 “사용자의 의도를 GPT-3보다 훨씬 잘 따르는” 모델을 발표했다. 13억 파라미터 모델이 1750억 모델을 이겼고, 그 비용은 사전학습의 1.6%였다. 열 달 뒤 같은 레시피로 만든 ChatGPT가 세상을 바꿨다. 이 글은 그 기술 — 인간 피드백 강화학습(RLHF) — 이 왜 필요했는지를 2017년 뒤공중돌기 로봇부터 따라간다. 보상을 글로 적을 수 없다는 문제, 순위 하나가 여섯 개의 비교가 되는 방식, 보상 모델을 너무 믿으면 벌어지는 일, 그리고 RLHF가 고친 것이 아니라 ‘만든’ 네 가지 버릇까지. 인터랙티브 위젯 8종과 삽화로 풀었다.

코어닷투데이61분
AI 정렬(Alignment)과 안전: 우리가 원하는 것을 기계에게 어떻게 전달하는가
인사이트AI 정렬AI 안전
2026.03.16

AI 정렬(Alignment)과 안전: 우리가 원하는 것을 기계에게 어떻게 전달하는가

1960년 위너의 경고에서 2025년 정렬 위장(alignment faking) 발견까지. AI가 인간의 의도대로 작동하게 만드는 정렬 문제의 역사, 기술, 사건, 그리고 실전적 의미를 추적한다.

코어닷투데이30분
Claude Opus 4.6 해부 — Chatbot Arena 1위, 에이전트 팀, 1M 컨텍스트의 모든 것
기술ClaudeOpus 4.6
2026.02.02

Claude Opus 4.6 해부 — Chatbot Arena 1위, 에이전트 팀, 1M 컨텍스트의 모든 것

Chatbot Arena 1위, SWE-bench 80.8%, HLE 53%, 1M 토큰 컨텍스트 — 2026년 2월 출시된 Claude Opus 4.6을 완전 해부한다. Anthropic의 역사부터 아키텍처, 벤치마크, 실무 활용까지.

코어닷투데이27분
Constitutional AI: AI에게 '헌법'을 주면 스스로 착해질 수 있을까?
인사이트Constitutional AIAI 안전성
2025.11.17

Constitutional AI: AI에게 '헌법'을 주면 스스로 착해질 수 있을까?

인간 수만 명이 AI 답변을 채점하는 대신, AI에게 '헌법'을 주고 스스로 개선하게 한다면? Anthropic의 Constitutional AI가 AI 안전성의 패러다임을 바꾼 이야기.

코어닷투데이31분