coredot.today
블로그로 돌아가기

#RLHF

16개의 포스트

Constitutional AI: AI에게 '헌법'을 주면 스스로 착해질 수 있을까?
인사이트Constitutional AIAI 안전성
2025.11.17

Constitutional AI: AI에게 '헌법'을 주면 스스로 착해질 수 있을까?

인간 수만 명이 AI 답변을 채점하는 대신, AI에게 '헌법'을 주고 스스로 개선하게 한다면? Anthropic의 Constitutional AI가 AI 안전성의 패러다임을 바꾼 이야기.

코어닷투데이31
DPO 특집: 강화학습 없이 AI를 정렬하는 법 — 'AI는 사실 보상 모델이었다'
인사이트DPORLHF
2025.11.04

DPO 특집: 강화학습 없이 AI를 정렬하는 법 — 'AI는 사실 보상 모델이었다'

ChatGPT를 만든 RLHF는 복잡하고, 불안정하고, 비싸다. 스탠퍼드의 DPO 논문은 이 모든 것을 하나의 수식으로 해결했다. 강화학습 없이 AI를 인간의 선호에 맞추는 혁명적 방법론의 탄생부터 2026년 현재까지를 추적한다.

코어닷투데이44
RLHF의 기원: '보상 함수를 쓸 수 없다면, 인간에게 물어보라'
기술RLHF강화학습
2025.10.14

RLHF의 기원: '보상 함수를 쓸 수 없다면, 인간에게 물어보라'

ChatGPT를 만든 기술의 원조 논문. 보상 함수를 쓸 수 없는 과제를 인간의 선호 판단 1% 미만으로 해결한 2017년 논문을 해부하며, 강화학습의 기초부터 현대 AI까지의 여정을 쉽게 풀어낸다.

코어닷투데이29
InstructGPT 해부: 1.3B 모델이 175B를 이긴 날, RLHF의 모든 것
기술InstructGPTRLHF
2025.10.07

InstructGPT 해부: 1.3B 모델이 175B를 이긴 날, RLHF의 모든 것

GPT-3는 왜 '도움이 되는 비서'가 아니었을까? 100배 작은 모델이 거대 모델을 이긴 비결은? InstructGPT 논문을 해부하며, ChatGPT를 탄생시킨 RLHF 기술을 처음부터 쉽게 풀어낸다.

코어닷투데이31