coredot.today
블로그로 돌아가기

#DeepSeek

3개의 포스트

당신의 AI, 빌린 겁니까 가진 겁니까 (2부): SFT에서 GRPO까지, '디지털 트윈'이라는 훈련장
기술강화학습GRPO
2026.07.30

당신의 AI, 빌린 겁니까 가진 겁니까 (2부): SFT에서 GRPO까지, '디지털 트윈'이라는 훈련장

'강화학습으로 모델을 훈련한다'는 말은 정확히 무슨 뜻일까? 사전학습·SFT·RLHF·RLVR로 이어지는 개념의 사다리를 밟아 오르고, 요즘 화제인 GRPO를 '커브로 채점하는 시험'에 빗대 직관적으로 푼다. 그리고 모델이 실제로 업무를 연습하는 '디지털 트윈'과 보상 설계까지, Fermisense의 카탈로그 실험을 해부한다.

코어닷투데이22
성당과 시장의 귀환 — 빅테크는 왜 자기 보물을 공짜로 풀어주는가
특집오픈소스오픈소스 전략
2026.05.23

성당과 시장의 귀환 — 빅테크는 왜 자기 보물을 공짜로 풀어주는가

Bill Gurley의 화제작 'Open Source Strategy'를 한국 독자를 위해 풀어 쓰다. 1983년 스톨먼의 분노부터 2026년 DeepSeek의 폭격까지 — 빅테크가 코드를 공짜로 푸는 진짜 이유, 그리고 AI 시대에 다시 시작된 '성당 대 시장'의 두 번째 시즌.

코어닷투데이45
Mixture of Experts 완전 해부: 1.8조 파라미터인데 왜 빠른가
기술MoEMixture of Experts
2025.07.15

Mixture of Experts 완전 해부: 1.8조 파라미터인데 왜 빠른가

GPT-4는 1.8조 파라미터지만 추론 시 222B만 활성화된다. 어떻게 가능한가? 1991년 MIT에서 시작된 '전문가 혼합' 아이디어가 34년 뒤 모든 프론티어 AI 모델의 핵심 아키텍처가 되기까지 — Expert의 정체, 라우팅의 작동 원리, 실전 사례와 논란까지 완전 해부한다.

코어닷투데이29