coredot.today

TECH BLOG

기술 블로그

AI 기술 인사이트와 엔지니어링 경험을 공유합니다.

EDITOR'S PICK

에디터 추천

AI 시대, 청년들은 왜 커리어를 다시 설계하는가 — 대체 불가능한 일의 조건
인사이트AI 고용커리어 전환
2026.02.10

AI 시대, 청년들은 왜 커리어를 다시 설계하는가 — 대체 불가능한 일의 조건

보험 사무직이 소방관을 준비하고, 컴퓨터공학도가 전기 기술을 배운다. AI가 화이트칼라의 안전지대를 무너뜨리면서, 젊은 세대는 '대체 불가능한 일'을 찾아 움직이고 있다. 데이터와 역사가 말하는 커리어 전환의 논리.

코어닷투데이55분
스스로 진화하는 AI, 그런데 진화할수록 잊는다: 자기진화 에이전트와 '능력 침식'
AI 에이전트자기진화 에이전트self-evolving agents
2026.06.08

스스로 진화하는 AI, 그런데 진화할수록 잊는다: 자기진화 에이전트와 '능력 침식'

오늘날의 AI는 출시되는 순간 박제된다 — 아무리 써도 더 똑똑해지지 않는다. 이 한계를 깨려는 분야가 '자기진화 에이전트'다. 스스로 코드를 고치고, 스킬을 만들고, 기억을 다듬으며 성장한다. 그런데 2026년의 한 논문이 불편한 진실을 밝혔다 — 진화할수록 '예전에 잘하던 것'을 까먹는다(능력 침식). 자기진화의 설계공간(What·When·How·Where), 2022→2025 진화 계보(원문 그림 인용), 네 통로의 망각, 그리고 '성장하되 잊지 않는' 법까지 정리한다.

코어닷투데이21분
리걸테크 AI 대전 2026: 변호사의 일을 빼앗는 130조 원 시장의 모든 것
특집리걸테크법률 AI
2026.05.16

리걸테크 AI 대전 2026: 변호사의 일을 빼앗는 130조 원 시장의 모든 것

2026년 글로벌 리걸테크 시장이 965억 달러(약 130조 원)를 넘어섰다. Harvey($11B), Legora($5.55B), Hebbia($700M)가 수십억 달러 단위로 경쟁하고, 한국에서는 로폼·LBOX·Casenote·BHSN이 변협과의 25년 갈등 끝에 대법원 판결로 길이 열렸다. 시간당 $2,000짜리 변호사 노동을 1시간 단위가 아니라 1분 단위로 다시 가격 매기는 AI의 폭발 — 이 산업의 모든 플레이어, 모든 기술, 모든 윤리 논쟁을 한 편으로 정리한다.

코어닷투데이54분
AI가 다 요약해주는데 왜 아직 책을 읽는가 — 2026년의 독서 기술
인사이트독서법학습
2026.08.12

AI가 다 요약해주는데 왜 아직 책을 읽는가 — 2026년의 독서 기술

한국 성인의 연간 독서량은 2.4권, 독서율은 38.5%로 역대 최저입니다. 같은 해 AI는 어떤 책이든 30초 만에 요약해줍니다. 그런데도 왜 읽어야 하는가 — 1597년 베이컨부터 2026년 MIT의 '인지 부채' 연구까지, 읽기 방법론이 왜 400년마다 다시 발명되는지 추적하고, 주 1권을 실제로 만들어내는 시스템을 처음부터 끝까지 설계합니다.

코어닷투데이97분

ALL POSTS

모든 포스트

'지난달 글'은 누가 계산하나 — 시간 표현과 검색, 계산하게 할 것인가 고르게 할 것인가 (한국어 검색 스택 11편)
튜토리얼시간 표현상대 날짜
2026.10.11

'지난달 글'은 누가 계산하나 — 시간 표현과 검색, 계산하게 할 것인가 고르게 할 것인가 (한국어 검색 스택 11편)

8편에서 '2026년 4월에 올라온 RAG 글'은 정규식 몇 줄로 풀렸습니다. 날짜가 숫자로 적혀 있었기 때문입니다. 그런데 사람은 그렇게 묻지 않습니다. '지난달 RAG 글', '올봄에 쓴 보안 글', '도커 첫걸음 시리즈가 나온 다음에 쓴 Git 글'. 이 글은 오늘을 2026년 10월 14일로 고정하고 이런 질문 38개로, 시간 표현을 날짜 범위로 바꾸는 일을 누구에게 맡겨야 하는지 쟀습니다. 정규식은 하나도 읽지 못했습니다. 로컬 LLM은 날짜를 직접 계산해 nDCG@10 0.735까지 올렸지만 '두 달 전'을 하루짜리 날짜로 읽어 결과가 텅 빈 질문을 만들었습니다. Jev에게 글마다 날짜를 판정시키면 '지난달'은 완벽했지만 '지난 분기'는 56%였습니다. 같은 Jev가 코드가 펼쳐 준 기간 후보 20개 중에서 고르게 하자 26개를 전부 맞혔고, 사건 기준 질문은 검색이 기준 글을 찾게 한 설계가 0.832로 상한선(0.851)에 다가갔습니다. 계산은 코드가, 판단은 Jev가, 찾기는 검색이. Jev 2,627회 호출에 0.06달러. 인터랙티브 4개와 삽화 7장.

코어닷투데이26분
조건이 둘, 셋이 되면 — 질문을 쪼개는 검색과 Jev의 조건별 판정, 한국어 실측 (한국어 검색 스택 10편)
튜토리얼다중 조건 검색MultiConIR
2026.10.10

조건이 둘, 셋이 되면 — 질문을 쪼개는 검색과 Jev의 조건별 판정, 한국어 실측 (한국어 검색 스택 10편)

8편이 풀지 못한 숙제가 있었습니다. 'AWS 보안 글', 'Claude Code에서 MCP를 쓰는 글'처럼 두 주제를 모두 만족해야 하는 질문입니다. 이 글은 조건 1개·2개·3개짜리 한국어 질문 52개와 조건 순서만 바꾼 쌍둥이 질문 40개로, 조건이 늘 때 검색이 어떻게 무너지는지와 그것을 어떻게 막는지를 쟀습니다. 질문을 한 번에 임베딩하면 nDCG@10이 조건 1개 0.940에서 2개 0.519, 3개 0.387로 떨어졌습니다. 질문을 조건별로 쪼개 따로 찾고 합치기만 해도 3개에서 0.592로 버텼고, 그 후보를 Jev가 판정하면 2개와 3개 모두 0.725였습니다. Jev는 한 호출에 질문을 여러 개 받으므로 조건마다 따로 물어도 조건 하나당 토큰 90개, 지연 2ms만 늘었고, 어느 조건이 빠졌는지까지 알려 줬습니다. 의외의 발견도 있었습니다. 판정할 문장 자체가 바뀌는 탓에 'Jev 한 질문'이 조건 순서에 가장 민감했고, 조건별로 묻자 그 흔들림이 사라졌습니다. Jev 9,544회 호출에 0.27달러. 인터랙티브 4개와 삽화 7장.

코어닷투데이22분
'빼고'를 공짜로 고칠 수 있나 — 임베딩 트릭 대 Jev, 한국어 제외 질문 50개 실측 (한국어 검색 스택 9편)
튜토리얼제외 질문부정 검색
2026.10.09

'빼고'를 공짜로 고칠 수 있나 — 임베딩 트릭 대 Jev, 한국어 제외 질문 50개 실측 (한국어 검색 스택 9편)

8편에서 '쿠버네티스는 빼고 도커만'이라고 물으면 임베딩이 상위 10개의 절반을 쿠버네티스 글로 채운다는 것을 봤고, Jev가 그것을 고쳤습니다. 그런데 8월과 9월에 나온 두 논문(EXCISE, E-SENS)은 학습도 큰 모델도 없이 이 문제를 줄이는 방법을 내놓았습니다. 이 글은 한국어 제외 질문 50개(표지어가 분명한 30개, 돌려 말한 10개, 두 가지를 동시에 빼는 10개)로 그 공짜 방법들과 Jev를 정면으로 비교했습니다. 가장 큰 한 걸음은 놀랍도록 단순했습니다. 질문에서 빼라는 말을 떼어 내기만 해도 nDCG@10이 0.245에서 0.555로 뛰었습니다. 빼라는 단어가 든 글을 아래로 내리는 공짜 규칙은 0.676으로 8편의 Jev 방식(0.672)과 같은 자리까지 올라왔습니다. 하지만 그 규칙은 평범한 질문을 제외 질문으로 오인했을 때 정답을 100위로 보내는 위험도 있었습니다. 글자 강등으로 정리한 상위 20개만 Jev가 판정하는 조합이 0.790으로 가장 높았지만 강등의 위험을 그대로 물려받았고, 원래 질문과 뗀 질문의 후보를 합쳐 Jev에 주면(0.759) 평범한 질문을 하나도 해치지 않았습니다. Jev 3,405회 호출에 0.1달러. 인터랙티브 5개와 삽화 7장.

코어닷투데이27분
도구는 넷, 자리는 넷 — BM25·임베딩·Jev·코드를 적재적소에 쓰는 한국어 검색 실측 (한국어 검색 스택 8편)
튜토리얼TypeSafeJev
2026.10.08

도구는 넷, 자리는 넷 — BM25·임베딩·Jev·코드를 적재적소에 쓰는 한국어 검색 실측 (한국어 검색 스택 8편)

6편에서 Jev는 리랭커로 강했고, 7편에서는 환각 검문소로 강했습니다. 그렇다면 검색의 모든 단계를 Jev에 맡기면 될까요? 이 글은 한국어 질문 134개를 다섯 가족(키워드·의미·제외 조건·두 주제·날짜·카테고리)으로 나눠 BM25, 임베딩 둘, 하이브리드, Jev, 그리고 정규식 몇 줄짜리 코드 필터를 열세 가지 방식으로 조합해 실측했습니다. 질문의 종류가 바뀌면 이기는 도구가 바뀌었습니다. '쿠버네티스는 빼고'라고 하면 임베딩과 BM25는 쿠버네티스 글을 상위 10개의 절반쯤 가져왔고 Jev가 그것을 19%로 줄였습니다. 날짜 질문에서는 Jev가 날짜 판정 807쌍을 전부 맞혔는데도 코드 필터에 졌습니다. 판정이 아니라 후보가 문제였기 때문입니다. 각 도구를 제자리에 둔 설계는 모든 질문에 Jev를 쓰는 방식보다 점수가 높으면서 Jev 호출은 40%였습니다. Jev 9,521회 호출에 0.26달러. 인터랙티브 5개와 삽화 7장.

코어닷투데이40분
임베딩은 '아니다'를 못 읽는다 — Jev를 RAG 환각 검문소에 세우다 (한국어 검색 스택 7편)
튜토리얼TypeSafeJev
2026.10.07

임베딩은 '아니다'를 못 읽는다 — Jev를 RAG 환각 검문소에 세우다 (한국어 검색 스택 7편)

임베딩 모델은 '매출이 30% 늘었다'와 '매출이 30% 줄었다'를 거의 같은 문장으로 봅니다. 검색에는 맞는 판단이지만, RAG 답변의 마지막 관문에서는 치명적입니다. 이 글은 6편에 이어 TypeSafe의 Jev를 한국어 검색 파이프라인의 새 자리, 답변 뒤의 '환각 검문소'에 세웁니다. 이 블로그 문단 87개로 참 주장 257개와 숫자·방향·주체를 바꾸거나 없는 사실을 덧붙인 거짓 주장 344개를 만들고, 임베딩 둘·크로스 인코더·NLI 모델·로컬 LLM 둘·Jev에게 같은 601쌍을 판정시켰습니다. 참 주장의 90%를 통과시키는 임계값에서 BGE-M3 코사인은 숫자를 바꾼 거짓의 3%만 잡았고, Jev는 100%를 잡았습니다(AUROC 0.995). 0.3B NLI 모델이 의외의 복병이었고(0.959), 숫자를 1만 바꿔도 잡던 Jev는 문서의 숫자로 계산해야 하는 주장에서 약해졌습니다. 601번 검문에 0.021달러. 인터랙티브 7개와 삽화 8장.

코어닷투데이36분
임베딩 다섯과 판정 모델 하나 — TypeSafe Jev를 한국어 검색 파이프라인에 세워 보다 (한국어 검색 스택 6편)
튜토리얼TypeSafeJev
2026.10.06

임베딩 다섯과 판정 모델 하나 — TypeSafe Jev를 한국어 검색 파이프라인에 세워 보다 (한국어 검색 스택 6편)

지난 특집에서 TypeSafe의 Jev를 '글자를 포기한 모델'이라고 소개했습니다. 벡터도 문장도 내놓지 않고, 상태와 질문을 받아 확률이 붙은 결정만 돌려주는 모델입니다. 그렇다면 임베딩 모델과 비교할 수 있을까요? 같은 자리에 놓으면 안 됩니다. 임베딩은 '문서 100만 개 중 어디를 볼까'를 정하고, Jev는 '이 열 장 중 어느 것이 답인가'를 판정합니다. 이 글은 그 자리를 정확히 나눈 뒤, 1~5편의 한국어 코퍼스(589건, 질문 85개)로 Jev를 검색 파이프라인의 세 자리에 세워 실측했습니다. 리랭커로는 8B 임베딩의 상위 10개를 0.889에서 0.929로 올렸고(같은 자리에서 568M 크로스 인코더는 0.864로 떨어뜨렸습니다), 한국어 지시문이 영어보다 조금 더 좋았고, 확률은 대체로 보정돼 있었고, 4,213번 호출에 0.16달러가 들었습니다. 반면 카테고리 분류에서는 임베딩 이웃 투표가 이겼습니다. 인터랙티브 5개와 삽화 10장.

코어닷투데이27분
BM25는 한국어를 어떻게 쪼개나 — 조사·복합명사·영한 혼용, 토크나이저가 검색을 결정한다 (한국어 검색 스택 5편)
튜토리얼BM25한국어 토크나이저
2026.10.05

BM25는 한국어를 어떻게 쪼개나 — 조사·복합명사·영한 혼용, 토크나이저가 검색을 결정한다 (한국어 검색 스택 5편)

2편에서 BM25는 '약한 고리'였습니다. 왜 약했을까요. 이 글은 그 질문을 파고듭니다. 같은 문서, 같은 질문, 같은 BM25 공식에 토크나이저만 여덟 가지로 바꿔 보니 nDCG@10이 0.42에서 0.62까지 벌어졌습니다. 띄어쓰기로 자르면 '청년취업을'과 '청년취업'이 다른 단어가 되고, 형태소 분석기로 조사를 떼면 같은 단어가 되며, 글자 2-gram을 겹쳐 색인하면 사전에 없는 말까지 받아 줍니다. 한국어에서 어휘 검색이 어려운 세 가지 이유(교착어의 조사와 어미, 복합명사, 영한 혼용)를 예시 문장의 실제 토큰으로 보여 주고, 엘라스틱서치 nori의 decompound 모드와 불용 품사 기본값, Kiwi의 사용자 사전, BM25의 k1·b 다이얼을 실측으로 짚습니다. 결론은 BM25 자체가 약한 것이 아니라 한국어를 잘못 쪼갠 BM25가 약하다는 것입니다. 인터랙티브 4개와 삽화 8장.

코어닷투데이20분
[특집] AI가 만든 새 시장 지도 2026 — 판단·연산·신뢰·새로운 고객·결과, 다섯 가지 희소성이 낳은 비즈니스
특집AI 비즈니스신규 시장
2026.10.04

[특집] AI가 만든 새 시장 지도 2026 — 판단·연산·신뢰·새로운 고객·결과, 다섯 가지 희소성이 낳은 비즈니스

2022년에는 없던 회사들이 2026년에 수십억 달러 매출을 냅니다. 의사와 변호사를 시간제로 모아 AI를 가르치는 Mercor는 연환산 총매출 20억 달러를 넘겼고, 말로 앱을 만드는 Lovable은 출시 2년이 안 돼 연 6억 달러, AI가 문의를 끝까지 해결할 때만 돈을 받는 Sierra는 기업가치 158억 달러가 됐습니다. 이 글은 이런 새 시장 열 개를 조사해, 모두 AI가 만든 '새로운 희소성' 위에 서 있다는 공통점을 찾았습니다. 모델을 가르칠 사람의 판단, GPU와 전력, 믿고 쓸 근거, AI라는 새로운 손님, 그리고 '끝낸 일'이라는 새 과금 단위입니다. 그리고 가장 빨리 크는 시장이 가장 오래 가는 시장은 아니라는 것도요. 랩에 납품하는 시장은 고객이 몇 곳뿐이고 그 고객이 직접 만들 수 있습니다. 결과를 파는 시장은 느리지만 넓습니다. 숫자를 읽는 법(총매출과 순매출, 거래 건수와 실제 돈)과 한국에서의 기회까지, 인터랙티브 5개와 삽화 5장으로 정리했습니다.

코어닷투데이33분
벤치마크 점수로 AI 모델을 고르면 안 되는 이유 — 독파모 2차 평가 원점수로 직접 계산해 보기
인사이트독자 AI 파운데이션 모델독파모
2026.10.04

벤치마크 점수로 AI 모델을 고르면 안 되는 이유 — 독파모 2차 평가 원점수로 직접 계산해 보기

8월 18일 발표된 독자 AI 파운데이션 모델 2차 평가에서 SKT·업스테이지·LG가 통과하고 모티프가 탈락했습니다. 그런데 과기정통부가 8월 27일 공개한 세부 점수를 보면 모티프는 벤치마크 점수 1위였고, 국제 평가 기관 Artificial Analysis의 지수에서는 2위와 10점 넘게 차이가 났습니다. 결과를 가른 것은 전문가와 사용자 평가였습니다. 평가위원 10명과 국민 평가단 185명의 원점수까지 공개된 자료로, 가중치를 바꾸면 순위가 어떻게 달라지는지 직접 계산해 볼 수 있게 했습니다. 공정했느냐를 따지려는 글이 아닙니다. 국내 모델을 고르는 기업에 '벤치마크 1위'가 무엇을 뜻하고 무엇을 뜻하지 않는지 보여 주는 드문 공개 데이터라서 들여다봤습니다. 2027년 AI 예산 9.4조와 '모두의 AI'까지 함께 정리했습니다.

코어닷투데이20분