본문 바로가기
728x90

전체 글81

MRC부터 Text-to-SQL까지 NLP 태스크 지도 다시 그리기 MRC, STS, Open IE, 기계번역, Text-to-SQL, 문서 이해는 서로 다른 커뮤니티에서 자란 태스크다. 모델 아키텍처를 걷어내고 입력과 출력, 채점 방식만 남기면 어디가 같고 어디가 다른지 선명해진다. 한국어 벤치마크의 설계 결정과 LLM 이후의 재편까지 같이 본다. NLP 모델을 제품에 붙이거나 평가 셋을 골라야 하는 쪽을 독자로 상정했다.입출력과 채점 방식으로 나눈 지도태스크입력출력주 지표대표 벤치마크Extractive MRC질문 + 지문지문 내 spanEM, F1SQuAD, KorQuADGenerative MRC질문 + 문서 집합자유 텍스트ROUGE, 사람 평가MS MARCOMulti-hop MRC질문 + 다중 문서span + 근거 문장supporting fact F1HotpotQA.. 2026. 9. 5.
RAG 파이프라인의 실패 지점 검색 품질 지표를 올렸는데 최종 답변 정확도는 그대로이거나 오히려 떨어진 경험이 있다면, 이 글이 그 간극을 설명한다. top-k를 키우고 임베딩 모델을 바꾸는 수준의 튜닝이 어디서 멈추는지, GraphRAG와 LightRAG 계열이 벡터 검색의 어떤 부분을 겨냥하는지 정리했다. RAG를 데모 단계 너머 운영 서비스로 굴려본 사람을 독자로 상정한다.무관한 문서가 정확도를 올리는 구간Cuconasu 등이 SIGIR 2024에서 발표한 실험은 RAG 설계의 기본 가정을 흔든다. 문서를 골드, 관련, 방해, 무작위로 나눈 뒤 프롬프트 구성을 바꿔가며 정확도를 쟀다. 방해 문서는 쿼리와 의미적으로 가깝지만 답을 담고 있지 않은 문서다. 나폴레옹 말의 색을 물었을 때 조제핀의 말 색을 서술한 문단이 여기 해당한다.. 2026. 9. 5.
한국어 RAG에서 형태소 분석이 하는 일 한국어 문서를 청킹하고 색인할 때 형태소 분석을 어디까지 밀어넣어야 하는지 정리한다. BM25 쪽의 어간 추출과 조사 제거가 재현율을 어떻게 바꾸는지, dense 임베딩과 어떻게 섞는지, reranker를 얹으면 무엇이 좋아지고 무엇이 그대로 남는지를 다룬다. 검색 파이프라인을 직접 손보는 사람, 그리고 파인튜닝 예산을 어디에 쓸지 결정해야 하는 사람을 염두에 뒀다.조사와 어미가 뚫어놓는 재현율 구멍BM25는 역색인 위의 정확 일치 통계다. 어절을 그대로 색인하면 "검색엔진이", "검색엔진을", "검색엔진에서"가 전부 다른 term이 된다. 질의가 "검색엔진 성능"이면 셋 중 무엇도 걸리지 않는다. df가 변이형마다 쪼개지므로 idf까지 같이 뒤틀린다. 흔한 명사일수록 조사 결합형이 많아 df가 잘게 흩.. 2026. 9. 2.
한국어 형태소 분석과 서브워드 토크나이저 토크나이저를 바꾸면 검색 품질과 학습 비용이 같이 흔들린다. 이 글은 BPE 계열이 교착어에서 무너지는 지점을 토큰 수, 미등록어, 형태론적 일반화로 나눠 정리하고, 형태소 분석 결과를 토크나이저 사전에 주입하는 방법과 그 효과의 상한을 다룬다.교착어에서 서브워드가 무너지는 지점BPE와 unigram은 빈도만 보고 병합 규칙을 만든다. 형태소가 무엇인지 모른다. "했습니다"는 고빈도라 통째로 한 토큰이 되고, 같은 어간의 저빈도 활용형은 경계를 무시한 채 잘린다.토큰 수부터 문제다. 어절당 토큰 수가 오르면 컨텍스트 길이, KV 캐시, prefill 연산량이 따라 오른다. Dagan 등은 토크나이저 크기와 pre-tokenization 정규식이 생성 속도와 유효 컨텍스트를 좌우하며 50B 토큰 이상 도메.. 2026. 8. 29.
추천 시스템 알고리즘 지형도 연관 규칙에서 시작해 협업 필터링, 행렬 분해, 지식 그래프 결합을 지나 생성형 추천까지 이어지는 계보를 한 장에 편다. 알고리즘 카탈로그를 나열하는 대신 각 기법이 서빙 파이프라인의 어느 자리에 앉고 어디서 무너지는지에 초점을 뒀다. 검색 랭킹이나 개인화 파이프라인을 직접 운영해본 쪽을 독자로 상정했다.연관 규칙이 남긴 어휘Apriori를 지금 프로덕션에 올리는 곳은 거의 없다. 남은 것은 어휘다. 지지도와 신뢰도, 향상도는 그대로 랭킹 피처 설계에 쓰인다.$$\begin{aligned}\text{support}(A) &= P(A) \\\text{confidence}(A \Rightarrow B) &= \frac{P(A,B)}{P(A)} \\\text{lift}(A \Rightarrow B) &= \f.. 2026. 8. 26.
검색 쿼리 이해와 의도 추정 두세 단어짜리 질의에서 무엇을 어디까지 복원하고, 그 복원 과정을 실제 지연 예산 안에 어떻게 밀어 넣는가. 쿼리 분류와 의도 태깅, 확장, 재작성, 제안으로 이어지는 전처리 계층이 DPR과 ColBERT, 하이브리드로 짜인 검색 계층과 어디서 맞물리는지를 정리한다. 검색 파이프라인을 운용하거나 RAG 리트리버를 손보는 쪽을 독자로 상정했다.질의 언어의 분포는 문서 언어와 다르다쿼리 이해를 언어 모델 문제로 놓고 본 초기 연구 중 WWW 2010의 웹 스케일 n-gram 논문이 아직 참조할 만하다. 73만여 개 질의로 body, title, anchor text, query 각각의 perplexity를 비교했더니 질의는 문서 본문보다 anchor text나 title에 가까웠다. 저자가 문서를 요약하는 .. 2026. 8. 22.
728x90