728x90 전체 글83 LLM 에이전트와 추론 모델의 구조 "에이전트"라는 단어가 API를 한 번 호출하는 스크립트부터 서브에이전트 수십 개를 병렬로 돌리는 시스템까지 전부를 가리키면서 설계 논의가 겉돈다. 이 글은 단일 호출과 에이전트를 가르는 기준을 도구 사용, 상태, 루프, 종료 조건 네 축으로 고정하고, 추론 모델이 test-time compute를 늘려 성능을 얻는 방식이 CoT 계열 프롬프팅과 어떻게 갈라지는지 정리한다. 검색 제품에 LLM 파이프라인을 얹거나 사내 GPU에 모델을 올려 서빙하는 쪽을 독자로 상정했다.단일 호출과 에이전트를 가르는 네 축Anthropic의 정의가 가장 실용적이다. 워크플로는 LLM과 도구가 미리 정의된 코드 경로로 조율되는 시스템이고, 에이전트는 LLM이 자신의 프로세스와 도구 사용을 동적으로 결정하며 작업 수행 방식에.. 2026. 9. 12. 하이퍼그래프 기반 지식 표현과 검색 지식 그래프를 검색 파이프라인에 붙여본 사람은 (h, r, t) 삼중항이 실제 문서의 사실을 담기에 좁다는 것을 안다. 이 글은 이항 관계 전제를 n항으로 확장하는 하이퍼그래프 표현, 하이퍼엣지 임베딩과 링크 예측 모델, 하이퍼그래프 신경망의 연산 정의, 그리고 이 구조를 RAG 인덱스로 썼을 때 얻는 것과 치르는 비용을 정리한다. 검색 인덱스나 RAG 파이프라인을 직접 설계하는 쪽을 독자로 상정했다.삼중항 스키마가 무너지는 지점"어떤 연구자가 2019년에 특정 기관에서 박사 학위를 받았다"는 사실 하나에 엔티티가 넷이다. 삼중항 스키마로 이걸 담으려면 reification을 쓴다. 사실 자체를 노드로 승격시키고 참여자를 그 노드에 이항 에지로 매다는 방식이다. 스키마는 지킨 셈이지만 임베딩 학습이 망가.. 2026. 9. 9. MRC부터 Text-to-SQL까지 NLP 태스크 지도 다시 그리기 MRC, STS, Open IE, 기계번역, Text-to-SQL, 문서 이해는 서로 다른 커뮤니티에서 자란 태스크다. 모델 아키텍처를 걷어내고 입력과 출력, 채점 방식만 남기면 어디가 같고 어디가 다른지 선명해진다. 한국어 벤치마크의 설계 결정과 LLM 이후의 재편까지 같이 본다. NLP 모델을 제품에 붙이거나 평가 셋을 골라야 하는 쪽을 독자로 상정했다.입출력과 채점 방식으로 나눈 지도태스크입력출력주 지표대표 벤치마크Extractive MRC질문 + 지문지문 내 spanEM, F1SQuAD, KorQuADGenerative MRC질문 + 문서 집합자유 텍스트ROUGE, 사람 평가MS MARCOMulti-hop MRC질문 + 다중 문서span + 근거 문장supporting fact F1HotpotQA.. 2026. 9. 5. RAG 파이프라인의 실패 지점 검색 품질 지표를 올렸는데 최종 답변 정확도는 그대로이거나 오히려 떨어진 경험이 있다면, 이 글이 그 간극을 설명한다. top-k를 키우고 임베딩 모델을 바꾸는 수준의 튜닝이 어디서 멈추는지, GraphRAG와 LightRAG 계열이 벡터 검색의 어떤 부분을 겨냥하는지 정리했다. RAG를 데모 단계 너머 운영 서비스로 굴려본 사람을 독자로 상정한다.무관한 문서가 정확도를 올리는 구간Cuconasu 등이 SIGIR 2024에서 발표한 실험은 RAG 설계의 기본 가정을 흔든다. 문서를 골드, 관련, 방해, 무작위로 나눈 뒤 프롬프트 구성을 바꿔가며 정확도를 쟀다. 방해 문서는 쿼리와 의미적으로 가깝지만 답을 담고 있지 않은 문서다. 나폴레옹 말의 색을 물었을 때 조제핀의 말 색을 서술한 문단이 여기 해당한다.. 2026. 9. 5. 한국어 RAG에서 형태소 분석이 하는 일 한국어 문서를 청킹하고 색인할 때 형태소 분석을 어디까지 밀어넣어야 하는지 정리한다. BM25 쪽의 어간 추출과 조사 제거가 재현율을 어떻게 바꾸는지, dense 임베딩과 어떻게 섞는지, reranker를 얹으면 무엇이 좋아지고 무엇이 그대로 남는지를 다룬다. 검색 파이프라인을 직접 손보는 사람, 그리고 파인튜닝 예산을 어디에 쓸지 결정해야 하는 사람을 염두에 뒀다.조사와 어미가 뚫어놓는 재현율 구멍BM25는 역색인 위의 정확 일치 통계다. 어절을 그대로 색인하면 "검색엔진이", "검색엔진을", "검색엔진에서"가 전부 다른 term이 된다. 질의가 "검색엔진 성능"이면 셋 중 무엇도 걸리지 않는다. df가 변이형마다 쪼개지므로 idf까지 같이 뒤틀린다. 흔한 명사일수록 조사 결합형이 많아 df가 잘게 흩.. 2026. 9. 2. 한국어 형태소 분석과 서브워드 토크나이저 토크나이저를 바꾸면 검색 품질과 학습 비용이 같이 흔들린다. 이 글은 BPE 계열이 교착어에서 무너지는 지점을 토큰 수, 미등록어, 형태론적 일반화로 나눠 정리하고, 형태소 분석 결과를 토크나이저 사전에 주입하는 방법과 그 효과의 상한을 다룬다.교착어에서 서브워드가 무너지는 지점BPE와 unigram은 빈도만 보고 병합 규칙을 만든다. 형태소가 무엇인지 모른다. "했습니다"는 고빈도라 통째로 한 토큰이 되고, 같은 어간의 저빈도 활용형은 경계를 무시한 채 잘린다.토큰 수부터 문제다. 어절당 토큰 수가 오르면 컨텍스트 길이, KV 캐시, prefill 연산량이 따라 오른다. Dagan 등은 토크나이저 크기와 pre-tokenization 정규식이 생성 속도와 유효 컨텍스트를 좌우하며 50B 토큰 이상 도메.. 2026. 8. 29. 이전 1 2 3 4 ··· 14 다음 728x90