본문 바로가기
728x90

전체 글85

국내외 전산학 학회 지형과 논문 검색 검색엔진 제품을 만들면서 대학원 과정을 병행하면 학회 달력이 곧 업무 달력이 된다. 어느 학회가 어떤 성격이고 마감이 언제 걸리는지, 선행 연구를 어디서 훑는지, 국내 학술대회 프로시딩이 해외 컨퍼런스 원고와 무엇이 다른지를 정리했다. 투고를 준비하는 대학원생과 사내 실험 결과를 논문으로 남겨보려는 개발자를 염두에 뒀다.해외 학회 지형NLP 쪽 축은 ACL, EMNLP, NAACL 세 곳이고 셋 다 ARR이라는 공용 리뷰 파이프라인 위에 얹혀 있다. 검색과 랭킹이면 SIGIR이 1순위, 로그 기반 추천이나 대규모 그래프는 KDD와 WWW, 그 아래로 CIKM과 WSDM이 붙는다. 방법론 자체를 파는 논문은 NeurIPS, ICML, ICLR로 간다. AAAI는 응용 트랙 비중이 높아 현장 결과물을 넣기가.. 2026. 9. 19.
AI 엔지니어링 스택을 네 계층으로 자르기 스택 지도를 한 장 그려두면 새 도구가 튀어나올 때마다 어디에 꽂을지 판단이 빨라진다. 이 글은 모델, 서빙, 오케스트레이션, 평가와 관측 네 계층으로 스택을 자르고 각 층에서 실제로 무엇을 고르게 되는지를 정리한다. 검색 제품이나 사내 LLM 서비스를 직접 굴려본 사람을 독자로 상정했다.계층 구분과 교체 비용Chip Huyen의 정리는 애플리케이션 개발, 모델 개발, 인프라 세 층이다. 도구를 고를 때 이 구분은 조금 거칠다. 인프라 한 덩어리 안에 GPU 스케줄링과 추론 서버와 트레이싱 백엔드가 같이 들어가는데, 셋은 교체 주기도 의사결정 주체도 다르다.원저자가 2024년 3월 기준 별 500개 이상 AI 저장소 896개를 집계했을 때 폭증한 쪽은 애플리케이션 계열이었고, 인프라 증가폭은 완만했다. .. 2026. 9. 16.
LLM 에이전트와 추론 모델의 구조 "에이전트"라는 단어가 API를 한 번 호출하는 스크립트부터 서브에이전트 수십 개를 병렬로 돌리는 시스템까지 전부를 가리키면서 설계 논의가 겉돈다. 이 글은 단일 호출과 에이전트를 가르는 기준을 도구 사용, 상태, 루프, 종료 조건 네 축으로 고정하고, 추론 모델이 test-time compute를 늘려 성능을 얻는 방식이 CoT 계열 프롬프팅과 어떻게 갈라지는지 정리한다. 검색 제품에 LLM 파이프라인을 얹거나 사내 GPU에 모델을 올려 서빙하는 쪽을 독자로 상정했다.단일 호출과 에이전트를 가르는 네 축Anthropic의 정의가 가장 실용적이다. 워크플로는 LLM과 도구가 미리 정의된 코드 경로로 조율되는 시스템이고, 에이전트는 LLM이 자신의 프로세스와 도구 사용을 동적으로 결정하며 작업 수행 방식에.. 2026. 9. 12.
하이퍼그래프 기반 지식 표현과 검색 지식 그래프를 검색 파이프라인에 붙여본 사람은 (h, r, t) 삼중항이 실제 문서의 사실을 담기에 좁다는 것을 안다. 이 글은 이항 관계 전제를 n항으로 확장하는 하이퍼그래프 표현, 하이퍼엣지 임베딩과 링크 예측 모델, 하이퍼그래프 신경망의 연산 정의, 그리고 이 구조를 RAG 인덱스로 썼을 때 얻는 것과 치르는 비용을 정리한다. 검색 인덱스나 RAG 파이프라인을 직접 설계하는 쪽을 독자로 상정했다.삼중항 스키마가 무너지는 지점"어떤 연구자가 2019년에 특정 기관에서 박사 학위를 받았다"는 사실 하나에 엔티티가 넷이다. 삼중항 스키마로 이걸 담으려면 reification을 쓴다. 사실 자체를 노드로 승격시키고 참여자를 그 노드에 이항 에지로 매다는 방식이다. 스키마는 지킨 셈이지만 임베딩 학습이 망가.. 2026. 9. 9.
MRC부터 Text-to-SQL까지 NLP 태스크 지도 다시 그리기 MRC, STS, Open IE, 기계번역, Text-to-SQL, 문서 이해는 서로 다른 커뮤니티에서 자란 태스크다. 모델 아키텍처를 걷어내고 입력과 출력, 채점 방식만 남기면 어디가 같고 어디가 다른지 선명해진다. 한국어 벤치마크의 설계 결정과 LLM 이후의 재편까지 같이 본다. NLP 모델을 제품에 붙이거나 평가 셋을 골라야 하는 쪽을 독자로 상정했다.입출력과 채점 방식으로 나눈 지도태스크입력출력주 지표대표 벤치마크Extractive MRC질문 + 지문지문 내 spanEM, F1SQuAD, KorQuADGenerative MRC질문 + 문서 집합자유 텍스트ROUGE, 사람 평가MS MARCOMulti-hop MRC질문 + 다중 문서span + 근거 문장supporting fact F1HotpotQA.. 2026. 9. 5.
RAG 파이프라인의 실패 지점 검색 품질 지표를 올렸는데 최종 답변 정확도는 그대로이거나 오히려 떨어진 경험이 있다면, 이 글이 그 간극을 설명한다. top-k를 키우고 임베딩 모델을 바꾸는 수준의 튜닝이 어디서 멈추는지, GraphRAG와 LightRAG 계열이 벡터 검색의 어떤 부분을 겨냥하는지 정리했다. RAG를 데모 단계 너머 운영 서비스로 굴려본 사람을 독자로 상정한다.무관한 문서가 정확도를 올리는 구간Cuconasu 등이 SIGIR 2024에서 발표한 실험은 RAG 설계의 기본 가정을 흔든다. 문서를 골드, 관련, 방해, 무작위로 나눈 뒤 프롬프트 구성을 바꿔가며 정확도를 쟀다. 방해 문서는 쿼리와 의미적으로 가깝지만 답을 담고 있지 않은 문서다. 나폴레옹 말의 색을 물었을 때 조제핀의 말 색을 서술한 문단이 여기 해당한다.. 2026. 9. 5.
728x90