728x90 전체 글90 논문 리뷰를 LLM에 맡길 때의 프롬프트 설계 논문 PDF를 붙여넣고 리뷰해달라고 하면 대개 요약이 돌아온다. 강점 세 개, 약점 두 개, 그리고 3점. ARR 리뷰 폼을 프롬프트 스키마로 옮기고 근거 좌표를 강제하면 이 붕괴가 줄어든다. 투고 전 자체 점검과 rebuttal 준비에 LLM을 쓰는 연구자용이다. 배정받은 리뷰를 대신 쓰는 용도는 아니다. ARR 가이드라인은 리뷰어가 논문을 직접 읽고 논증을 스스로 쓸 것을 요구한다. 프라이버시가 보장되지 않는 생성형 도구에 심사 중인 원고를 올리는 행위도 막는다.요약으로 무너지는 이유루브릭 없는 리뷰 요청의 출력은 본문 압축이다. 사전학습 코퍼스에서 논문에 붙어 있는 텍스트는 초록과 서베이 문단이 압도적이고 실제 리뷰는 비공개다. 기댈 분포가 요약 쪽으로 기울어 있다. Liang 등의 분석에서 GPT.. 2026. 10. 7. RLHF와 DPO, 선호 학습의 두 갈래 선호 데이터로 모델을 튜닝해본 사람이라면 RLHF와 DPO 중 무엇을 고를지 한 번쯤 고민한다. 이 글은 보상 모델과 PPO로 이뤄진 RLHF 파이프라인을 분해하고, DPO가 보상 모델을 폐형식 해로 흡수하는 유도를 식 단위로 따라간 뒤, IPO, KTO, ORPO, GRPO 계열의 위치를 정리한다.RLHF 파이프라인 분해InstructGPT가 정리한 3단계가 지금도 표준이다. 시연 데이터로 SFT를 돌리고, 같은 프롬프트의 여러 출력에 사람이 순위를 매겨 보상 모델을 학습하고, 그 보상 모델로 정책을 강화학습한다. 1.3B InstructGPT 출력이 175B GPT-3 출력보다 선호됐다는 결과가 이 파이프라인의 근거다.보상 모델은 Bradley-Terry로 세운다. 프롬프트 $x$, 선호 응답 $y_.. 2026. 10. 3. 인과추론과 표현 학습 상관과 인과를 가르는 형식적 기준이 딥러닝 표현 학습과 텍스트 인과 추출까지 어떻게 내려앉는지 정리한다. 검색 로그로 "무엇이 성능을 올렸는가"를 주장해야 하는 개발자를 염두에 뒀다.두 계보potential outcome 계보는 처치와 결과만 놓고 시작한다. 비타민 C 섭취를 $X$, 건강 여부를 $Y$라 하고 $X=1$일 때의 $Y$값을 $C_1$, $X=0$일 때의 $Y$값을 $C_0$으로 두면 인과 효과는 $E(C_1) - E(C_0)$이다. 실제 계산되는 양은 $E(Y \mid X=1) - E(Y \mid X=0)$이다. 4명짜리 예제 표를 채워 보면 후자는 1, 관측되지 않은 결과까지 아는 상태로 계산한 전자는 0으로 나온다. 완벽한 연관이 보이는데 인과 효과는 없다. 개체 하나에서 $C_1$과.. 2026. 9. 30. 머신러닝에 필요한 수학 최소 집합 선형대수, 최적화, 확률에서 모델 학습에 실제로 호출되는 부분만 추린다. 교과서 목차 대신 학습 루프의 어느 줄에서 그 정리가 쓰이는지를 기준으로 배치했다. 랭커나 임베딩 모델을 직접 학습시키고 서빙까지 책임지는 사람이 독자다.벡터 공간과 고유값 분해행렬을 데이터 테이블로 읽는 습관을 버려야 나머지가 풀린다. 행렬은 벡터 공간 사이의 선형 사상이고, 고유벡터는 그 사상이 방향을 바꾸지 못하는 축이다.$$\begin{gathered}A = V \Lambda V^{-1}, \quad \Lambda = \operatorname{diag}(\lambda_1, \dots, \lambda_n) \\A = A^{\top} \;\Longrightarrow\; A = Q \Lambda Q^{\top}, \quad Q^{.. 2026. 9. 26. 머신러닝 핵심 개념 정리 검색 랭킹 모델이나 문서 분류기를 붙이다 보면 알고리즘 이름보다 판단 기준이 아쉬울 때가 많다. 손실 함수, 정규화, 편향-분산, 교차 검증, 하이퍼파라미터 탐색을 어떤 상황에서 무엇으로 고르는지 기준 중심으로 정리한다. 지도 학습과 비지도 학습, 딥러닝을 한 축에 놓았다. 이미 몇 번 학습을 돌려보고 다음에 무엇을 손댈지 고민하는 쪽을 상정했다.손실 함수와 분포 가정손실수식쓰이는 곳최소제곱$\frac{1}{2}(y-z)^2$선형 회귀로지스틱$\log(1 + e^{-yz})$로지스틱 회귀힌지$\max(0,, 1-yz)$SVM교차 엔트로피$-[y \log z + (1-y) \log(1-z)]$신경망 분류네 손실이 따로 노는 것처럼 보여도 GLM이라는 한 틀에 들어간다. 지수족 $p(y;\eta) = b(y.. 2026. 9. 23. 국내외 전산학 학회 지형과 논문 검색 검색엔진 제품을 만들면서 대학원 과정을 병행하면 학회 달력이 곧 업무 달력이 된다. 어느 학회가 어떤 성격이고 마감이 언제 걸리는지, 선행 연구를 어디서 훑는지, 국내 학술대회 프로시딩이 해외 컨퍼런스 원고와 무엇이 다른지를 정리했다. 투고를 준비하는 대학원생과 사내 실험 결과를 논문으로 남겨보려는 개발자를 염두에 뒀다.해외 학회 지형NLP 쪽 축은 ACL, EMNLP, NAACL 세 곳이고 셋 다 ARR이라는 공용 리뷰 파이프라인 위에 얹혀 있다. 검색과 랭킹이면 SIGIR이 1순위, 로그 기반 추천이나 대규모 그래프는 KDD와 WWW, 그 아래로 CIKM과 WSDM이 붙는다. 방법론 자체를 파는 논문은 NeurIPS, ICML, ICLR로 간다. AAAI는 응용 트랙 비중이 높아 현장 결과물을 넣기가.. 2026. 9. 19. 이전 1 2 3 4 ··· 15 다음 728x90