llm 18

17. 상품 핫딜 헌팅 에이전트 (1) - 파인튜닝 모델 서비스화 및 가격 예측 에이전트 개발

목차0. 들어가며1. 7개 에이전트(agent)의 협업 - Week 8에서 만들려는 에이전트 시스템2. 파인튜닝 모델을 클라우드 GPU에서 실행 - Modal 이용3. 잠깐 떴다 사라지는 앱에서 배포된 서비스로 - 파인튜닝 모델 서비스화4. 첫 번째 에이전트 - SpecialistAgent, 그리고 전처리가 필요한 이유5. 학습이 아니라 추론(inference)에서 승부 - 상품 80만 개를 벡터 DB로6. 두 번째 에이전트 - GPT-5.1에게 RAG를 통해 비슷한 상품 5개를 쥐여주기7. 세 번째 에이전트와 앙상블 에이전트 - 셋을 섞으면 정말 더 좋아질까마무리 - 성적표가 또 뒤집혔다0. 들어가며지난 글(글 16)에서 나온 가격 예측 모델 성능 비교는 꽤 놀라웠다.3B(30억) 파라미터짜리 오픈소스..

AI 공부 2026.08.02

16. 3B 오픈소스 모델(Llama 3.2)로 GPT-5.1 이겨보기 — QLoRA 파인튜닝 실전

목차들어가며1장. 학습을 좌우하는 5개 하이퍼파라미터2장. 잠깐 복습 — QLoRA 5개 하이퍼파라미터3장. 학습은 실제로 어떻게 일어나는가 — 학습 4단계와 backpropagation4장. SFTTrainer로 실제 학습 돌리기 — 그리고 wandb 곡선 읽기5장. 오버피팅 관찰기 — train loss가 좋아 보일 때가 더 위험하다6장. LLM은 "숫자를 빼지 않는다" — cross-entropy와 128k 확률분포7장. 최종 평가와 전체 성적표 — 작은 모델이 프론티어를 이긴다마무리 — 파인튜닝은 만능인가 들어가며지난 글(글 15)에서는 실제 모델 학습을 거의 하지 않았다.대신 모델 학습을 시작하기 전에 알아야 할 것들을 파악해보는 시간을 가졌다.- 왜 3B(30억) 파라미터를 그냥 학습할 수 ..

AI 공부 2026.07.11

15. LoRA·QLoRA 원리 파악 — Llama 3.2 파인튜닝 준비하기

목차들어가며1. 이번엔 오프소스 모델을 직접 파인튜닝한다2. 3B(30억) 파라미터 모델을 그냥 학습 못하는 이유 3. LoRA - 원본은 얼리고(freeze), 작은 어댑터만 학습 4. QLoRA의 Q - 양자화로 4비트까지 줄이기 5. LoRA 어댑터는 실제로 얼마나 작을까 6. 학습데이터 만들기 - 프롬프트 설계 7. 파인튜닝 전, 베이스 모델은 얼마나 못할까마무리 들어가며지난 글 2편 - https://doobeom-coding.tistory.com/90- https://doobeom-coding.tistory.com/91 에서 나는 GPT-4.1-nano를 데이터로 파인튜닝을 해보는 작업을 진행하고, 이를 통해 상품 설명을 기반으로 가격을 예측해보는 작업을 진행했다. 결과는 좀 허무했다. 아무 ..

AI 공부 2026.06.28

14. 내 데이터로 GPT를 파인튜닝하면 더 똑똑해질까 - 가격 예측 모델 실험기

목차0. 들어가며1. 모델 간 성능 비교를 위한 기준 설정2. 베이스라인부터 전통 머신러닝까지3. 딥러닝 - 신경망으로 한 단계 더4. 학습 없이 이긴다 - 제로샷 프론티어 모델5. 프론티어 모델을 직접 파인튜닝해보다6. 의외의 결과, 그리고 그게 알려주는 것7. 마무리 - 전체 성적표와 다음 이야기 0. 들어가며지난 글에서는 Week 6 프로젝트 - 상품 설명 기반 가격 예측 (THE PRICE IS RIGHT)의 앞부분 데이터 전처리를 다뤘다.아마존 상품 데이터를 긁어와 정제하고, 학습 80만 / 검증 1만 / 테스트 1만 건의 데이터셋을 만들어 허깅페이스 허브에 올리는 데까지가 지난 글의 내용이었다.이번 글은 정제한 데이터를 기반으로(1) 전통 머신러닝부터(2) 딥러닝과 제로샷 프론티어 모델(3) ..

AI 공부 2026.06.06

12. RAG의 한계를 어떻게 깰까 — Advanced RAG (Semantic Chunking·Reranking·Query Rewriting 등)

목차0. 들어가며1. Advanced RAG로 - 10가지 개선 기법2. 개선 ① - LLM 기반 지능형 청킹3. 개선 ② - Reranking4. 개선 ③ - Query Rewriting5. 최종 파이프라인 - 모두 합치기6. 마무리 0. 들어가며지난 글에서 RAG 평가 시스템을 만들고, 기본 RAG의 한계를 점수로 정량화했다.요약하면 이렇다.- 검색 메트릭(MRR / nDCG / Keyword Coverage)에서 전반적으로 점수가 낮고, 특히 spanning·holistic 카테고리가 약했다.- 답변 메트릭에서 풀네임 누락 같은 completeness 문제가 잡혔다.- 청크 크기·임베딩 모델만 바꾸는 단순 튜닝으로는 이 한계를 못 깬다는 결론이었다.이번 글에서는 이 한계를 깨기 위한 본질적 개선, ..

AI 공부 2026.05.09

11. RAG, 잘 만들었는지 어떻게 알지? — RAG 평가 시스템 구축 (테스트셋 구축 및 검색/답변 평가 진행)

목차0. 들어가며1. 평가가 전부다 (Evaluations are Everything)2. 골든 테스트셋 만들기3. 검색 평가 메트릭 (Retrieval Evaluation)4. 답변 평가 메트릭 (LLM-as-a-Judge)5. 평가 결과로 본 한계6. 1편 마치며0. 들어가며지난 글에서 가상의 보험회사의 사내문서를 기반으로 답변을 할 수 있는 Rag챗봇을단순 키워드 매칭 방식부터 LangChain 기반 RAG까지 만들어봤다.그 과정에서 마지막에 한계를 볼 수 있었다. (복합질문에 답변이 어려운 것, 각 청크에 해당 인물의 풀네임이 적혀있진 않아서 답변에서도 풀네임을 갖고 오지 못한 것 등) 이번 글은 이런 RAG의 한계를 극복하기 위한 방법을 고민해나가는 글이고 1가지 질문에서 출발한다."근데 RAG..

AI 공부 2026.05.09

10. LLM이 우리 회사 문서를 읽고 답하게 하려면? — 키워드 매칭에서 임베딩·벡터 DB·LangChain으로 확장해본 RAG 구현기

목차1. RAG는 왜 필요한가2. 단순 RAG ( 벡터 DB 없이 문자열 매칭을 통한 구현)3. 벡터 임베딩(Vector Embedding) 이해하기4. 문서를 벡터 DB에 넣기5. LangChain으로 기본 RAG 파이프라인 완성6. RAG의 한계 — 개발한 챗봇을 돌려보니 드러난 문제들7. 마무리 “LLM이 우리 회사 내부 문서를 기반으로 답변하게 만들 수 있을까?”이번 글에서는 이 질문을 출발점으로 삼아, 키워드 매칭 기반 검색에서 시작해 벡터 임베딩 검색과 LangChain 파이프라인까지 RAG의 기본 흐름을 직접 구현해봤다.직접 만들어보고 돌려보면서, RAG 작동방식에 대한 이해와, 또 실제 적용 시 어디서 한계가 드러나는지도 함께 살펴봤다. 1. RAG는 왜 필요한가1) LLM 프롬프트를 향상..

AI 공부 2026.04.19

9. LLM 평가(Evaluation) - 벤치마크·리더보드 정리부터 9개 모델 Python -> C++ 포팅 실험까지

목차 1. 주요 벤치마크와 벤치마크의 한계점 2. 주요 리더보드 사이트3. 프론티어 모델별 코드 생성능력 (Python to C++ 포팅 성능 비교)4. 오픈소스 모델 포함 생성능력 비교 ( Python to C++ 포팅 성능 비교, w/ Gradio UI)5. 생성형 AI 솔루션 성능 평가를 어떻게 할 것인가? 이번 글은 모델 평가(Evaluation) 관련 챕터를 공부했던 글로 1) 주요 벤치마크들과 리더보드 사이트에 대해 공부해 본 내용 2) 실제로 다양한 closed 모델, open source 모델들의 성능을 코드 생성능력 task를 직접 시켜보며 비교해 본 내용 을 작성해보고자 한다. 1. 주요 벤치마크와 벤치마크의 한계점 1) 주요 벤치마크1)- 1. 6개 벤치마크 등장 배경 MMLU,..

AI 공부 2026.04.12

8. print(model) 한 줄로 Transformer 구조 이해해보기 (feat. Llama-3.2-1B)

목차 1. print(model) 한 줄로 Transformer 구조 이해해 보기 (feat. Llama-3.2-1B)- 0) 전체 흐름 요약- 1) Embedding Layer- 2) Decoder Layers (총 16개)- 3) Final RMSNorm- 4) LM Head (출력층)- 5) 전체 흐름 재정리- 6) 느낀점 1. print(model) 한 줄로 Transformer 구조 이해해 보기 (feat. Llama-3.2-1B)Llama-3.2-1B 모델을 print(model) 했을 때 나오는 내부 레이어 구조를 출력해본 뒤,출력 결과물을 통해 Transformer 구조 속 요소를 하나하나 가볍게 뜯어볼 수 있었다. 이렇게 하나하나 뜯어본 요소들에 대해 적어본다. 0) 전체 흐름 요약 모..

AI 공부 2026.03.29

7. LLM 양자화(Quantization): 원리부터 코드까지 - GPU 메모리는 왜 4배 줄어들까?

목차 1. LLM 파라미터는 왜 “숫자”일까?2. 양자화(Quantization)3. 양자화 유형4. 코드로 보는 양자화5. 배운 점/느낀 점 Day 14 - 양자화 (Quantization) 1. LLM 파라미터는 왜 “숫자”일까?1) 핵심 요약LLM의 모든 파라미터(weight)는 실수(float) 값보통:학습: float32 / bfloat16추론: float16 / int8 / int4이유:정밀도 vs 메모리/속도 트레이드오프 2) LLM 파라미터는 왜 실수(float)인가?예: (Llama 3 70B → 파라미터 700억 개)LLM 내부에는 여러 개의 파라미터(가중치)가 있다.모든 파라미터는 실수로 저장된다:예시:W = 0.12837b = -0.05392... ✔ 신경망은 모든 계산이 “행렬..

AI 공부 2026.03.22