전체 글 63

LLM Wiki에 대하여

LLM Wiki - RAG를 넘어선 지식 축적 방법론Andrej Karpathy가 2026년 4월 공개한 아이디어 파일 "Obsidian is the IDE; the LLM is the programmer; the wiki is the codebase" 🚀 LLM Wiki란?📌 등장 배경대부분의 개발자들이 LLM과 문서를 함께 사용하는 방식은 RAG(Retrieval-Augmented Generation) 패턴이다.문서를 일정한 크기로 나누고, 임베딩을 생성해 벡터 데이터베이스에 저장한 뒤, 사용자의 질문과 유사한 문서를 검색하여 LLM에 전달하는 방식이다. RAG는 매우 유용한 구조이지만 한계점들이 존재한다.🔸 RAG는 매번 질문할 때마다 지식을 처음부터 재발견한다.🔸 지식의 축적이 없다.🔸..

HiRAG (Retrieval-Augmented Generation with Hierarchical Knowledge)

지난 포스트에서는 CAG와 KAG에 대해서 살펴보았다.이후 나온 연구로 HiRAG가 있는데, 이에 대한 논문을 살펴보고 KAG와의 차이점을 알아보고자 한다. 📌 HiRAG (Retrieval-Augmented Generation with Hierarchical Knowledge) 🔸 출처 : https://arxiv.org/pdf/2503.10150🔸 코드 : https://github.com/hhy-huang/HiRAG GitHub - hhy-huang/HiRAG: [EMNLP'25 findings] This is the official repo for the paper, HiRAG: Retrieval-Augmented Generation wit[EMNLP'25 findings] This is t..

CAG(Cache Augmented Generation) 와 KAG (Knowledge Augmented Generation)

🚀 들어가기 앞서 품목 분류 체계를 만들고, AI를 활용해 자동 품목 체계 매핑 시스템을 구축을 하기 위해서는 임베딩 값을 활용한 검색이 필요하다. (시스템에 대한 자세한 내용은 https://raeul0304.tistory.com/81 을 참고)이를 위해서는 RAG를 구축해야하는데, 온톨리지 기반의 데이터를 잘 검색하기 위해 어떤 RAG가 효과적일지를 살펴보고자 한다.따라서 이번 포스트에서는 CAG, KAG에 대해 정리하였고, 다음 포스트에서 HiRAG, MultiHop-RAG 에 대해 정리하고자 한다. 📌 CAG (Cache-Augmented Generation)CAG는 LLM의 확장된 컨텍스트 메모리를 활용하여 사전 로드된 지식을 캐시(Cache)에 저장하고 이를 추론 시 활용하는 방식이다...

[OCR/VLM 기반 비정형 문서 자동 구조화] 1. 프로젝트 개요 & 아키텍처 설계

📌 왜 만들었나 장비에서 추출되는 PDF 파일에는 여러 실험 결과 테이블이 존재하는데,장비마다 레이아웃이 다르고 이를 수기로 입력을 해야할 때 많은 인력/시간 비용이 들어감과 동시에 human error로 인한 문제가 발생하고 있어 이를 해결하기 위한 시스템이 필요하다고 하셨다. 장비마다 추출되는 레이아웃은 비교적 고정적이지만,이걸 어느정도 솔루션화 해서 범용적으로 사용될 수 있는 것을 원하시는 듯 했다. 초반에 우리 부서는 로컬 OCR 모델들은 다양한 테이블의 형태들을 모두 커버하기에 무리가 있어 (그리드가 없거나, 값이 여러 행을 걸쳐 있을 경우, 혹은 주변에 메타데이터가 많을 경우) openai를 사용해 테이블 데이터 추출을 했다. (프롬프트는 아래 공유해두겠다)하지만 장당 약 15원 정도의 비용..

Work/OCR-VLM 2026.04.20

[Dacon] [시계열 기초] 2. 예제를 통한 패턴 분석

이번 장에서는 여러 예제를 통한 패턴 분석을 해볼 예정이다. 🚀 1. 월별 패턴 분석을 통한 계절성 발견 🔻 주요 학습 목표 ▪️시계열 데이터에서 계절성의 개념을 이해하고, 월별 택시 수요 패턴을 통해 실제 계절성을 확인한다.▪️pandas.resample() 함수를 활용해 시간 단위별(월별) 데이터 집계 방법을 익히고, 시계열 데이터의 주기적 패턴을 수치적으로 분석할 수 있다.▪️ matplotlib을 사용한 막대그래프 시가고하 기법을 익히고, 월별 데이터의 변화 추이를 직관적으로 표현하여 계절성 패턴을 시각적으로 발견할 수 있다.▪️시계열 데이터에서 최댓값, 최솟값, 변동폭을 계산하고 해석하여 계절성의 강도와 특성을 정량적으로 평가할 수 있다. 🔻 월별 집계와 막대그래프 🔸 resample(..

[Dacon] [시계열 기초] 1. 시계열 데이터 및 프로젝트 개요

1. 시계열 분석 프로젝트 개요 🚀 학습 목표 ▪️ 택시 수요 예측 프로젝트의 목표를 이해하고, 입력 변수(Feature)와 예측 대상(Target)의 개념을 정리할 수 있다.▪️ 프로젝트에서 제공되는 데이터셋(train.csv, test.csv, sample_submission.csv)의 구조와 용도를 구분하여 설명할 수 있다.▪️ 시계열 데이터의 특징(시간 순서, 패턴, 추세, 변동성)을 이해하고, 일상 속 사례(택시 수요)를 통해 개념을 연결할 수 있다.▪️ 이번 프로젝트의 성능 평가 지표인 SMAPE의 의미를 이해하고, 오차를 줄이는 것이 왜 중요한지 설명할 수 있다. 📌 1. 시계열 데이터란?"오늘 오후 5시에 택시를 탈 사람이 몇 명이나 될까?""다음 주 금요일 저녁에는 택시를 몇 대..

Django + DRF + SimpleJWT로 Authentication 기능 구현 정리

1. 인증(Authentication)과 인가(Authorization) 개념 정리📍 Authentication (인증) ▪️ 사용자가 누구인지 확인하는 과정▪️ ex. 아이디/비밀번호 로그인, 토큰 검증 📍 Authorization (인가) ▪️ 인증된 사용자가 어떤 리소스에 접근할 수 있는지 판단▪️ ex. 로그인한 사용자만 특정 API 호출 가능 2. 왜 JWT(Json Web Token)를 사용하는가?🔻 기존 Session 기반 인증의 한계 ▪️ 서버 메모리에 세션 저장▪️ 확장성(Scale-out)에 불리▪️ REST API와 궁합이 좋지 않음 🔻 JWT 기반 인증의 장점 ▪️ Stateless (서버 상태 저장 x)▪️ 모바일 / 웹 / 외부 서비스 연동에 적합▪️ API 서버 ..

Work/Django 2026.02.05

[Bookflow] Neon DB를 통한 클라우드 DB 설치하기

✨ 로컬 PostgreSQL 지옥 탈출기– 왜 나는 Neon DB + Django 조합으로 갈아탔나 (feat. 여러 노트북, 어디서나 접속) “왜 회사 DB는 다들 각자 노트북에서 잘만 붙는데, 내 PostgreSQL은 이 노트북에서만 되지…?"이 생각으로 며칠을 헤매다가, 결국 Neon DB + Django 구조로 갈아탄 기록이다.중간에 pg_hba.conf, DJANGO_SETTINGS_MODULE, .env 비밀번호 삽질까지 다 했으니,혹시 나랑 비슷한 상황이라면 이 글 한 번 쭉 읽고 시간 아끼길… 1. 문제 시작: “하나의 DB를 여러 노트북에서, 어디서나 쓰고 싶다”처음에는 로컬에 PostgreSQL 깔고 이렇게 생각했다.“이 노트북에 DB 만들고”“DBeaver로 붙어서 개발하면 되..