Posts
총 16개의 글
jikji: 에이전트의 파일 탐색 비용을 줄이는 로컬 인덱스
에이전트가 로컬 파일을 찾을 때 ls·find·grep으로 트리를 반복해서 훑는 대신, 미리 만들어둔 로컬 인덱스에서 단 한 번의 find 호출로 후보 슬레이트를 받게 해주는 jikji를 살펴본다. 임베딩·벡터 DB·RAG 없이 결정론적 시맨틱 검색을 하고, HWP·PDF부터 이미지·영상까지 내용 기반으로 찾는다. Rust CLI 기반 비파괴 도구로 원본은 건드리지 않고 .jikji/ 아래에 인덱스·문서 텍스트 캐시·에이전트 맵·지식 그래프를 만든다. 직접 돌려 prepare 비파괴성과 find --json 근거 팩을 확인했다.
MinSync: 파일이 바뀐 만큼만 다시 인덱싱하고, 청커로 그 비용을 좌우하기
MinSync는 git 없이 manifest로 파일 변경을 추적해 바뀐 청크만 다시 청킹·임베딩하고 로컬 LanceDB 인덱스를 최신 상태로 유지하는 단일 Rust CLI다. 테스트 결과 재임베딩 비용을 가른 건 청커 선택이었고, 같은 상단 삽입에서 recursive 111% vs cdc 27%로 갈렸다.
Braincrew Tech 블로그를 시작합니다
Braincrew의 응용 AI 엔지니어링 기록을 공유하는 공식 기술블로그입니다.
Braincrew의 일하는 방식
수평적 협업과 실험 중심 문화 — Braincrew Culture 카테고리의 첫 글입니다.
agentdir: 원본은 그대로 두고 에이전트에게 작업하기 좋은 파일 구조를 따로 만들어주기
정리 안 된 원본 폴더는 그대로 두고, 에이전트에게는 목적에 맞게 재배치한 읽기 전용 가상 파일 트리를 만들어주는 agentdir를 살펴본다. CoW 파일시스템에서는 대용량 데이터셋을 여러 레이아웃에 노출해도 추가 디스크가 거의 들지 않고, 가상 뷰는 0o444로 읽기 전용이 된다.
SEISMIC: Learned Sparse Retrieval을 위한 효율적 역색인 구조
SIGIR 2024 논문 리뷰 — LSR 벡터의 Concentration of Importance를 활용하여 기존 대비 100배 이상 빠른 근사 검색을 달성하는 SEISMIC 알고리즘
The Effect of Dynamic Date Injection Methods on LLM Temporal Reasoning across Deictic Expression Granularities
LLM은 "어제", "다음 주"와 같은 상대적 시간 표현을 해석할 때 현재 날짜를 알 수 없어 날짜 주입이 필수입니다. 320회의 실험 결과, **한국어 형식(`2025년 3월 19일`) + User Prompt 조합**이 Simple/Structured 모두에서 95
Docker Log Monitor vs Sentry 비교 분석
Docker Log Monitor는 설치가 간단하고 비용이 들지 않으며 코드 수정 없이 즉시 사용 가능한 반면, Sentry는 풍부한 에러 컨텍스트와 분석 도구를 제공하지만 SDK 통합과 비용이 필요합니다. LG Electronics Agent 프로젝트의 경우, 이미
Docker Log Monitor 적용 가이드라인
EC2 환경에서 Docker 컨테이너 로그를 실시간 모니터링하고 에러 발생 시 Slack으로 알림을 보내는 경량 모니터링 시스템 구축 경험을 공유합니다. Sentry 같은 무거운 솔루션 대신, Python 기반의 간단한 스크립트로 실시간 로그 감지, 중복 알림 방지,
Which tabular format RAG Process understands very well?
RAG 파이프라인에서 테이블 데이터의 포맷이 검색 성능에 미치는 영향을 실험한 결과, Markdown Key-Value 형식이 가장 높은 Recall을 보였으며, TOON 포맷은 토큰 효율성 측면에서 가장 우수했습니다. AIHub의 표 정보 질의응답 데이터 50개를 7
메모랜덤 flow에 사용된 문서영역별 Clustering 성능평가
GS Caltex 메모랜덤-연구노트 매칭 프로젝트에서 PyMuPDF 기반 파서, Titan Embed V2 임베딩, ChromaDB 벡터 검색, Claude Sonnet 4.5 LLM 판정을 결합한 파이프라인을 구축했습니다. 137개 연구노트 중 82.5%가 메모랜덤과
근사 최근접 탐색(ANN) 오차와 데이터 분포 밀도의 관계 고찰
RAG 시스템에서 n_results는 단순히 '반환할 결과 개수'가 아닌 '검색 반경(search radius)'을 의미합니다. ANN 알고리즘의 근사 특성으로 인해 작은 n_results 값은 진짜 근접 벡터를 놓칠 수 있으며, 특히 고밀도 데이터 분포와 추상적 쿼리
IBK기업은행 여신 승인신청서 작성 업무 효율화
여신 승인신청서 및 심사보고서 자동 작성을 위한 생성형 AI 기반 RAG PoC를 구축하여 복잡한 금융 문서 작성 업무를 효율화한 사례입니다.
LG전자 라이프로그 기반 개인화 AI 어시스턴트 구축
일상 활동 데이터를 그래프 기반 하이브리드 검색으로 연결하여 사용자 맥락을 이해하고 자연어 질문에 답변하는 AI Agent PoC를 구축한 사례입니다.
MLflow 기술 검토(RAG 성능 실험 테스트베드 기능)
MLflow는 전통적인 ML과 LLM 애플리케이션의 전체 생명주기를 관리할 수 있는 오픈소스 통합 플랫폼입니다. LangGraph 기반 RAG Agent 개발 시 Tracking으로 하이퍼파라미터와 메트릭을 관리하고, Tracing으로 복잡한 LLM 호출 흐름을 추적하
LLM이 가장 잘 이해하는 Table Format에 대한 평가실험
재무제표 데이터를 LLM에 전달할 때 데이터 포맷에 따라 성능과 비용이 크게 달라집니다. 11가지 포맷을 비교한 결과, TSV(tab-separated) 포맷이 정확도 100%, 최소 토큰 사용(7,192개), 최단 응답시간(8.24초)으로 모든 지표에서 최고 성능을