$ cat wiki/concepts/llm-knowledge-bases.md
LLM 지식 베이스 (LLM 이 관리하는 개인 위키)
concept갱신 2026-08-31생성 2026-05-16
정의
LLM 을 활용해 지속적으로 누적·구조화되는 개인 또는 팀 지식 베이스를 유지하는 패턴. 매 query 마다 처음부터 합성하는 RAG 와 달리, 정리·교차참조·유지보수 자체를 LLM 이 수행하여 지식이 페이지에 영구화됨.
대표 구현: Karpathy LLM-wiki gist — markdown 파일 트리 + ingest/query/lint 워크플로우.
왜 중요한가
- 본 시스템의 메타-원리.
CLAUDE.md가 이 패턴의 구체적 적용. - RAG 의 근본 한계 ("매 질의마다 재발견, 누적 없음") 해결 시도
- Vannevar Bush 의 1945 Memex 구상 — "누가 유지보수하나" 문제를 LLM 이 풀이
현재 수준 (2026-08)
- 이 패턴이 처음으로 어블레이션을 얻었고, 그 대상은 사람이 읽는 위키가 아니다 — WikiSkill: Compiling Agent Experience into Persistent Knowledge for Skill Evolution (arXiv 2026-08-27) 은 WikiSkill 을 만든다. 원시 실행 경험, 스스로 wiki 라 부르는 축적된 지식 베이스, 실행 가능한 스킬을 분리한 뒤 스킬과 wiki 를 함께 진화시킨다. 어블레이션은 wiki 에서의 지속적 축적이 스킬 진화가 작동하는 데 결정적이라고 보고하며, 이는 이 페이지가 자신의 중심 전제에 대해 보유한 최초의 측정된 근거다. 지금까지 그 전제는 Andrej Karpathy 의 서술과 이 프로젝트의 실천에만 기대고 있었다 (source)
- 그 발견 중 둘은 아래 열린 문제에 직접 닿는다. 진화된 스킬은 모델과 모델 계열을 넘어 이전되고, 다른 모델이 진화시킨 스킬이 그 모델의 자기 진화 스킬을 이길 수 있다 — 축적된 아티팩트가 사적 자산이 아니라 옮길 수 있는 자산이라는 뜻이며, 스키마의 "portability first" 원칙이 미학이 아니라 실질을 지닌다는 이 페이지에서 가장 강한 논거다. 별도로, 스킬을 갖춘 작은 모델이 스킬 없는 훨씬 큰 모델을 능가할 수 있다는 결과는 아래 토큰 비용 문제를 다시 규정한다. 위키는 읽는 비용일 뿐 아니라 모델 크기를 대신할 수도 있다
- 정리되지 않은 부분. 논문 초록은 벤치마크도, 모델도, 수치도 명시하지 않으므로 위 어느 것도 정량화되어 있지 않고, "대부분의 모델-벤치마크 조합에서 능가한다"는 표현은 논문 자신의 유보다. 철회, 모순 처리, 크기 상한에 대한 서술도 없다 — 즉 축적이 작동한다는 것을 측정했을 뿐 축적이 퇴화하는 경우에는 침묵하며, 그것이 바로 이 프로젝트가
placeholder-check.py와 주간 lint 로 막으려는 실패다
현재 수준 (2026-07)
- 패턴이 주류가 됐다 — Andrej Karpathy의 "두 번째 뇌" 글이 2026-07-11 무렵 2,100만 조회에 도달하며 LLM 위키라는 발상을 전문가 영역에서 자리 잡은 패러다임으로 옮겼다(Weekly Synthesis — 2026-W28 (2026-07-06 ~ 2026-07-12)). 이 사이트가 바로 그 패턴을 구현한 것이며, 여기서 읽을 것은 파생 구현이 뒤따르고 아래의 열린 문제들이 더는 가정이 아니게 된다는 점이다
- 그 사이 몇 달이 더한 것은 개념이 아니라 운영이다. 이 페이지가 열린 문제로 적어 둔 유지보수 부담은 이제 짐작이 아니라 측정된다 — 이 프로젝트 스키마가 기술하는 커버리지·구조 검사를 보라
현재 수준 (2026)
- Karpathy 의 LLM-wiki gist (2026-04) — 3-layer (Raw sources / Wiki / Schema), markdown + frontmatter, ingest/query/lint 사이클
- Karpathy 자신: "a large fraction of my recent token throughput is going less into manipulating code, and more into manipulating [knowledge]"
- 도구 생태계: Obsidian (그래프 뷰), Marp (슬라이드), qmd (로컬 BM25+vector+rerank 검색)
Architecture (Karpathy 패턴)
Layer 1 — Raw Sources (불변)
- 원문 article/PDF/data 스냅샷
- LLM 은 읽기만 함
Layer 2 — The Wiki (살아있는 markdown)
- Entity, concept, model, person, paper, trend 페이지
- 상호 참조 (wikilink) 자동 관리
Layer 3 — The Schema (운영 규칙)
CLAUDE.md같은 schema 문서에 위키 구조·작성 규칙 정의- LLM 이 매 작업 시 참조
Workflows:
- Ingest — 새 소스 추가 → 관련 페이지 10-15개 동시 갱신
- Query — index 읽기 → 관련 페이지 read → 답변 (좋은 답변은 새 페이지로 저장)
- Lint — 모순/고아/dead link 점검
이 프로젝트가 채택한 이유
이 ai-trend-notifier 자체가 LLM-wiki 패턴의 적용. AI 트렌드 추적이라는 도메인에 맞춰:
- entities/models/concepts/people/papers/trends 6개 카테고리로 위키 구조화
- ingest 매일 / lint 매주 / synthesize 매분기
- 일일 산출물 (briefs/daily/) 은 별도지만 위키와 cross-link
하위 개념 · 관련
- Vannevar Bush Memex
- Obsidian / PKM (Personal Knowledge Management) 일반론 작성 예정
열린 문제
- 모순 자동 해소 — LLM 이 어디까지 자율 결정? 어디서부터 user 결정 필요?
- Schema drift — 토픽 다양해질수록 schema 가 깨질 수 있음
- Information half-life — 오래된 페이지의 stale 판정 기준
- Token cost — 위키 전체 read 비용 증가 추세 vs index-driven selective read 의 정확도 트레이드오프
주요 소스
- Karpathy gist — 원전
- people/karpathy — 원안자
- Memex (Vannevar Bush, 1945) — Wikipedia
관련 개념
- Agents (LLM Agents) (간접 — knowledge management agent 형태)
- RAG (대안 패턴), PKM(포괄 개념) 작성 예정
주목할 인용
"the LLM is rediscovering knowledge from scratch on every question. There's no accumulation." "the wiki is a persistent, compounding artifact"
— Karpathy, LLM-wiki gist
개인적 의의
이 페이지의 존재 자체가 시스템의 self-reference. 본 시스템이 자기 자신의 운영 원리를 위키로 추적함으로써 메타 일관성 확보.
Referenced by
에이전트 (LLM Agents)Andrej KarpathyAnthropicContextPilot: Teaching Agents for Proactive Context Management via Fine-grained RLSoftware 3.0주간 종합 — 2026-W21 (2026-05-11 ~ 2026-05-17)주간 종합 — 2026-W28 (2026-07-06 ~ 2026-07-12)WikiSkill: Compiling Agent Experience into Persistent Knowledge for Skill Evolution