Continual learning for AI agents
AI 에이전트의 지속적 학습은 모델 가중치 업데이트만이 아니라 모델, 하네스, 컨텍스트 세 계층에서 이루어질 수 있으며, 각 계층별로 다른 최적화 전략이 필요하다. 에이전트 시스템의 3계층 구조: 모델(모델 가중치), 하네스(에이전트를 구동하는 코드와 명령어), 컨텍스트(하네스 밖의 설정 정보) 모델 계층 학습: SFT, RL 등으로 가중치 업데이트하지만…
최근에 읽었거나 읽으려고 하는 것들의 기록.
개발 280건
AI 에이전트의 지속적 학습은 모델 가중치 업데이트만이 아니라 모델, 하네스, 컨텍스트 세 계층에서 이루어질 수 있으며, 각 계층별로 다른 최적화 전략이 필요하다. 에이전트 시스템의 3계층 구조: 모델(모델 가중치), 하네스(에이전트를 구동하는 코드와 명령어), 컨텍스트(하네스 밖의 설정 정보) 모델 계층 학습: SFT, RL 등으로 가중치 업데이트하지만…
에이전트 시스템이 프로덕션 실패를 자동으로 분석하고 평가 케이스로 변환해 자체 개선하는 오픈소스 자동화 루프 'auto-harness' 공개 자동 개선 루프: 프로덕션 실패를 채굴 → 근본 원인별 클러스터링 → 평가 케이스 생성 → 하네스 변경 자동 제안 및 검증 성능 향상: Tau3 벤치마크에서 에이전트 점수 0.56에서 0.78로 약 40% 향상 핵심…
AI 에이전트 조율 시스템으로 대규모 코드베이스를 몇 시간 내에 재구현한 claw-code 프로젝트가 보여주는 것은 코드 자체가 아니라, 그것을 생산한 에이전트 조율 시스템의 힘이다. 핵심은 생성된 코드가 아니라 시스템: 2시간 내 Python 완성, 1일 내 Rust 포팅은 단순히 빠른 개발이 아닌 자동화된 에이전트 시스템의 능력을 보여주는 사례 인간 인…
LLM을 활용해 개인 연구용 지식베이스를 구축하고 관리하는 실용적인 워크플로우 소개 데이터 수집 → LLM 컴파일 → 마크다운 위키 생성 - 원본 자료를 정리된 지식베이스로 자동 변환 Obsidian IDE를 통한 통합 관리 - 원본 데이터, 컴파일된 위키, 시각화를 한곳에서 운영 LLM 기반 Q&A 엔진 - 규모가 크면 복잡한 RAG 없이도 효과적인 질의…
Claude Code 소스코드 분석을 통해 대부분의 사용자가 놓치고 있는 고급 기능과 설정 방법을 공개하는 글. 올바른 설정과 구성으로 같은 비용으로 10배 이상의 생산성을 얻을 수 있음을 설명합니다. 핵심 요약 CLAUDE.md는 매 턴마다 로드됨 - 40,000자 제한으로 아키텍처 결정, 파일 규칙, 테스트 패턴을 저장하면 모든 쿼리마다 적용됨 서브에이…
AI 에이전트 시대에 누구도 완전히 이해하지 못하는 '어두운 코드(Dark Code)'가 프로덕션 환경에서 보안 사고를 일으키고 있으며, 기업들은 이에 대한 책임 추적과 투명성 확보 능력을 갖춰야 한다. Dark Code의 정의: 런타임에 동적으로 동작이 결정되고 아무도 전체 시스템을 완전히 이해하지 못하는 프로덕션 코드 구조적 원인: AI 에이전트가 런타…
앤트로픽이 유출된 클로드 코드를 통해 드러낸 미래 전략: AI를 '도구'에서 '자율적 팀원'으로 전환하려는 패러다임 전환이 이미 기술적으로 완성 단계에 있다. KAIROS + DAEMON 조합: GitHub PR 모니터링 → 자동 코드 리뷰, 테스트 수정, 배치 작업 자동 실행 (개발자가 자는 동안 작동) 멀티에이전트 스웜 아키텍처: 상급 Claude(Co…
GitHub Actions는 시장 점유율에만 의존하고 있으며, 개발팀의 생산성을 심각하게 해치는 여러 근본적인 문제들을 가지고 있다. 로그 뷰어의 악몽: 여러 번의 클릭을 거쳐야 오류를 확인할 수 있으며, 큰 로그에서는 브라우저가 충돌함 YAML의 복잡성: 고유한 표현식 언어와 문자열 보간 규칙으로 인해 작은 변경도 4분 대기 후 실패하기 쉬움 마켓플레이스…
코인베이스가 AI 에이전트 중심 개발 방식으로 전환하면서 엔지니어링 워크플로우 전체를 재구축했으며, 기존 도구에 AI를 추가하는 방식이 아닌 근본적인 프로세스 개혁을 통해 개발 생산성을 크게 향상시키고 있다. 에이전트 중심 설계로의 전환: 2026년 초 엔지니어들에게 IDE 삭제 및 2주간 코드 작성 금지 지시로 에이전트 의존도를 높이는 워크플로우 구축 L…
리눅스/맥 커맨드라인 초보자를 위한 기초 개념과 필수 명령어 완벽 가이드 커맨드라인의 핵심 개념: 커널, 셸, 터미널의 구분 - 추상적 인터페이스(CLI), 물리적 구현(터미널), 실행 프로그램(셸)의 역할 이해 기본 네비게이션: pwd(위치 확인) → cd(이동) → ls(목록 조회)로 파일 시스템 탐색 경로 표현법 3가지: 절대경로(/로 시작), 상대경…
AI 코딩 에이전트의 급속한 보급으로 인한 소프트웨어 품질 저하 문제와 이를 해결하기 위한 신중한 접근 방식의 필요성을 다룬 글 AI 에이전트의 역설: 코드 생성 속도는 빠르지만 품질 관리와 학습 메커니즘이 부재함 누적되는 작은 오류들: 인간과 달리 에이전트는 동일한 실수를 반복하며, 병목 없이 이러한 오류들이 급속도로 축적됨 복잡성의 증대: 에이전트의 지…
Claude AI가 장시간 실행되는 애플리케이션 개발에서 고품질 결과물을 만들기 위한 멀티-에이전트 하네스 설계 방법론 생성형-평가형 에이전트 구조: GAN에서 영감을 받아 생성 에이전트와 평가 에이전트를 분리하는 구조로, 자기 평가의 낙관적 편향 문제 해결 주관적 판단의 객관화: "아름다운가?"같은 주관적 질문을 "설계 원칙을 따르는가?"같은 구체적 기준…
Claude의 스킬을 자동으로 개선하는 '오토리서치' 방법론 소개 - Andrej Karpathy의 방법을 활용해 AI 에이전트가 자동으로 프롬프트를 테스트하고 최적화하는 과정 핵심 개념: Andrej Karpathy의 오토리서치 방법론을 Claude 스킬에 적용 자동화 루프: AI 에이전트가 작은 변화를 시도 → 결과 측정 → 개선 여부 판단 → 반복 (…
코드 작성 속도 향상이 소프트웨어 개발의 진정한 병목이 아니며, 잘못된 최적화는 오히려 시스템을 더 악화시킨다는 주장 병목 지점 최적화의 역설: 병목이 아닌 단계를 빠르게 하면 더 느린 시스템이 되고, AI 코딩 도구로 코드 출력을 40% 증가시켜도 검토·배포 단계가 막혀있으면 더 큰 혼란만 초래 실제 발생하는 문제: 더 많은 PR이 쌓여 검토 대기 시간…
현재 AI 에이전트 붐으로 인한 피로는 과거 JavaScript 생태계의 혼란과 유사하며, 결국 표준화될 것이라는 개발자의 경험담 분석 Agent Fatigue의 발생: 매일 새로운 에이전트 도구와 프레임워크가 쏟아지면서 '정답'이 계속 바뀌는 상황 역사적 비교: 2008년 JavaScript/웹 프론트엔드 발전 과정과 현재의 에이전트 생태계 패턴이 동일…
에이전트(AI)가 효과적으로 사용할 수 있는 CLI 설계 가이드 에이전트가 CLI 도구를 사용할 때 막히지 않도록 하려면 대화형 프롬프트를 제거하고, 모든 입력을 플래그로 전달 가능하게 하며, 명확한 예제가 포함된 도움말을 제공해야 한다. 핵심 설계 원칙 비대화형 방식 필수: 실행 중 대화형 프롬프트가 나타나면 에이전트가 동작 불가 모든 입력을 플래그로 전…
OpenAI의 Parameter Golf 챌린지에서 AI 에이전트 swarm을 활용하여 16MB 제약 조건에서 최고 성능의 언어모델을 두 번 달성한 사례 129번의 에이전트 실행과 2시간의 인간 개입으로 두 번의 #1 달성 - Hive 플랫폼에서 자동화 리서치 에이전트를 배포하여 최종 성능 1.1228 val_bpb 달성 "Deep" 전략: Int5 MLP…
Ramp는 AI 에이전트를 활용해 Ramp Sheets를 자동으로 유지보수하는 시스템을 구축했다. 1,000개 이상의 AI 생성 모니터가 지속적으로 프로덕션을 감시하고, 알림을 분류하며, 엔지니어 리뷰 이전에 자동으로 수정안을 제시한다. 자동화된 모니터링 체계 도입: 매 75줄의 코드마다 1개 모니터(총 1,000개 이상)를 자동으로 생성하여 운영 수동 모…
AI 에이전트 메모리 시스템에서 99% 정확도를 달성한 새로운 기술 ASMR(Agentic Search and Memory Retrieval) 공개 벡터 데이터베이스 대체: 전통적 RAG 방식 대신 에이전트 기반 추론으로 시간 변화에 따른 정보 업데이트 문제 해결 병렬 처리 아키텍처: 수집 3개, 검색 3개의 전문화된 에이전트 활용으로 속도와 정확도 동시…
FFmpeg는 멀티미디어 파일을 처리하기 위한 명령줄 도구와 라이브러리 모음으로, 오디오/비디오 인코딩, 디코딩, 트랜스코딩을 지원하며 실제 애플리케이션에 통합할 수 있는 다양한 라이브러리를 제공한다. FFmpeg의 구성: 커맨드라인 도구(ffmpeg, ffplay, ffprobe)와 8개의 핵심 라이브러리로 구성 핵심 라이브러리: libavformat(입…