Agent responsibly - Vercel
AI 에이전트로 생성된 코드를 배포할 때는 맹목적 신뢰가 아닌 책임감 있는 판단이 필수적이며, 이를 위해 인프라 수준의 안전장치가 필요하다. AI 에이전트 코드의 위험성: 깔끔해 보이고 테스트를 통과하지만 프로덕션 환경의 실제 제약을 이해하지 못함 신뢰 vs 활용의 차이: 신뢰는 에이전트가 작성하면 배포, 활용은 완전한 소유권 유지하며 빠른 반복 소유권 원…
최근에 읽었거나 읽으려고 하는 것들의 기록.
AI/ML 329건
AI 에이전트로 생성된 코드를 배포할 때는 맹목적 신뢰가 아닌 책임감 있는 판단이 필수적이며, 이를 위해 인프라 수준의 안전장치가 필요하다. AI 에이전트 코드의 위험성: 깔끔해 보이고 테스트를 통과하지만 프로덕션 환경의 실제 제약을 이해하지 못함 신뢰 vs 활용의 차이: 신뢰는 에이전트가 작성하면 배포, 활용은 완전한 소유권 유지하며 빠른 반복 소유권 원…
Anthropic이 Claude Mythos Preview를 통해 주요 OS와 소프트웨어에서 수천 개의 제로데이 취약점을 발견했으며, 이를 해결하기 위해 Project Glasswing을 시작했다. Claude Mythos Preview의 성과: OpenBSD, FFmpeg, Linux 커널 등에서 수십 년 된 미발견 취약점들을 자동으로 발견 CyberGy…
멀티 에이전트 시스템은 이론적으로 매력적이지만 실제 운영에서는 토큰 비용이 10배 이상 증가하면서도 생산성은 떨어지는 심각한 한계를 가지고 있다. 현재 단계에서 에이전트에게 적극적으로 위임할 수 있는 영역은 오류 비용, 검증 용이성, 암묵지 의존도 등 5가지 기준으로 판별해야 한다. 멀티 에이전트의 근본 문제: 에이전트 간 작업 인수인계 과정에서 맥락이 반…
300개의 Huberman Lab 에피소드를 Claude Code와 NotebookLM으로 처리하여 전문가 지식을 실제 행동으로 전환하는 자동화 시스템 구축 핵심 문제: 90%의 사람들이 전문가 콘텐츠를 소비하지만 실제 행동으로 옮기지 않음 솔루션: NotebookLM(지식베이스) + Claude Code(실행 엔진)를 연결한 폐쇄형 루프 시스템 프로세스:…
무신사 iOS 팀이 AI를 활용해 테스트 코드 커버리지를 9.82%에서 79.04%로 8배 증가시킨 경험담 초기 상황: 업계 평균 74-76%인데 반해 9.82%의 극히 낮은 커버리지로 리팩터링 어려움, 회귀 테스트 부담, 신규 개발자 온보딩 어려움 목표와 결과: 2월 말까지 70% 달성을 목표로 3개월간 진행한 결과 79.04% 달성 (추가 중인 PR 머…
AI가 생성한 코드에 대한 인간의 이해도 부족으로 인한 숨겨진 비용이 증가하고 있으며, 이는 속도와 품질 사이의 균형을 맞추는 것이 중요함을 강조한다. 핵심 요약 이해 부채(Comprehension Debt): 시스템에 존재하는 코드의 양과 인간이 실제로 이해하는 코드의 양 사이의 격차 기술 부채와 달리 표면적으로는 드러나지 않음 속도 지표에는 나타나지 않…
AI 에이전트의 지속적 학습은 모델 가중치 업데이트만이 아니라 모델, 하네스, 컨텍스트 세 계층에서 이루어질 수 있으며, 각 계층별로 다른 최적화 전략이 필요하다. 에이전트 시스템의 3계층 구조: 모델(모델 가중치), 하네스(에이전트를 구동하는 코드와 명령어), 컨텍스트(하네스 밖의 설정 정보) 모델 계층 학습: SFT, RL 등으로 가중치 업데이트하지만…
AI 시대에 조직 구조를 근본적으로 재설계하여 계층제 대신 기술 기반 조정 시스템으로 전환하는 Block의 혁신적 조직 운영 모델 2000년 로마군부터 현대까지: 조직 규모 확대에 따른 조정 문제는 변하지 않음 - 계층제 구조의 근본적 한계 (스팬 오브 컨트롤) AI는 조직의 조정 메커니즘 자체를 대체: 기존 AI 활용은 생산성 향상일 뿐, Block은 조…
에이전트 시스템이 프로덕션 실패를 자동으로 분석하고 평가 케이스로 변환해 자체 개선하는 오픈소스 자동화 루프 'auto-harness' 공개 자동 개선 루프: 프로덕션 실패를 채굴 → 근본 원인별 클러스터링 → 평가 케이스 생성 → 하네스 변경 자동 제안 및 검증 성능 향상: Tau3 벤치마크에서 에이전트 점수 0.56에서 0.78로 약 40% 향상 핵심…
AI 에이전트 조율 시스템으로 대규모 코드베이스를 몇 시간 내에 재구현한 claw-code 프로젝트가 보여주는 것은 코드 자체가 아니라, 그것을 생산한 에이전트 조율 시스템의 힘이다. 핵심은 생성된 코드가 아니라 시스템: 2시간 내 Python 완성, 1일 내 Rust 포팅은 단순히 빠른 개발이 아닌 자동화된 에이전트 시스템의 능력을 보여주는 사례 인간 인…
100시간으로 본 무샷AI의 키미, 중국 AI 스타트업의 신비로운 정체성 중국 AI 스타트업 무샷AI의 챗봇 키미가 3년 만에 160억 달러 가치평가에 도달한 가운데, 르뤼(Renwu) 잡지 기자가 100시간 동안 회사 내부를 관찰하고 기록한 심층 리포트. 천재 인재들로 가득 찬 조용한 회사의 문화와 성장, 그리고 딥시크 충격을 극복한 과정을 조명한다. 회…
DeepSeek이 V4 출시 전 조직 변화와 내부 긴장을 겪고 있으며, 창업자 량원펑의 독특한 AGI 목표 추구 방식이 업계 기대와의 괴리를 만들고 있다. 조직 변화: 핵심 인물 4명의 퇴사 확인 (V1 저자 왕빙쉬안, OCR 저자 웨이하오란, R1 저자 궈다야, 멀티모달 저자 완충) V4 출시 지연: 원래 2월 중순 설 연휴 전후 출시 예정에서 4월로 연…
LLM을 활용해 개인 연구용 지식베이스를 구축하고 관리하는 실용적인 워크플로우 소개 데이터 수집 → LLM 컴파일 → 마크다운 위키 생성 - 원본 자료를 정리된 지식베이스로 자동 변환 Obsidian IDE를 통한 통합 관리 - 원본 데이터, 컴파일된 위키, 시각화를 한곳에서 운영 LLM 기반 Q&A 엔진 - 규모가 크면 복잡한 RAG 없이도 효과적인 질의…
Claude Code 소스코드 분석을 통해 대부분의 사용자가 놓치고 있는 고급 기능과 설정 방법을 공개하는 글. 올바른 설정과 구성으로 같은 비용으로 10배 이상의 생산성을 얻을 수 있음을 설명합니다. 핵심 요약 CLAUDE.md는 매 턴마다 로드됨 - 40,000자 제한으로 아키텍처 결정, 파일 규칙, 테스트 패턴을 저장하면 모든 쿼리마다 적용됨 서브에이…
AI 에이전트 시대에 누구도 완전히 이해하지 못하는 '어두운 코드(Dark Code)'가 프로덕션 환경에서 보안 사고를 일으키고 있으며, 기업들은 이에 대한 책임 추적과 투명성 확보 능력을 갖춰야 한다. Dark Code의 정의: 런타임에 동적으로 동작이 결정되고 아무도 전체 시스템을 완전히 이해하지 못하는 프로덕션 코드 구조적 원인: AI 에이전트가 런타…
앤트로픽이 유출된 클로드 코드를 통해 드러낸 미래 전략: AI를 '도구'에서 '자율적 팀원'으로 전환하려는 패러다임 전환이 이미 기술적으로 완성 단계에 있다. KAIROS + DAEMON 조합: GitHub PR 모니터링 → 자동 코드 리뷰, 테스트 수정, 배치 작업 자동 실행 (개발자가 자는 동안 작동) 멀티에이전트 스웜 아키텍처: 상급 Claude(Co…
조직은 2000년간 계층 구조라는 정보 라우팅 시스템에 의존해왔지만, AI 기술이 이를 대체할 수 있는 새로운 가능성을 열었다. Block은 인공지능을 조직의 중추적 조정 메커니즘으로 활용하여 전통적 계층 구조를 재설계하고 있다. 조직 구조의 2000년 역사: 로마군의 스팬 오브 컨트롤(span of control) 개념에서 시작된 계층 구조는 오늘날까지…
코인베이스가 AI 에이전트 중심 개발 방식으로 전환하면서 엔지니어링 워크플로우 전체를 재구축했으며, 기존 도구에 AI를 추가하는 방식이 아닌 근본적인 프로세스 개혁을 통해 개발 생산성을 크게 향상시키고 있다. 에이전트 중심 설계로의 전환: 2026년 초 엔지니어들에게 IDE 삭제 및 2주간 코드 작성 금지 지시로 에이전트 의존도를 높이는 워크플로우 구축 L…
AI 코딩 에이전트의 급속한 보급으로 인한 소프트웨어 품질 저하 문제와 이를 해결하기 위한 신중한 접근 방식의 필요성을 다룬 글 AI 에이전트의 역설: 코드 생성 속도는 빠르지만 품질 관리와 학습 메커니즘이 부재함 누적되는 작은 오류들: 인간과 달리 에이전트는 동일한 실수를 반복하며, 병목 없이 이러한 오류들이 급속도로 축적됨 복잡성의 증대: 에이전트의 지…
Claude AI가 장시간 실행되는 애플리케이션 개발에서 고품질 결과물을 만들기 위한 멀티-에이전트 하네스 설계 방법론 생성형-평가형 에이전트 구조: GAN에서 영감을 받아 생성 에이전트와 평가 에이전트를 분리하는 구조로, 자기 평가의 낙관적 편향 문제 해결 주관적 판단의 객관화: "아름다운가?"같은 주관적 질문을 "설계 원칙을 따르는가?"같은 구체적 기준…