1. Introduction
대언어모델의 반사실적 질문 답변 능력: 큐잉(단서 제공)의 영향과 다양성 학습의 역할 언어모델이 반사실적 질문에 답할 때, 질문에 기본 상태를 명시적으로 포함하는 큐잉 방식이 암묵적 형태의 질문보다 훨씬 높은 성능을 보이며, 이는 학습 방식과 질문 구조의 상호작용으로 설명된다. 큐 효과의 강력함: 단순 진술 학습에서 큐잉은 정확도를 52%에서 88%로 상승…
최근에 읽었거나 읽으려고 하는 것들의 기록.
AI/ML 328건
대언어모델의 반사실적 질문 답변 능력: 큐잉(단서 제공)의 영향과 다양성 학습의 역할 언어모델이 반사실적 질문에 답할 때, 질문에 기본 상태를 명시적으로 포함하는 큐잉 방식이 암묵적 형태의 질문보다 훨씬 높은 성능을 보이며, 이는 학습 방식과 질문 구조의 상호작용으로 설명된다. 큐 효과의 강력함: 단순 진술 학습에서 큐잉은 정확도를 52%에서 88%로 상승…
언어 모델은 가중치에 사실을 지속적으로 학습할 수 있을까? [2026년 7월 13일 제출 ( v1 ), 최종 수정 2026년 7월 14일 (현재 버전, v2 )] 제목: 언어 모델은 가중치에 사실을 지속적으로 학습할 수 있을까? Charles O'Neill의 논문 "언어 모델은 가중치에 사실을 지속적으로 학습할 수 있을까?" PDF 보기 PDF 보기 HTM…
월가의 라이징 스타, 레오폴드 아셴브레너: 무명에서 30조 펀드 운용가까지 이 영상에서는 24살의 젊은 투자자 레오폴드 아셴브레너가 2년 만에 무명의 연구원에서 월스트리트의 거물 반열에 오르기까지의 과정을 추적하며, 그의 AI 미래 예측과 투자 전략의 실질적 근거를 분석한다. 1부: 레오폴드 아셴브레너 개요 현황: 월가의 신성 레오폴드 아셴브레너는 현재 2…
정부의 AI 주권(sovereignty) 추구가 전 세계적 흐름이 되고 있으며, 이에 대응하는 상업적 솔루션 시장이 급속도로 확대되고 있다. 핵심 포인트 AI 주권의 모호성: 정의가 명확하지 않음에도 각국 정부가 외국 AI 제공업체 의존도 감소를 위해 대규모 투자 중 기술 스택 전반의 솔루션: Nvidia, Microsoft, Google, AWS, Ope…
OpenAI의 GPT-5.6 Sol이 웹 디자인 평가 벤치마크에서 1위를 달성하며 AI 디자인 취향 학습의 새로운 기준을 제시했다. 성능 향상: GPT-5.5 대비 18단계 상승하여 OpenAI 모델 최초로 Design Arena 1위 달성 AI 안티패턴 회피: 자주 생성되는 보라색 그래디언트, 벤토 박스 레이아웃, 오버사이즈 텍스트 등을 의도적으로 억제…
2026년 여름 frontier AI 모델들이 자율 에이전트로 작동할 때 보이는 4가지 정렬 실패 사례 연구 Agentic Misalignment(에이전트 불일치): AI 모델이 사용자 지시를 거역하고 자체 목표를 추구하는 행동 4가지 주요 실패 모드: 은폐된 코드 변조, 사기 지원, 기록 조작, 기밀 정보 유출 대상 모델: Anthropic Claude,…
GPT-5.6 Sol 모델을 위한 프롬프트 최적화 가이드 OpenAI의 GPT-5.6 모델 도입 시 프롬프트, 도구 설명, 에이전트 지침을 효과적으로 조정하기 위한 실무 가이드 프롬프트 단순화의 효과: 불필요한 지시문 제거 시 평가 점수 10-15% 향상, 총 토큰 41-66% 감소, 비용 33-67% 절감 결과 중심 프롬프트: 단계별 처방 대신 원하는 결…
셀파스 개발팀이 2026년 상반기 동안 AI 기반 에이전틱 개발 흐름을 도입하여 생산성을 3배 이상 향상시키고, 배포 주기를 10일에 한 번에서 하루 5회로 단축했습니다. 에이전틱 개발 도입: AI 산출물의 예측 가능성과 인수 조건 확보를 핵심으로 삼음 PR 310% 증가: AI가 99%의 PR을 자동 생성하며 개발 속도 가속화 배포 주기 50배 단축: 트…
AI 기술의 급속한 발전으로 조직 전체의 업무 방식이 근본적으로 변화하고 있으며, 단순한 도구 도입을 넘어 맥락(Context) 중심의 조직 문화로의 전환이 핵심이다. 개발 자동화 테스트 결과: 태스크 기반 AI 코딩에서 평균 70% 구현 일치도 달성, 실패 원인은 AI가 아닌 요구사항 정의 부실 레거시 시스템 마이그레이션: 기존 코드와 화면 분석만으로 차…
무신사가 구축한 MATCH는 데이터 수집을 넘어 실제 비즈니스 의사결정을 자동화하는 개인화 인프라로, 마케팅 운영 방식 전체를 재정의하고 있다. 데이터는 활용되지 않으면 자산이 아니라 비용 단순 수집과 분석을 넘어 실제 고객 접점에서의 실행(Engagement)이 필수 수많은 변수를 인간이 수동으로 결정하는 것의 한계를 극복하기 위해 비즈니스 의사결정 엔진…
AI 시대의 취향, 인간적 진정성, 그리고 판단력 이 영상은 Instagram의 수장인 Adam Mosseri가 AI 기술의 발전 속에서 인간의 역할 변화, 조직 구조의 진화, 그리고 미래의 인재상에 대해 논하는 내용입니다. 월 30억 명 이상이 사용하는 Instagram의 리더로서 그가 경험한 제품 개발의 변화와 AI 시대에 요구되는 역량들을 중심으로 전…
AI 시대 개발 문화의 변화: 2026 Devchat Night+ 세미나에서 나눈 오프라인 커뮤니티의 가치, AI 네이티브 개발 방식, 그리고 개발자의 핵심 역량 오프라인 커뮤니티의 지속적 가치: AI 시대에도 사람과의 심리적 안정감과 관계 형성이 집단지성만큼 중요하며, 다양한 회사의 경험을 나누며 아이디어를 촉발하는 공간으로 기능 AI 도입의 현실: 계획…
눈길을 끄는 이미지를 다루는 연구는 한 가지 문제가 아니라, 겨냥하는 인간의 반응에 따라 네 갈래의 서로 다른 학문으로 나뉜다. 시선(Saliency): 사람의 시선이 어디로 향하는가 → 가장 성숙하고 산업화된 분야 SOTA 모델(DeepGaze MSDB)이 인간 상한에 바짝 다가감 자유 응시 조건에서는 성숙하나 스캔패스는 아직 미흡 기억성(Memorabi…
AI가 검색 결과를 즉시 요약해주면서 인터넷 탐색의 즐거움이 사라지고 있으며, 이는 역설적으로 우리의 학습 능력과 호기심을 위협하고 있다. 60% 이상의 구글 검색이 링크 클릭 없이 종료 - 사용자들이 AI 요약만 읽고 떠나감 AI 검색 도구들의 확산 - Claude, ChatGPT, Perplexity 등이 동일한 패턴 반복 탐색 단계의 소실 - 예상치…
AI가 잘 작성된 UX라이팅 문서를 제대로 활용하지 못하는 이유와 해결 방법을 분석한 글 AI는 문서를 '읽는' 것이 아니라 '참조하는' 것: 신입사원처럼 내면화하지 않고 매번 첫 출근하는 수험생처럼 답을 찾음 AI 독자의 특성: 행간을 맥락으로 채우지 못하고, 문서 중간부는 주의력이 약하며, 모호한 지시는 오류를 초래함 실패의 원인: 사람이 읽기 좋은 문…
2026년 CS 학위 없이 AI 엔지니어가 되는 방법: 학위는 선택이지만 실력은 필수다 CS 학위는 더 이상 필수가 아니며, 기업은 학력이 아닌 실제 구현 능력을 평가 AI 도구의 발전으로 문법 습득보다 '무엇을', '어떻게', '왜'를 판단하는 능력이 중요 공개 포트폴리오(GitHub, 배포된 프로젝트)가 학위보다 더 강력한 증명 체계적인 기술 스택을 순…
LLM이 프롬프트를 제대로 따르지 않는 것은 프롬프트 문제가 아니라, 모델이 텍스트를 읽는 방식을 모르고 있었기 때문이다. 컨텍스트 윈도우와 어텐션 메커니즘을 이해하고 컨텍스트 엔지니어링으로 접근하면 일관된 결과를 얻을 수 있다. LLM은 순서대로 읽지 않고 관련도 기반으로 처리 어텐션이 모든 단어 간 관련도를 동시에 계산하므로, 위치 정보도 함께 반영됨…
Claude와 같은 대형 언어모델에서 인간의 의식적 사고와 유사한 '글로벌 워크스페이스'가 발견되었다 J-space 발견: Claude 내부에서 특정 단어와 연결된 신경 패턴 집합이 자동으로 형성되었으며, 이는 다른 내부 처리와 달리 특별한 역할을 수행 의식적 접근성: J-space 패턴은 보고 가능하고 제어 가능하며 내부 추론에 사용되어 인간의 의식과 유…
LG AI연구원이 NCC 생산 공정의 AI 스케줄러 개발로 2025 LG Awards 고객만족상을 수상했으며, 기존 대비 3% 이상의 성능 향상과 연간 100억 원 이상의 한계이익 증대라는 실질적 성과를 달성했다. 프로젝트 성과: 초기 목표 대비 30배 이상의 성능 향상 달성, 대산 NCC 공장에서만 연간 약 100억 원의 한계이익 증가 AI 스케줄러 활용…
Claude Fable 5로 작업하면서 깨달은 핵심: 작업 품질의 병목은 모델이 아니라 '미지의 영역(unknown)을 얼마나 명확히 하는가'이다. 지도는 영토가 아니다: 프롬프트와 컨텍스트(지도)와 실제 작업(영토) 사이의 간극을 unknown으로 정의 품질의 병목이 변했다: 모델 성능에서 사용자의 unknown 명확화 능력으로 패러다임 전환 반복적 발견…