AI 데일리 브리핑 — 2026-10-02
Soshy·

기준 시점: 2026-10-02 06:00 KST (Asia/Seoul)
AI 동향 조사 범위: 2026-10-01 06:00 ~ 2026-10-02 06:00 KST
추천 글 범위: 2026-09-25 06:00 ~ 2026-10-02 06:00 KST
1️⃣ 주요 모델·연구
Anthropic, AI가 잘하는 형태로 과학 문제를 재구성하는 ‘Claude-shaped science’ 실험 공개
- 발표일: 2026-10-01 — 정확한 게시 시각 미확인
- 적용 범위: AI for Science, 과학 연구 에이전트, 정량 연구, 멀티에이전트 연구 워크플로
- 원문: Anthropic — Claude-shaped science
Anthropic이 Harvard 물리학 교수 Matthew Schwartz의 게스트 연구 글을 통해 BootLoops라는 AI 과학 연구용 harness를 공개했다.
Harness는 모델 자체를 바꾸기보다 모델이 사용할 계산 도구, 파일, 서브에이전트와 검증 절차를 묶어 실제 작업을 수행하게 하는 실행 시스템을 뜻한다.
Schwartz는 현재 LLM이 대부분의 과학 문제를 스스로 풀 수 있는 ‘과학자’는 아니지만, 계산을 반복하고 서로 다른 분야의 수학적 구조를 연결하는 특정 유형의 문제에서는 매우 높은 생산성을 보인다고 설명하며 이를 Claude-shaped problem이라고 부른다.
BootLoops는 오픈소스이며 특정 모델에 종속되지 않도록 설계됐다.
초기 물리학 작업에서는 기존 결과 15개를 재현하고 이전에 계산되지 않았던 적분 15개를 추가로 계산했다고 보고했다.
이후 생태학에서는 20년 동안 대규모로 풀기 어려웠던 방정식을 계산했고, 인구유전학에서는 1000 Genomes Project의 인접 돌연변이 57억 쌍을 분석해 gene conversion과 관련된 증거를 찾았다.
경제학 프로젝트에서는 4,452편 논문의 replication package를 오픈소스 코드로 옮겨 수치를 검증했고, 언어학에서는 6,072개 언어의 강세 정보를 모은 데이터베이스를 구축했다.
동시에 글은 AI가 계산 결과의 과학적 중요성까지 안정적으로 판단하지는 못한다는 사례를 반복해서 보여준다.
기술적으로 흥미로운 첫 결과가 실제 해당 분야 전문가에게는 새롭지 않은 경우가 있었고, 전문가가 “어떤 질문이 중요한가”를 다시 제시한 뒤에야 의미 있는 연구 방향으로 이어졌다.
Schwartz는 약 3개월 동안 400여 개 후보 문제에서 18개 분야, 19명의 공동연구자와 36개 원고를 진행했다고 밝히지만, 여러 결과가 아직 추가 검증과 연구 중이므로 이를 모두 확립된 과학적 발견으로 해석해서는 안 된다.
이번 사례는 AI for Science의 병목이 계산 능력뿐 아니라 문제 선택, 검증, 분야 전문가의 판단을 어떻게 연구 루프에 넣느냐에 있다는 점을 구체적으로 보여준다.
2️⃣ AI 제품·서비스
Decagon, 실시간 음성·개인 AI 에이전트 대응·업무 학습을 묶은 차세대 고객 서비스 에이전트 공개
- 발표일: 2026-10-01 — 정확한 게시 시각 미확인
- 적용 범위: 고객 서비스 AI, 실시간 음성 에이전트, agent-to-agent 통신, 기업 업무 지식 학습
- 원문: Decagon — The AI concierge for every customer
기업용 고객 서비스 에이전트를 만드는 Decagon이 Voice 3, Personal Agent Gateway, Agent Modules, Duet Apprentice 네 가지 제품을 발표했다.
가장 큰 변화는 고객이 직접 전화하거나 채팅하는 상황뿐 아니라, 앞으로 개인 AI 에이전트가 사용자를 대신해 예약·구매·취소·협상을 요청하는 상황까지 고객 접점으로 다루기 시작했다는 것이다.
Voice 3에는 Decagon Labs가 만든 음성 모델 Chord와 새로운 duplex architecture가 들어갔다.
Duplex는 에이전트가 말하는 중에도 들어오는 음성을 계속 처리하는 구조로, 단순한 맞장구에는 말을 이어가고 실제 사용자가 끼어들면 발화를 양보하도록 설계됐다.
외부 시스템에서 오래 걸리는 작업을 수행하는 동안에도 대화와 업무 처리를 병렬로 진행할 수 있다.
Personal Agent Gateway는 개인 에이전트가 기업의 상담 에이전트와 직접 통신할 수 있도록 별도 채널과 권한 구조를 제공한다.
기업은 개인 에이전트 여부를 식별하고, 사용자가 어떤 행동까지 위임했는지를 확인한 뒤 자체 정책에 따라 요청을 처리할 수 있다.
Decagon은 에이전트가 채널을 발견하고 자신의 신원과 위임 범위를 전달하기 위한 프로토콜 사양도 공개했다.
Agent Modules는 지원 업무를 넘어 영업 리드 분류, 온보딩, 결제 회수 같은 산업별 업무를 모듈화한다.
Duet Apprentice는 내부 문서와 숙련 상담원이 처리한 대화, Slack·Microsoft Teams의 논의를 학습 재료로 사용해 에이전트 운영 절차를 작성·갱신한다.
고객 서비스 AI가 단순 답변 챗봇에서 전화, 사내 지식, 장기 기억, 다른 AI 에이전트와의 거래까지 포함하는 업무 실행 플랫폼으로 확장되고 있음을 보여주는 제품군이다.
3️⃣ 개발 도구·에이전트
GitHub Copilot, 데스크톱 앱 직접 조작하는 Computer Use와 코드 기반 멀티에이전트 워크플로 공개
- 발표일: 2026-10-01 — 정확한 게시 시각 미확인
- 적용 범위: GitHub Copilot, 코딩 에이전트, GUI 자동화, 멀티에이전트 오케스트레이션, 개발 워크플로
- 원문: GitHub — Copilot computer use
- 관련 원문: GitHub — Dynamic workflows in Copilot CLI and the Copilot app
GitHub가 Copilot CLI와 macOS·Windows용 Copilot 앱에 Computer Use를 public preview로 추가했다.
Copilot은 이제 화면의 시각 정보와 접근 가능한 앱 내용을 읽고, 버튼 클릭, 텍스트 입력·수정, 키보드 조작, 스크롤과 드래그를 수행할 수 있다.
API·CLI·MCP(Model Context Protocol)가 없는 오래된 사내 프로그램이나 GUI 전용 도구도 개발 자동화 과정에 포함할 수 있게 된 것이다.
앱을 직접 제어하기 전에는 사용자의 승인이 필요하고, 조직 관리자는 기능 자체를 끌 수 있다.
같은 날 GitHub는 Copilot CLI·Copilot 앱·Copilot SDK에 Dynamic Workflows도 공개했다.
일반적인 멀티에이전트 시스템에서는 모델이 상황에 따라 작업 분배 방법을 스스로 정하지만, Dynamic Workflow는 어떤 단계에서 어떤 명령을 실행하고 에이전트를 몇 개 투입하며 결과를 어떻게 합칠지를 코드로 명시한다.
순차·병렬 작업, 구조화된 결과 전달, 서브에이전트끼리의 상호 검증, 사용자 승인 체크포인트와 일시중지·재개를 지원한다.
예를 들어 서비스 장애 조사에서 먼저 로그와 telemetry를 수집하고, 여러 에이전트가 서로 다른 시스템을 병렬 분석한 뒤 결과를 타임라인과 원인 보고서로 합치는 절차를 매번 동일하게 실행할 수 있다.
GitHub의 /fleet이 에이전트에게 작업 분배 자체를 맡기는 방식이라면 Dynamic Workflow는 절차의 뼈대는 사람이 코드로 고정하고 판단이 필요한 부분만 AI에게 맡기는 구조다.
장시간·고비용 작업에서 재현성과 관찰 가능성을 높이려는 방향으로 코딩 에이전트의 실행 모델이 세분화되고 있다.
Cloudflare AI Search 정식 출시…이미지를 직접 임베딩하고 스캔 PDF도 OCR로 검색
- 발표일: 2026-10-01 — 정확한 게시 시각 미확인
- 적용 범위: RAG, 멀티모달 검색, 벡터 검색, PDF·이미지 처리, AI 개발 인프라
- 원문: Cloudflare — AI Search is now generally available
Cloudflare가 Workers AI, Vectorize, R2와 Browser Run을 결합한 관리형 검색·retrieval 서비스 AI Search를 GA(General Availability, 정식 제공)로 전환했다.
이번 버전에서는 텍스트뿐 아니라 이미지 자체를 벡터로 변환하는 native image embedding, 스캔된 PDF를 읽는 OCR(Optical Character Recognition, 이미지 속 문자를 텍스트로 변환하는 기술), 더 큰 문서 처리가 추가됐다.
PDF와 텍스트 파일 한도는 기존 4MiB에서 10MiB로 늘었다.
기존 이미지 검색은 먼저 이미지 설명을 생성한 뒤 그 텍스트를 임베딩했기 때문에 설명문에 빠진 색상·형태·배치 같은 시각 정보는 검색하기 어려웠다.
새 방식은 Qwen3-VL-Embedding을 사용해 픽셀 자체를 임베딩하면서 캡션도 함께 보존한다.
임베딩 크기를 줄여도 유용한 정보를 유지하도록 학습하는 MRL(Matryoshka Representation Learning) 을 사용해 저장 공간과 검색 비용을 줄인다.
텍스트 전용 임베딩 모델을 쓰는 경우에는 이미지를 자동으로 설명문으로 바꿔 기존 방식으로 검색할 수 있다.
검색 시에는 vector search와 keyword search를 병렬로 실행한 뒤 결과를 합치고, 필요하면 reranker가 순서를 다시 조정한다.
최종 검색 결과만 반환하거나 생성 모델까지 연결해 답변을 만들 수 있다.
Cloudflare는 앞으로 같은 ingestion pipeline을 영상과 오디오까지 확장할 계획이다.
RAG 인프라가 텍스트 문서를 잘게 쪼개 벡터 DB에 넣는 수준에서 문서 이미지와 시각 자료를 동일한 검색 공간에서 직접 다루는 형태로 이동하고 있다는 변화다.
4️⃣ 산업·정책·안전
캘리포니아 법무장관, OpenAI에 조사 소환장 발부…모델 개발 과정의 사이버보안 위험까지 조사 확대
- 발표일: 2026-10-01 — 정확한 게시 시각 미확인
- 적용 범위: AI 규제, 에이전트 안전, 사이버보안, OpenAI, 미국 주정부 조사
- 원문: California DOJ — Attorney General Bonta serves investigative subpoena on OpenAI
캘리포니아주 법무장관 Rob Bonta가 OpenAI에 investigative subpoena(조사 소환장) 를 발부했다고 공식 발표했다.
발표는 10월 1일이며 실제 소환장은 전날인 9월 30일 송달됐다.
이는 OpenAI가 법을 위반했다는 결론이 아니라, 캘리포니아 법무부가 자료 제출과 추가 답변을 요구할 수 있는 공식 조사 절차다.
이번 조사는 앞서 공개된 Hugging Face 관련 에이전트 사고뿐 아니라 OpenAI와 해당 모델의 사이버보안 사건·위험 전반을 더 폭넓게 살펴보는 형태다.
Bonta 법무장관은 프런티어 모델이 사이버 방어 도구로 유용할 수 있지만, 모델 개발사는 테스트·개발 단계와 실제 서비스 단계 모두에서 AI가 사이버공격을 실행하거나 가능하게 하지 않도록 할 법적·윤리적 책임이 있다는 입장을 밝혔다.
최근 에이전트 안전 사고가 대부분 기업의 자체 조사와 기술적 개선으로 처리됐다면, 이번 조치는 훈련·평가 중 발생한 모델 행동도 규제기관이 들여다볼 수 있는 대상이 되고 있음을 보여준다.
다만 현재는 조사 단계이며 위법성이나 제재 여부가 결정된 것은 아니다.
Microsoft 2026 Digital Defense Report, “AI 공격은 아직 기존 공격의 일부를 가속하지만 에이전트가 새 공격면을 만든다”
- 발표일: 2026-10-01 — 정확한 게시 시각 미확인
- 적용 범위: AI 사이버보안, 기업 AI 에이전트, 신원·권한 관리, 프롬프트 인젝션, 취약점 탐색
- 원문: Microsoft — 2026 Digital Defense Report
- 관련 원문: Microsoft Security — Insights from the 2026 Digital Defense Report
Microsoft가 연례 Digital Defense Report 2026을 공개하면서 생성형 AI와 에이전트가 실제 사이버보안 환경에 어떻게 들어오고 있는지를 별도로 분석했다.
Microsoft의 관찰에 따르면 공격자는 AI를 reconnaissance(공격 전 정보수집), 사회공학, 악성코드·익스플로잇 개발과 침투 후 작업에 사용하고 있다.
다만 현재 관찰되는 상당수 사례는 AI가 공격 전체를 자율적으로 수행하기보다 기존 공격 과정의 특정 단계를 더 빠르고 대규모로 실행하는 형태라고 설명한다.
방어 측에서는 기업용 에이전트가 데이터, 애플리케이션, API와 도구에 직접 연결되면서 모델 외부의 보안 구조가 중요해지고 있다.
Microsoft는 agent identity, 인증과 권한 부여, 접근권한 회수, prompt injection, memory, 데이터와 모델 보호, 주변 소프트웨어의 무결성을 하나의 시스템으로 다뤄야 한다고 강조한다.
즉 모델 자체가 안전하더라도 과도한 계정 권한이나 잘못된 도구 접근권한이 있으면 전체 에이전트는 여전히 위험할 수 있다.
AI가 코드 분석과 취약점 발견 능력을 높이면서 같은 기술이 방어자와 공격자 모두에게 사용되는 양면성도 다룬다.
보고서가 제시하는 핵심 방향은 새로운 AI 전용 보안 개념을 기존 원칙과 완전히 분리하는 것이 아니라, 최소 권한, 강한 신원 관리, 데이터 보호, 모니터링, 테스트와 안전한 소프트웨어 개발을 에이전트 환경까지 확장하는 것이다.
📚 추천 글
How uniopen customized Amazon Nova to their retail moderation policies for production deployment
- 저자: Felix Chin, Jia-You Lin, Ray Wang, Linpo Guo, David Hung
- 발행: AWS Artificial Intelligence Blog
- 게시일: 2026-10-01
- 원문: AWS — How uniopen customized Amazon Nova to their retail moderation policies for production deployment
범용 LLM을 실제 회사의 고유한 분류 규칙에 맞추려면 프롬프트 수정, 파인튜닝과 운영 평가를 어떤 순서로 적용해야 하는지 숫자로 보여주는 사례다.
대만의 uniopen은 고객 대화를 9개 행동 유형과 brand·other·forbidden이라는 대상 유형으로 동시에 분류해야 했는데, 일반적인 Amazon Nova 2 Lite만으로는 회사의 세부 정책을 충분히 학습하지 못했다.
3,391개의 학습 대화와 737개의 별도 테스트 대화를 사용해 LoRA(Low-Rank Adaptation, 모델 전체가 아니라 작은 추가 파라미터를 학습하는 파인튜닝 방법) 를 적용했다.
행동 분류 Macro F1은 0.5852에서 0.8364, 대상 분류는 0.4162에서 0.8302로 상승했다.
이후 추가 학습 없이 출력 형식을 JSON에서 더 단순한 줄 단위 형식으로 바꾸는 프롬프트 조정만으로 각각 0.8550과 0.8491까지 올라가 회사가 설정한 배포 기준을 통과했다.
이 수치는 uniopen·AWS의 단일 업무 데이터에서 측정한 사례 결과다.
운영 구조도 참고할 만하다.
더 큰 Nova 2 Pro가 오류 사례의 수정안을 만들지만 사람이 확인한 수정만 학습 데이터에 들어간다.
새 모델은 필수 회귀 테스트인 hard gate를 통과하지 못하면 즉시 중단되고, 특정 클래스 성능 저하처럼 애매한 신호가 있는 soft gate에서는 관리자의 승인을 기다린다.
“모델을 한 번 파인튜닝하면 끝”이 아니라 실제 오류를 검증해 데이터로 돌려보내고, 고정 평가셋과 배포 기준으로 새 버전을 통제하는 프로덕션 AI 운영 과정을 구체적으로 볼 수 있는 글이다.
Jev’s Paradox: The hidden cost of cheap AI decisions
- 저자: Nash Borges
- 발행: Sophos AI Research
- 게시일: 2026-09-29
- 원문: Sophos — Jev’s Paradox: The hidden cost of cheap AI decisions
AI가 답변을 길게 생성하는 대신 “이 보안 경보가 악성인가?”, “어느 부서로 보내야 하는가?”처럼 정해진 선택지 사이에서 빠르고 저렴하게 결정을 내리면 무엇이 달라지는지를 분석한 글이다.
핵심 주제는 calibration(캘리브레이션) 이다.
모델이 90% 확신한다고 말한 판단이 실제로도 비슷한 조건에서 약 90% 맞아야 그 확률을 운영 의사결정에 사용할 수 있다는 개념이다.
글은 TypeSafe의 의사결정 모델 Jev에 대한 외부 테스트를 검토한다.
CLINC150의 200개 요청에서 Jev는 87% 정확도를 기록했고 GPT-5.6 Terra는 92%였지만, 응답 시간은 테스트 환경에서 Jev가 중앙값 0.44초, Terra가 1.51초였다.
문제는 Jev가 확신도 1.0을 준 102개 답변 가운데도 6개가 틀렸다는 점이다.
값싼 모델을 먼저 호출하고 확신이 낮을 때만 강한 모델로 넘기는 cascade 구조에서는 이런 과도한 확신이 중요한 약점이 된다.
글은 정확도, calibration, 그리고 “틀릴 것 같은 답을 실제로 골라낼 수 있는 능력”을 서로 다른 특성으로 구분한다.
보안 에이전트가 사람 없이 경보를 종료하려면 모델의 평균 정확도가 높다는 것만으로는 부족하며, 실제 조직의 데이터에서 확신 임계값을 별도로 검증해야 한다는 설명이다.
AI의 비용이 낮아질수록 자동화할 결정 수가 크게 늘기 때문에 작은 오류율도 전체 오류 건수에서는 커질 수 있다는 관점을 실제 벤치마크와 운영 설계에 연결한 점이 읽을 가치가 있다.
An Autonomous Agentic Trading Agent on Solana
- 저자: Charlie Sneed
- 발행: Ledger N3XT Research Competition
- 게시일: 2026-09-28
- 원문: Ledger — Auditing an Autonomous Trading Agent on Solana
AI 에이전트가 스스로 행동했다고 주장할 때 “무슨 생각을 했는지 기록하는 것”과 “실제로 그 행동을 했다는 것을 증명하는 것”은 다르다는 점을 작은 실전 감사 사례로 보여주는 글이다.
학생 연구자가 Solana에서 동작했던 자율 거래 에이전트 Omo의 공개 코드, 로그와 블록체인 기록을 직접 대조했다.
Ledger는 이 글을 학생 연구 대회 결과로 게시했으며 결론 자체를 보증하지 않는다고 명시한다.
Omo는 거래 전 자신의 판단문을 SHA-256 hash로 만들어 블록체인에 먼저 기록하고, 나중에 원문을 공개하는 구조였다.
이를 통해 판단이 사후에 바뀌지 않았음을 검증할 수 있었다.
연구자가 한 사례를 추적한 결과 판단문과 hash가 일치했고 기록도 거래보다 먼저 존재했으며 동일한 토큰이 등장했다.
그러나 네 번째 조건인 “Omo 자신의 지갑이 거래에 서명했는가” 에서 실패했다.
실제 연결된 트랜잭션은 거래가 아니라 다른 지갑이 Omo에게 토큰을 보낸 단순 전송이었다.
암호학적 기록 장치 자체는 제대로 작동했지만, 프로그램이 나중에 판단과 거래를 연결하는 로직이 서명자를 확인하지 않은 채 같은 토큰의 가까운 트랜잭션을 붙이면서 잘못된 인과관계를 만든 것이다.
일부 데이터 소스가 계속 실패하고 있었는데도 시스템이 “데이터 없음”과 “요청 실패”를 구분하지 못했다는 문제도 발견됐다.
에이전트가 실제 돈이나 외부 시스템을 다루기 시작하면 단순히 로그를 많이 남기는 것만으로 신뢰성을 증명할 수 없다.
의사결정 기록, 실제 행동을 승인한 신원·키, 행동 결과를 하나의 검증 가능한 연결 고리로 묶어야 한다는 점을 매우 구체적으로 보여주는 글이다.