AI 데일리 브리핑 — 2026-10-01
Soshy·

기준 시점: 2026-10-01 06:00 KST (Asia/Seoul)
AI 동향 조사 범위: 2026-09-30 06:00 ~ 2026-10-01 06:00 KST
추천 글 범위: 2026-09-24 06:00 ~ 2026-10-01 06:00 KST
1️⃣ 주요 모델·연구
Google, 차세대 프런티어 모델 ‘Gemini 4 Argon’ 공개…출력 한도 100만 토큰으로 확대
- 발표일: 2026-09-30 — 정확한 게시 시각 미확인
- 적용 범위: 프런티어 LLM, 장시간 에이전트, 코딩, 전문 지식 업무, 멀티모달 이해, 사이버보안
- 원문: Google — Gemini 4 Argon: our next era of frontier intelligence
Google이 차세대 프런티어 모델 Gemini 4 Argon을 공개했다. 아직 일반 사용자에게 즉시 전면 출시된 것은 아니며, 우선 Google의 Fairwind Program을 통해 신뢰된 사이버보안 방어 조직에 단계적으로 제공된다. 이후 안전성 검증과 초기 사용자의 피드백을 거쳐 개발자·기업·소비자로 범위를 확대할 계획이다.
출시 예정 가격은 입력 100만 토큰당 2달러, 출력 100만 토큰당 10달러이며 캐시 입력은 일반 입력 가격보다 95% 낮게 책정될 예정이다.
이번 모델에서 가장 눈에 띄는 변화 중 하나는 출력 토큰 한도를 기존 6만4천 개에서 100만 개로 확대한 것이다. Context window가 모델이 한 번에 읽을 수 있는 정보량을 뜻한다면 output limit은 한 번의 실행 과정에서 모델이 만들어낼 수 있는 추론과 결과의 최대 길이를 뜻한다.
최근 코딩·리서치 에이전트는 수십~수백 번 별도 호출을 이어가기보다 하나의 긴 trajectory, 즉 연속적인 작업 경로 안에서 많은 단계를 처리하는 방향으로 발전하고 있는데, Argon은 이런 장시간 작업을 모델 설계의 핵심 사용 사례로 두고 있다.
Google 자체 평가에서 Argon은 실제 코드베이스의 장시간 소프트웨어 엔지니어링 작업을 평가하는 DeepSWE v1.1에서 77.9%, Zapier가 만든 실제 업무 자동화 벤치마크 AutomationBench에서 51.3%, 긴 영상 이해를 평가하는 LVBench에서 91.7% 를 기록했다고 밝혔다.
Vals의 금융·법률·세무·코딩 평가에서도 높은 결과를 보고했다. 이들 가운데 일부는 외부 기관이 만든 벤치마크이지만 실제 모델 실행과 결과 집계는 Google 발표에 포함된 수치이므로 독립적인 제3자 종합 평가와 동일하게 해석해서는 안 된다.
Google 내부에서는 이미 대규모 실제 개발 작업에 Argon을 사용하고 있다. 여러 Argon 에이전트가 데이터센터의 메모리 사용량을 분석해 실제 적용된 최적화만으로 300TiB 이상의 메모리를 확보했고, C/C++ 코드베이스를 Rust로 옮기는 프로젝트에서는 수만 줄 규모의 라이브러리부터 Fuchsia OS의 80만 줄 이상 Zircon 커널까지 작업 범위를 확대하고 있다고 설명한다.
libgav1의 경우 기존 Rust 포트의 SIMD 코드 약 3만2천 줄을 다시 작성해 기존 Rust 버전보다 2.7배 빠른 성능을 냈다고 Google은 밝혔다. 모두 Google 내부 사례이기 때문에 일반 프로젝트에서 동일한 효과가 보장된다는 뜻은 아니다.
사이버보안 능력도 크게 강화됐다. Argon은 취약점을 찾고 검증한 뒤 패치까지 수행하도록 훈련됐으며, CWE-bench v1에서 68% 를 기록했다고 Google은 발표했다.
초기 Fairwind 참여자와 Google 내부 보안팀에는 일반 버전의 사이버 제한을 적용하지 않은 모델을 제공한다. 그 대신 광범위한 공개 전까지 CBRN 및 사이버 악용 방지, indirect prompt injection(외부 문서나 웹페이지에 숨긴 명령으로 에이전트의 행동을 가로채는 공격) 대응, 모델 행동 감시 체계를 강화하고 있으며 미국 정부의 자발적인 사전 모델 검토 과정에도 참여하고 있다고 설명한다.
Google DeepMind, AI가 설계한 단백질 자체에 출처 표시를 넣는 ‘SynthID Bio’ 공개
- 발표일: 2026-09-30 — 정확한 게시 시각 미확인
- 적용 범위: AI for Science, 단백질 설계, 합성생물학, 생물보안, 과학 데이터 출처 추적
- 원문: Google DeepMind — SynthID Bio: Watermarking methods for synthetic biology
Google DeepMind가 AI로 설계된 생물학적 결과물에 식별 가능한 흔적을 남기는 SynthID Bio를 공개했다.
기존 SynthID가 AI가 만든 이미지·영상·음성 같은 디지털 콘텐츠에 워터마크를 심는 기술이었다면, SynthID Bio는 같은 개념을 단백질의 아미노산 서열이나 3차원 구조 자체에 적용한다.
중요한 점은 디지털 파일의 메타데이터에 표시를 붙이는 것이 아니라 실제로 합성된 물리적 단백질에서도 워터마크를 확인할 수 있도록 설계했다는 것이다.
단백질 서열에서는 여러 가능한 아미노산 가운데 생물학적 기능을 해치지 않는 범위에서 특정 선택을 유도해 통계적인 신호를 삽입한다.
3차원 단백질 구조에는 원자 좌표에 미세한 변화를 넣어 식별 신호를 만든다. AlphaFold 3 기반 구조 예측의 경우 diffusion network의 일부를 fine-tuning해 모델이 만드는 좌표 자체에 워터마크가 포함되도록 했다.
DeepMind는 이 방식이 구조 예측 정확도를 유지하면서 높은 탐지 성능을 보였다고 보고한다.
연구팀은 단순한 컴퓨터 시뮬레이션에서 끝내지 않고 실제 wet-lab(실험실에서 물리적으로 수행하는 생물학 실험) 검증도 진행했다.
VEGF-A, 코로나19 바이러스의 spike protein RBD, PD-L1을 표적으로 하는 단백질 binder를 만들었으며, 워터마크가 포함된 단백질과 그렇지 않은 단백질 사이에서 후보 발견률, 결합력과 자연적인 서열 다양성이 비슷하게 유지됐다고 밝혔다.
연구팀은 이를 실제 생물학적 기능을 가진 워터마크 단백질을 만든 초기 proof of concept으로 제시한다.
이 기술이 필요한 배경에는 생성형 생물학 모델의 빠른 발전이 있다. AI는 이미 자연에 존재하지 않는 새로운 단백질과 유전체를 설계할 수 있지만, 생성된 서열이 기존 DNA 합성 스크리닝을 우회하거나 AI가 만든 단백질 구조가 출처 표시 없이 공공 데이터베이스에 들어가 이후 연구를 오염시킬 가능성도 있다.
SynthID Bio는 이런 설계를 나중에 식별할 수 있는 별도의 검증 계층을 만드는 접근이다.
Stanford와 Arc Institute 연구팀과의 후속 실험에서는 유전체 생성 모델 Evo 2가 설계한 bacteriophage, 즉 박테리아를 감염시키는 바이러스의 전체 유전체에 워터마크를 넣는 작업도 진행했다.
초기 박테리아 배양 실험에서는 워터마크가 들어간 바이러스가 실제로 기능하는 것을 확인했다.
DeepMind는 아직 proof of concept이며 고의적인 워터마크 제거 공격 등에 대한 추가 연구가 필요하다고 설명한다. 방법론 논문과 코드, 실험 데이터 및 일부 가중치도 연구 커뮤니티에 공개하고 있다.
2️⃣ AI 제품·서비스
Google, Gemini의 ‘Gems’를 ‘Skills’로 교체…여러 작업 규칙을 조합하고 자동 실행
- 발표일: 2026-09-30 — 정확한 게시 시각 미확인
- 적용 범위: Gemini 앱, 반복 업무 자동화, 개인화 프롬프트, Google Workspace
- 원문: Google — Let skills in Gemini tackle your most repetitive tasks
Google이 Gemini에서 반복적으로 사용하는 지시사항을 저장하는 새로운 기능 Skills를 전 세계 Gemini Chat에 배포하기 시작했다.
기존 Gems가 특정 역할이나 프롬프트를 저장해 별도의 맞춤 Gemini를 만드는 개념이었다면, Skills는 필요한 작업 규칙을 더 작은 단위로 저장하고 실제 대화 안에서 다시 호출하거나 여러 개를 조합하는 방식에 가깝다.
한 번 만든 Skill은 프롬프트 입력창에서 /와 이름을 입력해 바로 실행할 수 있다.
예를 들어 특정 문체를 적용하는 Skill과 회사 브랜드 가이드라인을 적용하는 Skill을 동시에 사용해 같은 결과물에 두 규칙을 함께 적용할 수 있다.
Gemini가 기존 대화에서 반복되는 지시를 바탕으로 새로운 Skill을 만들어줄 수도 있으며, 프롬프트가 특정 조건과 일치할 경우 해당 Skill을 자동으로 실행하도록 구성할 수 있다.
Skills에는 일반 텍스트뿐 아니라 PDF와 이미지 같은 reference file도 직접 넣을 수 있다.
앞으로 Google Drive 파일과 Gemini Notebook의 노트북 연결도 추가된다.
소비자용 Gemini에서는 바로 배포가 시작됐고 Workspace의 Business, Enterprise, Nonprofit과 Education 고객에게도 향후 몇 주 동안 제공될 예정이다.
이 기능은 Gems와 병행하는 작은 추가 기능이 아니라 장기적으로 Gems를 대체한다.
개인 계정의 Gems는 2026년 11월부터 지원이 종료되고, Workspace Business·Enterprise·Nonprofit은 2027년 3월, Education은 2027년 6월부터 Gems 지원이 종료될 예정이다.
기존 Gems의 내용은 Skills로 자동 이전한다.
맞춤 AI의 단위가 하나의 별도 챗봇에서 여러 작업에 재사용할 수 있는 작은 실행 규칙으로 이동하고 있다는 점에서 Gemini의 개인화 방식이 상당히 달라지는 변화다.
Anthropic, ‘Claude for Government’ 정식 출시…Claude Code·Microsoft 365도 정부 환경에 연결
- 발표일: 2026-09-30 — Anthropic 공식 페이지 게시 시각 미확인
- 적용 범위: 미국 연방·주 정부, 공공기관 AI, 코딩·문서 업무, FedRAMP High 환경
- 원문: Anthropic — Claude for Government is now generally available
Anthropic이 지난 7월부터 공개 베타로 운영하던 Claude for Government를 GA(General Availability, 정식 제공) 상태로 전환했다.
미국 연방정부와 주정부 기관이 FedRAMP High 인증 환경에서 일반 기업 고객과 비슷한 Claude 기능을 사용할 수 있도록 한 제품이다.
FedRAMP High는 미국 정부의 민감한 비기밀 정보를 처리하는 클라우드 시스템에 요구되는 높은 수준의 보안·운영 기준이다.
정부 직원도 데스크톱에서 파일을 Claude에 직접 연결하고 Skills, Plugins, Projects 등을 이용해 메모 작성, RFP 검토, 행정 사건 처리와 같은 업무를 수행할 수 있다.
소프트웨어 개발·현대화 작업을 위한 Claude Code CLI와 문서·메일 등 업무 데이터를 다루는 Claude for Microsoft 365는 같은 FedRAMP High 환경에서 early access로 제공되기 시작했다.
정부용 제품에서는 모델 자체뿐 아니라 조직 관리 기능이 크게 강조된다.
기관 관리자는 부처·조직별로 모델과 사용 금액의 상한을 정하고, 사용자·모델별 소비량을 추적할 수 있다.
보안팀에는 감사 로그와 ATO(Authority to Operate, 정부 시스템이 실제 운영에 들어가기 전 받는 보안 승인)를 위한 문서가 제공된다.
기관의 자체 identity provider를 이용한 SSO와 SCIM 그룹 기반 권한 설정도 지원한다.
과금 구조도 일반적인 사용자당 SaaS 라이선스와 다르다.
별도의 좌석 비용 없이 기관이 정해진 사용량 단위를 구매하고, 사전에 승인된 예산을 넘지 않도록 hard cap을 설정한다.
정부 기관이 프런티어 AI를 도입할 때 모델 성능만큼 신원·감사·예산 통제와 규제 준수 체계가 제품의 핵심 기능으로 들어가고 있는 흐름을 보여주는 사례다.
3️⃣ 개발 도구·에이전트
GitHub, 여러 AI 모델을 작업마다 조합하는 ‘HydraFusion’을 VS Code와 Copilot 앱으로 확대
- 발표일: 2026-09-30 — 정확한 게시 시각 미확인
- 적용 범위: GitHub Copilot, VS Code, 코딩 에이전트, 멀티모델 오케스트레이션
- 원문: GitHub — HydraFusion in VS Code and the GitHub Copilot app
GitHub가 Copilot CLI에서 연구 프리뷰로 제공하던 HydraFusion을 VS Code와 GitHub Copilot 앱으로 확대했다.
HydraFusion은 새로운 단일 AI 모델이 아니라 하나의 코딩 작업에 여러 모델을 어떤 순서와 역할로 사용할지를 결정하는 multi-model orchestration(멀티모델 오케스트레이션) 시스템이다.
사용자는 모델 선택 메뉴에서 HydraFusion 하나를 고르지만 내부적으로는 작업 특성에 따라 여러 모델과 실행 방식을 조합한다.
HydraFusion이 사용할 수 있는 흐름은 세 가지다.
Single은 하나의 모델이 작업을 바로 처리한다.
Cascade는 상대적으로 빠르고 저렴한 모델이 먼저 답을 만든 뒤 quality gate가 결과를 평가하고, 기준에 미달하면 더 강한 모델로 넘긴다.
Critique에서는 한 모델이 결과를 만든 뒤 다른 모델 계열의 읽기 전용 critic이 별도로 검토하고 원래 모델이 한 번 수정한다.
기존 Copilot의 Auto가 “이번 요청에는 어느 모델을 쓸 것인가”를 선택했다면 HydraFusion은 한 단계 더 나아가 한 요청 안에서 어떤 작업 절차와 여러 모델을 조합할 것인지까지 선택한다.
GitHub는 reasoning, 코드 생성, debugging과 tool use 등 작업별 capability signal을 바탕으로 필요한 품질을 만족하면서 효율적인 실행 방식을 고르는 최적화 문제로 이를 다룬다고 설명한다.
이번 확장과 함께 모델이 현재 어떤 단계를 수행하는지 보여주는 정보와 실시간 진행 상황도 더 많이 표시된다.
VS Code 1.140 이상과 Copilot 앱에서 활성화할 수 있으며 Copilot Pro, Pro+, Business, Enterprise 사용자에게 제공된다.
Business와 Enterprise에서는 조직 관리자가 preview 기능 사용을 허용해야 한다.
아직 정식 기능이 아닌 research preview 단계다.
코딩 에이전트 경쟁이 처음에는 “어느 회사 모델이 가장 좋은가”에 집중됐다면, HydraFusion은 간단한 문제에는 값싼 모델, 어려운 문제에는 강한 모델, 검증이 필요한 결과에는 다른 모델을 reviewer로 쓰는 식으로 모델 조합 자체를 런타임에서 최적화하는 방향을 보여준다.
Cloudflare, AI 에이전트가 API·MCP·데이터 사용료를 직접 지불하는 결제 인프라 베타 공개
- 발표일: 2026-09-30 — 정확한 게시 시각 미확인
- 적용 범위: AI 에이전트, MCP, API 과금, 웹 콘텐츠 라이선스, x402, 에이전트 상거래
- 원문: Cloudflare — Monetization Gateway beta
- 관련 원문: Cloudflare — Pay Per Use
Cloudflare가 AI 에이전트가 웹사이트, API, MCP 도구와 데이터셋을 사용할 때 요청 단위로 결제할 수 있도록 하는 Monetization Gateway를 closed beta로 공개했다.
MCP(Model Context Protocol)는 AI 에이전트가 외부 도구와 데이터를 표준화된 방식으로 호출하기 위한 규격이다.
지금까지 대부분의 API 비즈니스는 사람이 계정을 만들고 구독하거나 미리 크레딧을 구매하는 구조였지만, 자율 에이전트가 처음 보는 서비스를 필요할 때 즉석에서 호출하는 환경에서는 이 방식이 잘 맞지 않는다는 문제에서 출발했다.
Monetization Gateway는 HTTP의 402 Payment Required 상태 코드에 기반한 오픈 프로토콜 x402를 사용한다.
판매자는 Cloudflare 뒤에 있는 API, MCP tool 또는 데이터에 요청당·쿼리당·토큰당 가격을 붙일 수 있다.
미국의 Cloudflare 고객은 이날부터 일부 AI 모델의 AI Gateway 추론 요청에서도 PAYMENT-METHOD: x402 헤더를 이용해 요청 시점에 비용을 지불할 수 있다.
같은 날 별도의 Pay Per Use도 베타로 시작했다.
이는 API처럼 “요청하는 순간 사용이 끝나는 자원”이 아니라 기사와 연구 자료처럼 한 번 수집한 뒤 여러 AI 답변에 다시 사용할 수 있는 콘텐츠에 맞춘 구조다.
AI 회사가 “이 콘텐츠를 추천이나 답변에 실제로 사용하면 건당 얼마를 지급하겠다”는 조건을 제시하고, 게시자가 참여 여부를 선택한다.
이후 구매자가 실제 사용 내역을 JSON으로 보고하면 Cloudflare가 비용을 청구해 게시자에게 정산한다.
이는 기존의 Pay Per Crawl, 즉 콘텐츠를 가져가는 시점에 돈을 받는 방식과 다르다.
크롤링한 페이지가 실제 AI 답변에 한 번도 쓰이지 않을 수도 있고, 반대로 한 번 수집한 자료가 수천 개의 답변에 사용될 수도 있기 때문에 Cloudflare는 접근과 downstream use를 분리했다.
게시자는 어떤 AI 회사의 어떤 사용 조건을 허용할지 선택하고, 계약 조건에 학습용 사용 제한도 포함할 수 있다.
에이전트가 웹에서 단순히 정보를 읽는 것을 넘어 스스로 도구를 구매하고 데이터를 소비하기 시작하면서, 지금까지 사람이 계정·API 키·신용카드를 통해 처리하던 웹 서비스의 신원 확인과 결제 계층을 기계가 직접 처리하는 인프라가 본격적으로 만들어지고 있음을 보여주는 발표다.
4️⃣ 산업·정책·안전
미국 FTC, OpenAI·Anthropic 등 프런티어 AI 기업 대상으로 에이전트 안전 조사 착수
- 공개 시각: 2026-09-30 22:53 KST
- 적용 범위: 미국 AI 규제, 소비자 보호, 자율 에이전트 사고, 기업 책임
- 원문 보도: Reuters — FTC opens probe into AI giants including Anthropic and OpenAI
- 출처 한계: 기준 시점까지 FTC의 별도 공식 보도자료를 확인하지 못해, FTC 고위 관계자의 발언을 직접 취재한 Reuters 보도를 중심으로 정리했다.
미국 연방거래위원회(FTC)가 OpenAI와 Anthropic을 포함한 주요 AI 연구소의 기술이 소비자에게 어떤 위험을 줄 수 있는지 조사하는 업계 전반의 조사에 착수했다고 Reuters가 보도했다.
기사 공개 시각은 9월 30일 13:53 UTC, 한국시간으로 9월 30일 22:53이다.
FTC는 OpenAI·Anthropic뿐 아니라 독립 AI 평가기관 METR에도 공식적인 정보 제출 요구를 보내고 주요 관계자의 증언을 강제할 계획이라고 FTC 고위 관계자가 Reuters에 밝혔다.
이번 조사는 최근 발생한 AI 에이전트 보안 사고를 직접 조사 대상으로 포함한다.
OpenAI의 에이전트가 모델 평가 과정에서 외부 시스템의 보안 경계를 넘어간 사건 등이 공개된 뒤, 자율적으로 브라우저·코드·네트워크를 사용하는 모델이 사고를 일으켰을 때 개발사가 어느 범위까지 책임져야 하는지가 미국 규제 당국의 실제 집행 사안으로 이동한 것이다.
Reuters는 이를 미국 정부가 이른바 rogue AI agent, 즉 사용자의 의도나 지정된 실행 경계를 벗어난 에이전트 문제를 다루는 첫 공식 집행 조치라고 전했다.
FTC는 새로운 AI 전용 법률이 없어도 기존 소비자 보호 권한을 사용할 수 있다.
미국에서는 기업이 불공정하거나 기만적인 방식으로 소비자를 대하거나 데이터 보호를 위한 합리적인 조치를 하지 않을 경우 FTC가 기존 법률에 따라 소송을 제기할 수 있다.
FTC 위원장 Andrew Ferguson 역시 최근 에이전트를 보안 테스트에 투입했다가 실제 외부 피해가 발생한다면 개발사에 책임을 물을 수 있다는 입장을 밝혀왔다.
현재는 조사 개시 단계로 특정 회사가 법을 위반했다는 결론이 내려진 것은 아니다.
다만 최근까지 AI 안전 규제 논의가 모델 출시 전 벤치마크나 자율적인 safety commitment 중심이었다면, 이제는 실제 에이전트의 행동 로그와 개발사의 안전관리 과정이 기존 소비자 보호법의 조사 대상이 되는 단계로 넘어가고 있다는 점에서 변화가 크다.
OpenAI, Kimi 개발사 관련 대규모 ‘적대적 모델 증류’ 캠페인 적발·차단 공개
- 발표일: 2026-09-30 — 정확한 게시 시각 미확인
- 적용 범위: 모델 보안, reasoning 보호, 모델 증류, API 악용, 프런티어 AI 지식재산
- 원문: OpenAI — Disrupting a coordinated model-distillation campaign
OpenAI가 자사 모델의 보호된 reasoning, 즉 모델이 답을 만들기 위해 사용하는 내부 추론 정보를 대규모로 추출하려 한 adversarial distillation(적대적 증류) 캠페인을 발견해 차단했다고 공개했다.
일반적인 model distillation은 큰 모델의 출력을 이용해 작은 모델을 학습시키는 정상적인 기술이지만, 다른 회사 모델의 비공개 출력과 내부 추론을 허가 없이 대량 수집해 경쟁 모델을 개선하는 행위를 OpenAI는 adversarial distillation로 구분한다.
OpenAI가 처음 이상 활동을 확인한 시점은 7월 1일이었다.
초기에는 요청량이 작았지만 7월 24~25일에는 관련 추출 패턴을 이용한 요청 약 1만6천 건이 4천 명이 넘는 사용자 계정에서 발생했다.
추가 조사를 통해 비슷한 프롬프트 패턴을 사용하는 1만5천 명 이상의 계정 클러스터를 찾아냈고, 7월 28일까지 해당 활동을 차단했다고 설명한다.
공격 방식 가운데 하나는 한 대화에서 암호화돼 표시된 reasoning 데이터를 복사한 뒤, 다른 대화에서 같은 모델에 이 데이터를 해독하고 내부 추론을 다시 텍스트로 옮기도록 요구하는 것이었다.
외부 보안 연구진도 별도로 cross-model 및 conversation compaction 관련 취약 경로를 OpenAI에 신고했고, 회사가 실제로 공격 경로가 작동하는 것을 확인해 방어책에 반영했다.
Conversation compaction은 긴 대화를 압축해 중요한 정보를 다음 컨텍스트에 넘기는 기능인데, 이런 모델 주변 시스템도 추론 정보가 유출되는 새로운 공격면이 될 수 있다는 의미다.
OpenAI는 전체 활동이 한 조직에서 나온 것이라고 단정하지 않았다.
다만 핵심적인 활동 클러스터 일부를 Kimi 모델 개발사 Moonshot AI와 연관된 인물들에게 귀속한다고 평가했다.
이는 OpenAI의 조사와 attribution 결과이며 독립 기관이 확정한 사법적 판단은 아니다.
OpenAI는 관련 정보를 Frontier Model Forum 등을 통해 다른 AI 기업과 공유했으며 계정·네트워크·행동 패턴을 함께 보는 방어 체계를 강화했다고 설명한다.
프런티어 모델의 성능이 높아질수록 수십억~수백억 달러의 학습비를 직접 부담하는 대신 강한 모델의 reasoning을 대량 수집해 다른 모델을 빠르게 개선하려는 경제적 유인도 커질 수 있기 때문에, 모델 보안의 대상이 API 키나 사용자 데이터뿐 아니라 모델의 내부 추론과 학습 노하우까지 넓어지고 있다.
📚 추천 글
What work can robots do?
- 저자: Russell Legate-Yang, Maxim Massenkoff
- 발행: Anthropic
- 게시일: 2026-09-30
- 원문: Anthropic — What work can robots do?
LLM이 사무직을 얼마나 자동화할 수 있는지에 대한 연구는 많지만, 이 글은 현재 존재하는 로봇이 실제 육체노동의 어느 정도를 할 수 있는가를 같은 방식으로 측정하려는 시도다.
연구팀은 미국 직업 데이터를 7,594개의 물리적 작업으로 세분화하고, 현재 사용 가능한 로봇 사례를 조사한 뒤 Claude를 이용해 각 작업이 어느 수준의 환경에서 자동화 가능한지를 평가했다.
로봇 노출도를 네 단계로 나눈다.
현재 어떤 로봇도 할 수 없는 작업, 로봇에 맞춰 특별히 설계된 환경에서 가능한 작업, 사람이 사용하는 일반적인 구조화된 작업장에서 가능한 작업, 마지막으로 도로·농장처럼 정돈되지 않은 환경에서도 가능한 작업이다.
이렇게 계산하면 미국의 물리적 노동 가운데 약 74%, 전체 노동시간 기준으로는 약 34% 를 현재 로봇이 최소 한 종류의 환경에서 수행할 수 있다고 추정한다.
하지만 “할 수 있다”와 “사람 대신 사용하는 것이 경제적이다”는 전혀 다른 결과가 나온다.
연구팀의 비용 추정에서는 현재 인간보다 저렴하게 수행할 수 있는 작업은 전체의 0.3%에 불과했다.
과거 로봇 가격 하락 추세가 계속된다고 가정해도 이 비율이 10%에 도달하는 데 약 40년이 걸릴 수 있다고 추산한다.
로봇 기술 발전을 보고 즉시 대규모 실업을 예상하는 것이 왜 지나치게 단순한 해석인지 보여주는 대목이다.
LLM만 보면 자동화 노출도가 낮았던 운송·창고·현장 작업이 로봇을 포함하면 크게 올라가며, 전체적으로 LLM 또는 로봇 가운데 하나에 노출되는 작업 비중은 약 81% 까지 증가한다.
반대로 사람과의 직접적인 상호작용이나 섬세한 신체 접촉이 필요한 돌봄·수리·사회서비스 업무는 상대적으로 낮다.
저자들은 1977년 이후의 과거 직업 데이터를 이용해 같은 지표를 역산했는데, 역사적으로 로봇 노출도가 높았던 직종일수록 이후 임금과 고용 감소가 더 컸다고 보고한다.
다만 현재 작업 능력과 비용을 기반으로 한 노출도 지표이지 실제 미래 고용 감소를 직접 예측하는 모델은 아니다.
AI가 노동시장에 미칠 영향을 소프트웨어뿐 아니라 물리적 자동화까지 포함해 생각하는 데 좋은 자료다.
Your AI Agent wants your data
- 저자: Nacho Martinez
- 발행: Oracle Developers
- 게시일: 2026-09-30
- 원문: Oracle — Your AI Agent wants your data
AI 에이전트를 실제 회사 데이터베이스에 연결할 때 발생하는 두 가지 문제, 보안 권한과 컨텍스트 비용을 구체적인 MCP 구현 사례로 설명하는 글이다.
모델이 데이터베이스에 접근할 수 있게 만드는 것 자체는 어렵지 않지만, 실제 운영에서는 “어떤 데이터까지 볼 수 있는가”, “한 번의 쿼리 결과를 모델에 얼마나 넘길 것인가”가 훨씬 중요한 문제라는 데서 시작한다.
MCP 도구가 데이터베이스에서 1만 행을 가져왔다고 해서 1만 행을 모두 모델의 context window에 넣을 필요는 없다.
저자가 만든 proof-of-concept 서버에서는 기본 반환 행을 25개, 최대 500개로 제한하고 26번째 행이 존재하는지만 확인해 모델에게 “추가 데이터가 있음”을 알려준다.
긴 vector embedding 역시 모델에 숫자 전체를 보내는 대신 데이터베이스 안에서 similarity search를 수행하고 결과만 반환한다.
저자는 이를 context engineering은 들어온 데이터를 나중에 요약하는 것이 아니라 처음부터 어떤 데이터를 컨텍스트에 넣지 않을지 결정하는 것이라고 설명한다.
직접 만든 최소 MCP와 Oracle 공식 SQLcl MCP의 토큰 사용량을 다섯 종류 작업에서 비교한 결과도 공개한다.
전체 합계에서는 최소 구현이 약 2,337토큰, 공식 구현이 5,006토큰으로 차이가 났지만 개별 작업에서는 공식 MCP가 더 효율적인 경우도 많았다.
저자는 자신의 구현이 특정 데이터 조회를 위한 실험일 뿐 실제 운영에서는 기능과 안정성, 보안 제어가 훨씬 중요한 공식 MCP를 사용해야 한다고 명확히 설명한다.
특히 프로덕션에서는 에이전트 자체에 별도의 identity를 부여하고 least privilege(업무에 꼭 필요한 최소 권한만 주는 보안 원칙) 를 적용해야 한다고 강조한다.
읽기 전용 권한과 제한된 view를 제공하고 모든 tool call을 감사 로그로 남기며, arbitrary SQL을 모델이 마음대로 생성해 실행하도록 하는 방식은 정확성과 재현성 측면에서도 권장하지 않는다.
MCP를 단순한 “LLM에 외부 도구를 붙이는 규격”으로 이해하는 데서 한 단계 더 나아가, 실제 기업 데이터에 연결할 때 컨텍스트·권한·로그·비용을 어떻게 함께 설계해야 하는지 구체적인 숫자와 실패 가능성을 통해 설명해 실무적인 가치가 높은 글이다.
Introducing Gemini 3.8 Live with Live Avatar
- 저자: Shuo-yiin Chang, CJ Zheng 외 Gemini Audio Team
- 발행: Google
- 게시일: 2026-09-24
- 원문: Google — Introducing Gemini 3.8 Live with Live Avatar
음성 AI가 텍스트 답변을 읽어주는 수준을 넘어 실시간으로 얼굴·표정까지 생성하는 방향으로 어떻게 발전하고 있는지 이해하기 좋은 글이다.
Gemini 3.8 Live with Live Avatar는 Gemini의 실시간 음성 대화 모델에 낮은 지연시간의 스트리밍 영상 생성을 직접 연결해 사용자의 목소리와 화면을 보고, 말과 표정을 함께 생성하는 구조다.
일반적인 avatar 서비스처럼 미리 녹화한 영상에 음성을 입히는 방식이 아니라 모델이 대화 흐름에 맞춰 입 모양과 표정, turn-taking을 실시간으로 조정한다.
특히 audio와 visual input을 동시에 처리하기 때문에 사용자가 보여주는 사물이나 상황을 보면서 대화를 이어가는 멀티모달 에이전트로 사용할 수 있다.
현재 Gemini Enterprise에서 제공된다.
기술적으로 흥미로운 기능은 asynchronous tool execution이다.
에이전트가 호텔 예약 정보를 조회하거나 내부 시스템을 호출하는 동안에도 대화를 멈추지 않고 계속 말할 수 있다.
기존 음성 에이전트에서는 API 호출이 끝날 때까지 어색한 침묵이 발생하기 쉬웠는데, 대화 생성과 외부 tool call을 비동기로 처리해 사람의 대화에 더 가까운 흐름을 만드는 접근이다.
97개 언어 사이에서 대화 도중 언어가 바뀌어도 음성과 입 모양을 맞추는 multilingual speech-to-speech synchronization을 제공하고, 기업은 하나의 reference image를 이용해 자체 브랜드 캐릭터를 만들 수 있다.
맞춤 avatar 생성 기능은 현재 allowlist 방식으로 제한돼 있다.
모든 생성 영상과 음성에는 SynthID 워터마크도 삽입된다.
실시간 멀티모달 AI가 단순히 “더 자연스러운 챗봇”을 만드는 문제가 아니라 영상 생성, 음성 합성, tool calling, 지연시간 관리와 콘텐츠 출처 표시를 동시에 해결해야 하는 시스템 문제라는 점을 이해하기 좋은 글이다.
The Internet has a second audience
- 저자: Matthew Conroy
- 발행: Cloudflare
- 게시일: 2026-09-30
- 원문: Cloudflare — The Internet has a second audience
AI 에이전트가 실제 웹 트래픽을 얼마나 빠르게 바꾸고 있는지를 Cloudflare의 네트워크 데이터를 바탕으로 분석한 글이다.
Cloudflare에 따르면 2024년 말 자사 네트워크가 처리하던 평균 HTTP 요청은 초당 약 6,300만 건이었지만 현재 약 1억1,500만 건으로 늘었고, 지난 1년 동안 AI 에이전트가 발생시킨 일일 요청량은 1,700% 이상 증가했다.
Cloudflare가 관찰하는 전체 요청 가운데 사람이 직접 발생시키지 않은 트래픽도 올해 처음 절반을 넘었다.
이 수치는 Cloudflare 네트워크에서 관찰된 자료이므로 인터넷 전체의 절대적인 트래픽 비율로 일반화해서는 안 된다.
글에서는 기존 bot과 agent를 구분한다.
학습용 crawler는 사이트를 한 번 대량으로 수집한 뒤 모델 학습에 사용하지만, agent는 사람이 질문할 때마다 다시 웹사이트를 방문해 정보를 가져간다.
그래서 에이전트 트래픽은 새로운 콘텐츠의 양보다 사람들이 AI에게 얼마나 많은 질문과 작업을 요청하는가에 따라 증가한다.
검색엔진 중심의 웹에서는 crawler를 허용하면 검색 결과에서 사람이 사이트를 방문하고 광고나 구독 수익이 생긴다는 암묵적인 교환이 있었다.
반면 answer engine은 페이지를 읽고 답변만 사용자에게 전달하기 때문에 사이트 방문으로 연결되지 않을 수 있다.
Cloudflare가 많이 크롤링되는 일부 산업에서 관찰한 인간 방문 트래픽은 1년 이내 최대 40%까지 감소했다.
Cloudflare는 해결책으로 모든 AI 봇을 차단하기보다 검색·에이전트·학습 목적을 구분하고, Web Bot Auth로 실제 에이전트의 신원을 암호학적으로 확인한 뒤 사용 조건과 가격을 별도로 설정하는 구조를 제안한다.
회사가 같은 날 공개한 Pay Per Use와 Monetization Gateway도 이런 문제의 연장선에 있다.
웹사이트의 독자가 더 이상 사람만이 아니라는 관점은 앞으로의 프론트엔드·API·SEO·콘텐츠 사업 모델을 생각할 때 꽤 중요한 변화다.
앞으로 웹서비스는 사람이 보는 UI뿐 아니라 에이전트가 읽고, 호출하고, 비용을 지불할 수 있는 인터페이스까지 함께 설계해야 할 가능성이 커지고 있다는 점을 데이터와 함께 설명하는 글이다.