AI 데일리 브리핑 — 2026-09-22
Soshy·

기준 시점: 2026-09-22 06:00 KST (Asia/Seoul)
AI 동향 조사 범위: 2026-09-21 06:00 ~ 2026-09-22 06:00 KST
추천 글 범위: 2026-09-15 06:00 ~ 2026-09-22 06:00 KST
1️⃣ 주요 모델·연구
SpaceXAI, 장시간 코딩·지식 업무에 초점을 둔 Grok 4.7 공개
- 발표일: 2026-09-21 — 정확한 게시 시각 미확인
- 적용 범위: 코딩, 장시간 에이전트 작업, 전문 지식 업무, 멀티모달 입력, API 기반 애플리케이션
- 원문: SpaceXAI — Introducing Grok 4.7
SpaceXAI가 Grok 4.7을 공개했다. 회사 설명에 따르면 이전 Grok 4.6보다 더 큰 새로운 기반 모델을 사용하고, 더 긴 강화학습(RL, 모델이 시행착오와 보상을 통해 행동을 개선하도록 학습시키는 방식) 과정과 난도가 높은 훈련 작업을 적용했다. 특히 몇 분 안에 끝나는 문제보다 수시간이 걸리는 작업의 비중을 높였으며, 스스로 결과를 검증하는 능력과 긴 컨텍스트 관리도 강화했다. Grok Bot의 에이전트 실행 환경인 ‘harness’ 자체를 모델이 이해하도록 훈련했다는 점도 이번 세대의 특징이다.
공개된 API 가격은 100만 토큰당 입력 $2, 출력 $6부터다. 일반 Grok 4.7과 함께 출력 속도를 약 두 배로 높인 Fast 변형도 제공한다. 모델은 Grok API와 Cursor, Grok Build, 외부 코딩 harness와 모델 라우터 등을 통해 사용할 수 있다.
SpaceXAI는 CursorBench 4.0에서 Grok 4.7이 46.3%를 기록해 Grok 4.6의 40.4%보다 향상됐다고 보고했다. DeepSWE v1.1에서는 71.0%, 여러 시간 동안 터미널 작업을 수행하는 Terminal-Bench 4.0에서는 38.0%를 제시했다. 다만 해당 수치들은 SpaceXAI가 공개한 평가 결과이며, 모델별 실행 조건과 reasoning effort가 모두 동일한 독립 평가라고 볼 수는 없다.
안전 측면에서는 새로운 safeguard stack을 적용했다. SpaceXAI는 생물안전 평가인 LatchBio에서 62.4%를 기록했으며, 회사가 만든 사이버보안 평가 HackerBench v0.3에서는 위험한 이중용도 요청 가운데 3.3%만 허용했다고 밝혔다. 이 역시 회사가 보고한 결과이므로 외부 독립 검증과 구분해서 볼 필요가 있다.
이번 변화는 최근 코딩 모델 경쟁의 평가 단위가 짧은 알고리즘 문제에서 수시간 동안 파일과 도구, 외부 환경을 오가며 계획을 수정하는 작업으로 이동하고 있음을 보여준다. 긴 컨텍스트를 지원하는 것 자체보다, 장시간 작업 중 무엇을 기억하고 언제 결과를 재검증하며 실패한 도구 호출에서 어떻게 복구하는지가 모델의 주요 능력으로 다뤄지고 있다.
Microsoft Research, 분자 합성 경로 예측 모델 ‘RetroChimera’ 오픈소스 공개
- 발표일: 2026-09-21 — 정확한 게시 시각 미확인
- 적용 범위: 의약품 후보 물질, 신소재·기능성 소재, 분자 설계, 자동화 화학 연구
- 원문: Microsoft Research — Improving synthesis prediction of small molecules at scale with RetroChimera
Microsoft Research가 최근 Nature에 게재된 RetroChimera 연구를 소개하면서 구현 코드와 모델 가중치를 MIT 라이선스로 공개했다. RetroChimera가 다루는 문제는 역합성(retrosynthesis) 이다. 원하는 최종 분자에서 출발해 “어떤 반응을 거꾸로 적용하면 더 단순한 전구체를 얻을 수 있는가”를 반복적으로 계산하고, 최종적으로 실제 조달 가능한 출발 물질까지 이어지는 합성 경로를 찾는 문제다.
신약이나 소재 후보를 컴퓨터로 빠르게 설계하더라도 실험실에서 실제로 합성할 방법을 찾지 못하면 활용하기 어렵다. 따라서 역합성은 AI 기반 분자 설계가 실제 연구로 이어지는 과정에서 중요한 병목 중 하나다.
RetroChimera는 서로 성격이 다른 두 모델을 결합한다. R-SMILES 2는 Transformer 기반 생성 모델로 목표 분자에서 직접 전구체를 생성한다. 학습 데이터에 명시적으로 존재하지 않는 조합까지 탐색할 수 있다는 장점이 있지만, 화학적으로 부적절한 반응을 생성할 가능성도 있다.
반대로 NeuralLoc은 분자와 알려진 반응 템플릿을 그래프로 표현하는 그래프 신경망(GNN, 노드와 연결 관계로 구성된 데이터를 처리하는 신경망) 이다. 기존 화학 반응에 더 강하게 근거한 결과를 만들 수 있지만 템플릿 라이브러리에 포함되지 않은 반응을 다루는 데는 제약이 있다.
RetroChimera는 이 두 모델의 후보에 순위별 가중치를 학습해 결합한다. 연구진은 블라인드 평가에서 박사급 화학자들이 개별 반응 예측에 대해 기존 모델보다 RetroChimera를 더 자주 선호했다고 보고했다. 난도가 높은 10개 표적 분자의 전체 다단계 합성 경로를 평가했을 때는 9개의 경로가 전문가에게 수용돼 90%의 수용률을 기록했다. 비교 대상으로 사용한 개별 구성 모델과 기존 접근은 20~50% 수준이었다.
이는 논문 연구팀과 외부 연구 협력자들이 수행한 평가이며 별도의 상업적 벤치마크 기관이 검증한 수치는 아니다. Microsoft는 모델 코드와 가중치를 GitHub에 공개했고 Microsoft Foundry에서도 접근할 수 있도록 했다.
장기적으로는 실험실 자동화와 결합해 AI가 분자를 설계하고, 합성 경로를 만들고, 로봇 실험 결과를 다시 모델에 반영하는 폐쇄 루프(closed loop) 연구 시스템으로 이어질 수 있다. 범용 LLM의 대화 성능보다는 “설계 가능한 분자”와 “실제로 만들 수 있는 분자” 사이의 간극을 줄이는 과학 AI 사례라는 점에서 의미가 있다.
OpenAI, 내부 수학 모델이 100개 넘는 미해결 문제를 해결했다고 발표하고 독립 자문그룹 구성
- 발표일: 2026-09-21 — 정확한 게시 시각 미확인
- 적용 범위: 수학 연구, AI 기반 정리 증명과 문제 해결, AI 연구 결과 검증·공개 절차
- 원문: OpenAI — Advisory Group on Mathematics and Artificial Intelligence
OpenAI는 8월 28일부터 학습하기 시작한 새로운 내부 수학 모델이 Navier–Stokes 밀레니엄 문제를 포함해 대부분의 수학 분야에서 100개가 넘는 장기간 미해결 문제를 해결했다고 발표했다.
다만 모델의 이름, 구조, 훈련 규모와 가중치 등 기술적인 세부사항은 이번 발표에서 공개되지 않았으며 일반 사용자를 대상으로 배포한 모델도 아니다. 또한 “100개 이상의 문제가 해결됐다”는 표현은 현재로서는 OpenAI의 발표 내용이다. 각 증명이 수학계의 독립적인 검증과 동료평가를 거쳐 확정적인 연구 성과로 인정됐다는 뜻은 아니다.
이번 발표에서 함께 주목할 부분은 검증 절차다. OpenAI는 빠르게 늘어나는 AI 수학 결과의 의미를 평가하고 공개 방식을 논의하기 위해 Advisory Group on Mathematics and Artificial Intelligence를 구성했다.
그룹은 미국 Institute for Advanced Study가 호스팅하며 Timothy Gowers, Martin Hairer, Edward Witten, Ravi Vakil 등 여러 분야의 수학자 9명으로 시작한다. OpenAI에 따르면 구성원들은 회사의 보수를 받지 않으며, 요청받지 않은 조언을 제공하거나 OpenAI가 수학계에 미치는 영향에 대해 공개적으로 의견을 밝힐 수 있다.
자문그룹은 새로운 AI 수학 결과의 중요성, 공개 방식, 학술 규범, AI를 활용한 수학 연구와 교육 등을 다룬다. 하지만 OpenAI 내부 수학 연구의 속도나 연구 방향을 결정하는 권한은 갖지 않는다.
따라서 현재 단계에서는 “AI가 Navier–Stokes 문제를 해결했다”는 문장 자체보다 AI가 실제 미해결 연구 문제를 빠르게 생성·풀이할 수 있게 될 때 어떤 검증과 공개 절차가 필요한가라는 문제가 더 중요하다. 개별 증명의 공개와 독립 검증이 진행돼야 실제 수학적 성과의 범위를 판단할 수 있다.
2️⃣ AI 제품·서비스
Google, Gemini를 운영체제 수준에 통합한 새 노트북 플랫폼 ‘Googlebook’ 공개
- 발표일: 2026-09-21 — 정확한 게시 시각 미확인
- 적용 범위: 개인용 PC, 화면 기반 AI 보조, 음성 입력, 자연어 UI 생성, 코딩·에이전트 작업
- 원문: Google — Googlebook’s built-in intelligence reinvents the way you use your laptop
Google이 Gemini를 부가적인 챗봇 앱이 아니라 PC 사용 흐름 자체에 통합한 새로운 노트북 플랫폼 Googlebook을 공개했다. Googlebook은 Android 기술 스택과 ChromeOS의 데스크톱 기반을 조합하며, 초기 제품군은 여러 PC 제조사가 제작한다. 가격은 $899부터 시작한다.
AI 기능에서 가장 눈에 띄는 것은 Magic Pointer다. 사용자가 마우스 포인터를 빠르게 흔들어 호출하면 Gemini가 현재 화면의 텍스트와 이미지, 주변 문맥을 함께 이해한다.
예를 들어 웹페이지에서 운동 계획을 선택해 Calendar 일정으로 만들거나, 의심스러운 이메일의 텍스트와 이미지를 함께 분석하고, 화면의 여러 이미지를 선택해 새로운 결과물을 만드는 식이다. Google은 Magic Pointer가 화면을 상시 분석하는 방식이 아니라 사용자가 명시적인 포인터 동작으로 호출했을 때 활성화된다고 설명한다.
Rambler는 음성 받아쓰기를 확장한 기능이다. 사람이 이야기하면서 반복하거나 중간에 표현을 수정하더라도 이를 정리해 구조화된 문장이나 할 일 목록으로 바꾼다. 하나의 문장 안에서 여러 언어를 섞어 사용하는 경우도 처리할 수 있도록 설계됐다.
Create My Widget은 원하는 기능을 자연어로 설명하면 작은 사용자 맞춤형 위젯을 생성한다. 특정 스포츠 결과 추적이나 여행 카운트다운처럼 기존에는 전용 앱을 찾아야 했던 작은 기능을 사용자가 직접 생성하는 방식이다.
Googlebook에는 Google의 에이전트형 개발 환경 Antigravity도 통합된다. 전체적인 방향은 PC에서 AI를 사용하는 기본 단위를 “별도 챗봇 창을 열어 질문하기”에서 현재 보고 있는 화면과 파일, 앱 상태를 문맥으로 받아 직접 행동하는 AI로 옮기려는 것이다.
이러한 방식은 편의성을 크게 높일 수 있지만 동시에 AI가 볼 수 있는 화면과 파일의 범위, 다른 애플리케이션에 수행할 수 있는 동작, 사용자 승인이 필요한 작업을 어떻게 정의할 것인지가 중요한 보안·개인정보 문제로 함께 떠오른다.
3️⃣ 개발 도구·에이전트
AWS Strands, 바로 실행할 수 있는 범용 에이전트 ‘Strands harness’ 공개
- 발표일: 2026-09-21 — 정확한 게시 시각 미확인
- 적용 범위: 범용 AI 에이전트 개발, 도구 실행, 장기 메모리, 멀티에이전트, MCP, 세션·컨텍스트 관리
- 원문: Strands Agents — Introducing Strands harness
AWS가 주도하는 오픈소스 Strands Agents 프로젝트가 Strands harness를 공개했다. 기존 Strands SDK가 개발자가 에이전트 구조를 조립하는 프레임워크에 가까웠다면, Strands harness는 도구와 메모리, 세션, 컨텍스트 관리, 시스템 프롬프트 등이 이미 구성돼 있는 완성형 범용 에이전트 실행 환경이다.
프로젝트 측은 Claude Code나 Codex 같은 제품에서는 에이전트가 처음부터 상당히 잘 작동하지만, 개발자가 직접 에이전트를 만들기 시작하면 도구 선택과 컨텍스트 관리, 메모리, 오류 복구 같은 실행 계층을 다시 만들어야 한다는 문제에서 출발했다고 설명한다.
Python에서는 strands-harness, TypeScript에서는 @strands-agents/harness를 사용한다. 기본 모델 제공자는 Amazon Bedrock이지만 Anthropic, OpenAI, Google 모델과 로컬 Ollama 등으로 교체할 수 있다.
기본 환경에는 셸 명령과 파일 읽기·쓰기·수정, 웹 접근 기능이 포함되며 필요하면 각각을 다른 구현으로 바꿀 수 있다. 최종적으로 반환되는 것도 별도의 폐쇄형 객체가 아니라 표준 Strands Agent이므로 기존 Strands 생태계와 함께 사용할 수 있다.
긴 작업을 위한 컨텍스트 관리도 기본 기능으로 들어갔다. 도구가 지나치게 긴 결과를 반환하면 이를 별도로 처리하고, 반복해서 사용되는 프롬프트 부분은 캐시한다. 세션 ID를 이용해 과거 작업을 이어갈 수 있고 장기 메모리도 사용할 수 있다.
복잡한 작업은 helper agent에 하위 작업으로 넘길 수 있고 체크리스트를 이용해 여러 단계의 진행 상황을 추적한다. 외부 서비스와 에이전트를 표준화된 방식으로 연결하는 MCP(Model Context Protocol) 와 Agent Skills도 지원한다.
최근 에이전트 개발에서 점점 중요해지는 개념이 바로 harness다. 모델에게 어떤 시스템 프롬프트를 제공하고, 어떤 도구를 쓸 수 있게 하며, 컨텍스트가 길어지면 무엇을 보존하고, 도구 호출이 실패하면 어떻게 복구할지를 결정하는 실행 계층을 뜻한다. Strands가 SDK 외에 완성된 harness를 별도로 공개한 것은 이 부분을 애플리케이션마다 직접 구현하는 대신 재사용 가능한 소프트웨어 구성요소로 다루려는 흐름을 보여준다.
Cloudflare, Python Workers 정식 출시…AI·에이전트 라이브러리도 엣지에서 직접 실행
- 발표일: 2026-09-21 — 정확한 게시 시각 미확인
- 적용 범위: 서버리스 Python, AI API·에이전트, MCP 서버, RAG, 엣지 추론, 웹 백엔드
- 원문: Cloudflare — Python Workers are now generally available
Cloudflare가 약 2년간의 프리뷰를 마치고 Python Workers를 GA(General Availability, 프로덕션용 정식 출시) 상태로 전환했다. Python은 이제 Cloudflare Developer Platform에서 TypeScript와 함께 정식 지원되는 언어가 됐다.
Python으로 작성한 애플리케이션에서 Workers AI, R2, D1, Hyperdrive, Durable Objects, Queues, Workflows 같은 Cloudflare 서비스를 직접 사용할 수 있으며 FastAPI, Django, Flask 같은 기존 Python 웹 프레임워크도 실행할 수 있다.
Python은 일반적인 서버의 CPython 프로세스 형태로 실행되는 것이 아니라 Pyodide를 사용한다. Pyodide는 CPython을 **WebAssembly(Wasm, 여러 실행 환경에서 이식성 있게 사용할 수 있는 바이너리 명령 형식)**로 옮긴 프로젝트다.
기존 프리뷰에서는 Python 객체와 Cloudflare의 JavaScript 기반 API 사이의 타입을 개발자가 명시적으로 변환해야 하는 경우가 있었지만, GA 버전에서는 상당 부분을 런타임과 SDK가 자동 처리하도록 개선됐다.
Python 패키지 호환성을 확대하기 위한 표준화도 진행됐다. Cloudflare가 제안한 PEP 783은 브라우저와 Wasm 기반 Python 환경을 위한 PyEmscripten 플랫폼을 정의한다. cibuildwheel에도 PyEmscripten 빌드 지원이 추가돼 패키지 제작자가 특정 서비스 전용 패키지를 따로 만들기보다 여러 Python-on-WebAssembly 환경에서 사용할 수 있는 wheel을 배포할 수 있게 됐다.
AI 개발자에게 특히 중요한 변화는 네트워크 라이브러리 호환성이다. openai, langchain, mcp 같은 라이브러리는 내부적으로 requests나 httpx 같은 HTTP 라이브러리를 사용한다. 과거 Python Workers에서는 저수준 네트워크 소켓 제약 때문에 이런 패키지를 그대로 실행하기 어려웠다.
Cloudflare는 HTTP 요청을 WebAssembly 환경의 JavaScript fetch와 연결하고 소켓 호환성을 추가하는 방식으로 이 문제를 개선했다. 그 결과 Python Workers에서 OpenAI SDK, LangChain, MCP 도구 등을 실행하고 Workers AI의 GPU 추론이나 AI Gateway, RAG 시스템과 연결할 수 있게 됐다.
4️⃣ 산업·정책·안전
스페인 정부, 향후 12개월 AI 정책 로드맵 ‘Plan IA360’ 발표
- 발표일: 2026-09-21 — 정확한 게시 시각 미확인
- 적용 범위: AI 컴퓨팅 인프라, 중소기업 도입, 교육, 사이버보안, 프런티어 모델 감독, 데이터센터 정책
- 원문: 스페인 정부 La Moncloa — Plan IA360 발표
스페인 정부가 앞으로 12개월 동안 추진할 AI 정책 로드맵 ‘Plan IA360’ 을 발표했다. 계획은 기술 역량 확대, 기업과 인재의 AI 도입, AI 거버넌스와 안전, 노동·사회 변화에 대응하기 위한 사회적 합의를 주요 축으로 삼는다.
기술 인프라 분야에는 AI 기가팩토리 프로젝트와 Barcelona Supercomputing Center를 중심으로 한 AI 연구가 포함된다. 기후, 보건, 에너지 등 특정 공공·산업 분야를 위한 AI 모델 개발도 추진한다.
데이터센터 확대 과정에서는 연산 능력뿐 아니라 에너지와 물 같은 자원 이용, 데이터 주권 문제를 함께 고려한다는 입장이다. 대규모 AI 인프라 확대와 환경적 비용을 하나의 정책 문제로 묶어 다루려는 접근이다.
기업 도입에서는 중소기업과 자영업자의 AI 활용을 지원하는 프로그램을 추진하고, 정부는 2030년까지 스페인 기업 절반 이상이 업무에 AI를 통합하도록 하는 목표를 제시했다. 중등교육과 직업교육 과정에서도 AI 활용을 다루는 방향으로 교육 체계를 수정할 계획이다.
안전 분야에서는 국가 사이버 방어 역량을 강화하고 프런티어 모델(frontier model, 현재 최고 수준에 가까운 고성능 범용 AI) 가운데 공격적인 활용 가능성이 높은 모델에 대한 감독을 강화하겠다고 밝혔다.
정부는 AI가 노동시장에 미칠 변화에 대응하기 위해 기업, 노동자, 노동조합, 정당과 공공기관이 참여하는 새로운 사회적 합의도 추진한다. 다음 달부터 사회적 파트너들을 모아 이 논의를 시작한다는 계획이다.
딥페이크 피해와 청소년 보호, 지식재산권 문제 등에 대해서도 AI 기업의 책임을 강화하는 방향을 국제사회에서 논의하겠다는 입장을 밝혔다. 다만 이는 새로운 법률이 이미 제정됐다는 의미가 아니라 향후 스페인 정부가 추진하겠다고 밝힌 정책 방향이다.
OpenAI, ‘AI가 다음 AI를 연구하는 단계’에 대비한 국제 기술 표준 제안
- 발표일: 2026-09-21 — 정확한 게시 시각 미확인
- 적용 범위: 프런티어 AI 안전, 자동화된 AI 연구, 사고 보고, 공통 평가 기준, 인간 감독
- 원문: OpenAI — Building standards for the next phase of AI
OpenAI가 고성능 AI 연구소와 국가들이 공통으로 사용할 수 있는 국제 기술 표준을 만들자는 정책 제안을 발표했다. 특히 초점을 맞춘 개념은 RSI(Recursive Self-Improvement, 재귀적 자기개선) 다.
여기서 RSI는 AI가 다음 세대 AI를 개발하는 연구와 엔지니어링의 더 많은 부분을 수행하고, 그렇게 만들어진 더 강한 AI가 다시 다음 연구를 가속하는 과정을 의미한다.
OpenAI는 완전히 자율적인 RSI가 현재 발생하고 있다는 의미는 아니며, 충분한 안전성과 인간 통제 없이 이를 추구해서는 안 된다고 명시했다.
제안의 핵심은 연구소마다 다른 방식으로 측정하고 있는 AI 연구 자동화 수준과 안전 사고를 일정한 기준으로 비교할 수 있도록 하는 것이다.
예를 들어 AI가 한 연구소 안에서 전체 AI 연구 업무 중 어느 정도를 스스로 수행하는지 측정하는 방법, 어떤 자동 연구 활동이 발생하면 즉시 사람이 검토해야 하는지, 정렬(alignment) 문제나 자동화 연구 사고를 어느 정도 심각도로 분류할지를 표준화하자는 내용이다.
OpenAI는 국가 AI 안전기관과 국제 AI 측정·평가 네트워크, ISO와 Frontier Model Forum 등의 표준화 조직을 활용하는 방안을 제시했다.
다만 이번 제안은 모델을 출시하기 전에 국제기관의 허가를 받아야 한다는 식의 승인 제도를 의미하지는 않는다. 공통 기술 표준을 만들되 이를 실제 법이나 규제로 어떻게 활용할지는 각 국가가 결정하도록 하자는 접근이다.
AI 에이전트가 코딩뿐 아니라 AI 연구와 실험 자동화에도 사용되기 시작하면서 안전 평가의 대상 역시 “모델이 위험한 답변을 하는가”에서 모델이 장시간 연구 과정을 얼마나 자율적으로 수행할 수 있는가로 확대되고 있다. 이번 제안은 이러한 능력을 비교 가능한 측정값과 사고 보고 절차로 만들려는 시도다.
Microsoft, 2026년 2분기 글로벌 생성형 AI 이용률 18.8%로 추산
- 발표일: 2026-09-21 — 정확한 게시 시각 미확인
- 적용 범위: 글로벌 AI 도입률, 국가별 AI 격차, 교육·업무 활용, 오픈웨이트 모델 확산
- 원문: Microsoft — The continued state of global AI diffusion in 2026
Microsoft AI Economy Institute가 최신 Global AI Diffusion Report를 공개했다. Microsoft의 추산에 따르면 2026년 6월 전 세계 15~64세 인구 가운데 생성형 AI 제품을 사용하는 사람의 비율은 **18.8%**로, 1분기보다 약 1% 증가했다.
지역별 격차는 계속 확대됐다. Microsoft 분류에서 Global North의 이용률은 28.8%, Global South는 16.2%였다.
국가별로는 UAE가 73.3%, 싱가포르가 64.3%로 가장 높은 수준을 기록했다. 한국은 이전 분기보다 3.5%포인트 상승해 조사 대상 국가 가운데 절대 증가 폭이 가장 컸다. 일본은 22.5%에서 2.2%포인트 증가했고, 사우디아라비아는 국가 순위가 다섯 단계 상승했다.
Microsoft가 자체 Copilot 사용을 분석한 결과에서는 Global South에서 교육·학습 목적으로 AI를 활용하는 비율이 상대적으로 높게 나타났다.
다만 이 수치는 세계 각국 사람들에게 “AI를 쓰는가”라고 직접 설문한 통계가 아니다. Microsoft는 자사 서비스에서 익명화·집계한 **telemetry(서비스 이용 과정에서 수집되는 사용량 신호)**를 이용해 AI 이용자를 추정하고, 운영체제와 기기 시장점유율, 인터넷 보급률, 인구 구조 등을 반영해 보정한다.
Microsoft도 새로운 AI 제품과 모델이 빠르게 늘어나면서 현재 방식으로는 전체 AI 사용량을 완벽하게 포착할 수 없다고 설명한다. 따라서 18.8%라는 숫자는 전 세계 생성형 AI 이용자의 정확한 전수조사 결과라기보다 Microsoft가 관측 가능한 데이터를 기반으로 만든 추정치로 봐야 한다.
보고서는 오픈웨이트(open-weight, 학습된 모델의 가중치를 공개해 외부에서 직접 실행·수정할 수 있도록 한 모델) 사용량도 빠르게 증가하고 있다고 분석했다. 클라우드 API에 전적으로 의존하지 않고 저렴한 인프라에서 직접 실행하거나 지역 언어·업무에 맞게 수정할 수 있어 특히 개발도상국에서 활용 가능성이 있다는 설명이다.
📚 AI 추천 글
Our framework for reporting model misalignment
- 저자·발행: OpenAI
- 게시일: 2026-09-16
- 원문: OpenAI — Our framework for reporting model misalignment
AI 안전에 관한 글은 추상적인 미래 위험을 이야기하는 경우가 많지만, 이 글은 OpenAI 내부에서 실제로 발견된 모델 오정렬(misalignment, 모델 행동이 사용자의 의도나 시스템 규칙에서 벗어나는 현상) 사례를 어떤 방식으로 기록하고 공개할 것인지 다룬다.
OpenAI는 새로운 보고 프레임워크와 함께 최근 6개월 동안 관찰된 여섯 건의 사례를 공개했다. 모든 사례가 실제 사용자에게 피해를 준 사건은 아니며, 모델 개발·훈련·평가·배포 단계에서 발견된 이상 행동까지 포함한다.
프레임워크의 목적은 원인을 완전히 규명하거나 해결책을 찾을 때까지 기다리지 않고 연구적으로 의미 있는 오정렬 사례를 더 빠르게 공개하는 것이다. 새로운 행동 메커니즘이 발견됐거나 기존 안전 가정과 다른 결과가 나오는 경우, 피해 발생 여부와 무관하게 공개 후보가 될 수 있다.
사례는 조사 필요성에 따라 여러 경로로 나뉘며, 제3자에게 영향을 미치거나 보안 문제가 포함돼 있다면 우선 비공개 통지와 조사를 진행한 뒤 공개하도록 설계됐다.
OpenAI는 공개한 여섯 사례가 모델 전체에서 이런 행동이 얼마나 자주 발생하는지 보여주는 통계 표본은 아니라고 명시한다. 이 글은 에이전트가 실제 파일·웹·API를 다루는 환경에서 어떤 행동을 AI 안전 사고로 기록할 것인지, 그리고 언제 외부에 공개할 것인지를 구체적으로 생각해볼 수 있다는 점에서 읽을 가치가 있다.
TensorRT Edge-LLM Completes the MLPerf Edge Agentic Benchmark 6.4x Faster on Jetson AGX Thor
- 저자: Luxiao Zheng, Palanivel Guruva reddiar, Maximilien Breughe, Zhihan Jiang, Zhijia Liu, Lin Chai
- 발행: NVIDIA Technical Blog
- 게시일: 2026-09-16
- 원문: NVIDIA Technical Blog — TensorRT Edge-LLM and MLPerf Edge Agentic
자동차나 로봇처럼 클라우드 연결이 불안정하거나 응답 지연이 중요한 환경에서 에이전트형 LLM을 로컬에서 얼마나 효율적으로 실행할 수 있는지를 구체적인 최적화 기법과 함께 설명한 글이다.
일반 챗봇은 질문 한 번과 답변 한 번으로 끝나는 경우가 많지만 에이전트는 도구를 호출하고 결과를 다시 읽으면서 대화 문맥이 계속 길어진다. MLPerf Inference v6.1의 Edge Agentic 성능 워크로드도 이를 반영해 20개 대화에서 총 1,007개의 턴을 수행하며 컨텍스트가 약 2만3,500 토큰까지 증가한다.
NVIDIA는 단일 Jetson AGX Thor에서 Qwen3.6-27B와 TensorRT Edge-LLM을 사용해 전체 1,007턴을 24분 36초에 처리했다. 동일 장비의 llama.cpp 참조 실행은 2시간 37분으로, NVIDIA 제출 결과 기준 6.4배 짧았다. 출력 속도는 초당 52.33토큰이었고 BFCL v4 기반 함수 호출 정확도는 87.94%였다.
다만 이는 NVIDIA가 최적화한 TensorRT Edge-LLM 구현과 MLCommons의 llama.cpp 참조 구성을 비교한 결과다. 따라서 Jetson 자체가 모든 LLM 실행에서 무조건 6.4배 빨라졌다는 의미는 아니다.
속도 개선에는 여러 기술이 동시에 사용됐다. 모델의 가중치와 연산은 NVFP4로 양자화(숫자를 더 적은 비트로 표현해 메모리 사용량과 연산량을 줄이는 기술) 했고, 과거 토큰의 attention 중간 상태를 저장하는 KV cache는 FP8로 유지했다.
또 이전 에이전트 턴에서 만든 KV cache와 recurrent state를 재사용하면서 전체 프롬프트 토큰 중 약 96%를 다시 계산하지 않았다. 한 번에 여러 다음 토큰 후보를 예측하고 검증하는 tree-based MTP(Multi-Token Prediction)도 적용해 디코딩 속도를 높였다.
에이전트가 엣지 기기에서 작동할 때 성능이 단순히 모델 크기나 GPU 연산량에 의해 결정되는 것이 아니라 양자화, 컨텍스트 캐시 재사용, 디코딩 알고리즘의 조합에 크게 영향을 받는다는 점을 이해하기 좋은 글이다.
Deploy Hugging Face models on Amazon SageMaker AI with coding agents
- 저자: Dario Salvati, Álvaro Bartolomé, Sanhita Sarkar, Qiong Zhang
- 발행: AWS Artificial Intelligence Blog / Hugging Face
- 게시일: 2026-09-18
- 원문: AWS — Deploy Hugging Face models on Amazon SageMaker AI with coding agents
코딩 에이전트가 코드를 작성하는 능력과 빠르게 변하는 운영 환경에 대한 최신 지식을 갖고 있는 것은 서로 다른 문제라는 점을 실제 실패 사례로 보여주는 글이다.
연구진이 Kiro와 Claude Code에 Qwen3 모델을 SageMaker에 배포하는 작업을 맡기자 두 에이전트 모두 과거에 널리 사용되던 TGI(Text Generation Inference) 컨테이너를 선택했다.
하지만 해당 리전의 TGI 빌드는 Qwen3 아키텍처를 지원하지 않았고 엔드포인트 배포가 반복해서 실패했다. 이 과정에서 GPU 인스턴스는 실제로 시작됐다가 종료됐기 때문에 작업에는 실패하면서도 비용은 발생했다.
새로운 멀티모달 MoE 모델을 대상으로 한 다른 테스트에서도 에이전트는 지원되지 않는 TGI 구성을 다시 선택했다.
저자들은 문제의 원인을 에이전트의 추론 능력보다 최신 배포 정보의 부족에서 찾았다. AI 모델 자체보다 클라우드 컨테이너 버전과 Python 패키지, serving backend 지원 범위가 훨씬 빠르게 바뀌기 때문이다.
이를 해결하기 위해 Hugging Face 저장소에 여섯 개의 Agent Skill을 공개했다. Agent Skill은 SKILL.md 같은 파일에 특정 작업을 수행하는 최신 절차와 조건을 기록해 두고, 에이전트가 해당 업무를 수행할 때 필요한 정보만 불러오는 방식이다.
AWS 환경 확인, Python 환경 구성, IAM 권한 검사, 모델에 맞는 serving image 선택, 프로덕션 설정 등이 각각 독립된 Skill로 제공된다.
Skill을 적용한 실행에서는 실제 클라우드 리소스를 생성하기 전에 Qwen3에 맞는 vLLM을 선택했고, 현재 AWS 컨테이너 카탈로그에서 올바른 이미지 URI를 조회했다. 자동 확장과 CloudWatch 경보, 배포 확인, 리소스 삭제 검증도 함께 구성했다.
이 글이 흥미로운 이유는 더 큰 모델로 모든 문제를 해결하려 하지 않는다는 점이다. 빠르게 변하는 클라우드 운영 정보를 모델 파라미터 안에 모두 기억시키기보다 사람이 확인하고 쉽게 수정할 수 있는 외부 실행 지침으로 분리하는 방식을 택한다.
실제 개발 업무에서 AI 에이전트를 사용할 때 모델 성능만큼 최신 문서와 runbook, 권한 검사, 비용이 발생하기 전의 검증 단계가 중요하다는 점을 구체적인 실패 사례를 통해 보여준다.