AI 데일리 브리핑 — 2026-10-08
Soshy·

기준 시점: 2026-10-08 06:00 KST (Asia/Seoul)
AI 동향 조사 범위: 2026-10-07 06:00 ~ 2026-10-08 06:00 KST
추천 글 범위: 2026-10-01 06:00 ~ 2026-10-08 06:00 KST
1️⃣ 주요 모델·연구
Anthropic, 소형 모델 ‘Claude Haiku 5.5’ 출시…컴퓨터 사용 성능 높이고 비용 대폭 인하
- 발표일: 2026-10-07 — 정확한 게시 시각 미확인
- 적용 범위: Claude, 소형 언어모델, 코딩 에이전트, 컴퓨터 사용, 업무 자동화, API 비용 최적화
- 원문: Anthropic — Claude Haiku 5.5
Anthropic이 Claude 5.5 제품군의 새로운 소형 모델 Claude Haiku 5.5를 출시했다.
Haiku는 Claude 제품군에서 속도와 비용 효율성을 우선하는 모델이다. 복잡한 문제를 오랫동안 추론하는 Opus나 Sonnet과 달리, 짧은 문서 요약, 데이터 분류, 정보 추출, 데이터베이스 조회, 고객지원처럼 많은 요청을 빠르게 처리해야 하는 작업에 적합하도록 설계됐다.
이번 모델에서 달라진 부분은 단순히 응답 속도와 가격만이 아니다. Anthropic은 Haiku 5.5가 컴퓨터를 직접 조작하는 작업과 여러 단계를 거치는 에이전트 업무에서도 이전 세대보다 크게 향상됐다고 설명한다.
Anthropic 자체 평가에서 실제 컴퓨터 화면을 보고 조작하는 능력을 측정하는 OSWorld 2.1의 오프라인 평가 하위 집합에서 Haiku 5.5는 72.4%를 기록했다. Haiku 4.5의 15.7%, GPT-6 Luna의 48.9%보다 높은 수치다.
명령줄 환경에서 여러 단계의 실제 작업을 수행하는 Terminal-Bench 4.0에서는 39.2%를 기록했다. 이전 Haiku 4.5의 점수는 0.0%였고, 같은 평가에서 Sonnet 5.5는 70.6%를 기록했다.
이 결과는 모든 코딩 작업에서 Haiku가 대형 모델을 대체할 수 있다는 뜻은 아니다. 복잡한 코딩 에이전트 작업에서는 여전히 Sonnet이나 Opus가 우세하다. 다만 비교적 좁고 명확한 하위 작업에서는 소형 모델을 사용하더라도 상당한 성능을 확보할 수 있다는 점을 보여준다.
수치는 Anthropic이 자체 실행한 벤치마크 결과다. OSWorld는 실제 컴퓨터 사용 능력을 평가하기 위한 외부 벤치마크이지만, 여기서 제시된 모델별 실행 결과를 독립적인 제3자의 종합 검증으로 해석해서는 안 된다.
가격 변화도 크다.
입력 길이가 10만 토큰 이하인 요청의 API 가격은 입력 100만 토큰당 0.10달러, 출력 100만 토큰당 0.50달러다. 이전 Haiku 4.5의 입력 1달러, 출력 5달러와 비교하면 토큰 단가가 90% 낮아졌다.
입력이 10만 토큰을 넘는 요청에는 입력 0.50달러, 출력 2.50달러가 적용된다. Anthropic은 새로운 tokenizer의 토큰 사용량 변화까지 고려했을 때 실제 작업당 평균 비용이 이전 모델보다 약 75% 낮아진다고 설명한다.
Tokenizer(토크나이저) 는 문장을 모델이 처리할 수 있는 작은 단위인 토큰으로 나누는 도구다. 같은 문장이라도 토크나이저가 달라지면 처리해야 하는 토큰 수가 달라질 수 있으므로 단순한 토큰 단가 비교와 실제 업무 비용은 차이가 날 수 있다.
Haiku 5.5는 Haiku 계열 최초로 reasoning effort(모델이 답을 만들 때 사용할 추론량을 조절하는 설정) 도 지원한다. 간단한 분류는 낮은 설정으로 빠르게 처리하고, 더 신중한 판단이 필요한 경우 추론량을 늘리는 방식이다.
이번 출시에 맞춰 Anthropic은 Claude Sonnet 5.5의 캐시 읽기 비용도 50% 인하했다. 이전에는 캐시 입력 100만 토큰당 0.20달러였지만 이제 0.10달러다. Anthropic은 이 변화로 일반적인 에이전트 업무에서 Sonnet 5.5의 비용이 약 20% 낮아질 것으로 추정한다.
Prompt caching(프롬프트 캐싱) 은 모델에 반복해서 전달하는 시스템 지침이나 긴 문서를 매번 새로 계산하지 않고 이전 처리 결과를 재사용하는 기술이다. 긴 대화나 반복적인 도구 호출이 많은 에이전트에서는 입력의 상당 부분이 반복되기 때문에 캐시 가격이 실제 운영 비용에 큰 영향을 준다.
Haiku 5.5는 Anthropic API뿐 아니라 AWS, Google Cloud, Microsoft Azure에서도 제공된다. API 모델 ID는 claude-haiku-5-5다. Python과 TypeScript SDK에는 브라우저 및 컴퓨터 사용을 위한 베타 지원도 추가된다.
이번 발표는 최근 에이전트 아키텍처에서 중요해지고 있는 모델의 역할 분담과도 연결된다.
하나의 비싼 모델이 검색, 요약, 검증, 코드 작성까지 전부 처리하는 대신, 상위 모델이 전체 계획을 세우고 Haiku 같은 빠른 모델이 수많은 하위 작업을 수행하도록 구성할 수 있다. 이 경우 개별 모델의 최고 성능보다 전체 작업을 완료하는 데 필요한 시간과 비용이 더 중요한 설계 기준이 된다.
Mistral, 1조 파라미터 멀티모달 모델 ‘Mistral Large 4’ 공개…유럽 자체 인프라에서 학습
- 발표일: 2026-10-06 — 정확한 게시 시각 미확인
- 적용 범위: 오픈웨이트 LLM, 멀티모달 AI, 코딩·보안 에이전트, 금융·법률 업무, 유럽 주권형 AI
- 원문: Mistral — Introducing Mistral Large 4
프랑스 AI 기업 Mistral이 새로운 프런티어 모델 Mistral Large 4(ML4) 를 공개했다. 내부 별칭은 Le Chonk다.
Mistral Large 4는 약 1조 개의 전체 파라미터와 520억 개의 활성 파라미터를 가진 대형 멀티모달 모델이다.
모델 구조에는 MoE(Mixture of Experts, 여러 전문 신경망 가운데 입력에 필요한 일부만 선택적으로 활성화하는 방식) 가 사용된다.
일반적인 Dense 모델은 추론할 때 대부분의 파라미터를 계산하지만 MoE는 토큰마다 필요한 일부 expert만 활성화한다. 따라서 전체 모델은 많은 지식을 보유하면서도 매번 1조 개의 파라미터를 모두 계산할 필요는 없다.
다만 활성 파라미터가 520억 개라고 해서 모델 전체를 520억 파라미터 모델과 동일한 메모리로 운영할 수 있는 것은 아니다. 대부분의 가중치를 저장할 수 있는 메모리는 여전히 필요하다.
ML4는 처음부터 텍스트와 이미지 정보를 함께 처리하도록 학습된 natively multimodal model이다.
코드 작성, 장시간 에이전트 작업, 이미지 이해뿐 아니라 금융·법률·사이버보안처럼 전문적인 문서와 업무 지식을 필요로 하는 분야를 주요 활용 대상으로 삼는다.
학습 데이터에는 160개가 넘는 언어가 포함됐고, 유럽연합의 모든 공식 언어를 지원하도록 설계됐다.
Mistral은 모델을 유럽 내 자체 데이터센터에 설치된 NVIDIA Grace Blackwell GPU 약 3,800개를 사용해 처음부터 학습했다고 밝혔다.
이는 단순히 모델의 본사가 유럽에 있다는 의미를 넘어, 모델 학습과 추론에 필요한 인프라를 자체적으로 통제하려는 전략과 연결된다.
기업이나 정부기관이 AI를 사용할 때 데이터가 어느 국가에 저장되고 어떤 법률의 적용을 받는지, 모델 공급업체가 접근을 제한하거나 정책을 변경할 수 있는지 등이 중요한 문제가 될 수 있기 때문이다.
Mistral은 ML4를 이러한 sovereign AI(주권형 AI, 국가나 조직이 핵심 AI 모델과 인프라에 대한 통제권을 유지하려는 접근) 의 핵심 모델로 제시한다.
성능 평가에서는 특히 사이버보안을 강조했다.
Mistral 발표에 따르면 실제 오픈소스 취약점을 재현하고 수정하는 보안 평가에서 ML4는 82% 를 기록했고, 보안 경진대회 문제를 활용한 Cybench에서는 93% 를 해결했다.
회사는 일부 폐쇄형 프런티어 모델이 비슷한 보안 과제에서 답변을 거부하는 경우가 있어, 정상적인 취약점 연구와 사고 대응을 수행하는 보안팀에도 제약이 생길 수 있다고 지적한다.
다만 이런 비교는 단순한 모델 능력 차이뿐 아니라 모델별 안전 정책과 평가 환경의 차이에도 영향을 받는다. 보안 문제를 해결하지 못한 것과 안전 정책에 따라 해결을 거부한 것은 같은 실패 유형이 아니다.
Mistral은 초기 단계에서 검증된 보안 전문가와 정부기관에 일반 버전보다 제한이 적은 모델을 제공해 평가를 진행하고 있다.
현재 제공 상태에도 주의가 필요하다.
10월 6일부터 Mistral Studio에서 공개 프리뷰 API를 사용할 수 있지만, 전체 모델 가중치가 이미 공개된 것은 아니다.
Mistral은 10월 말까지 가중치를 공개할 계획이다. 따라서 현재는 API 프리뷰 단계이며, 실제 자체 인프라 배포는 가중치 공개 이후에 가능해진다.
이번 발표는 OpenAI·Anthropic 같은 폐쇄형 모델과 중국 기업들의 오픈웨이트 모델 사이에서 유럽 자체 학습 인프라와 향후 공개될 대형 모델 가중치를 결합한 경쟁 전략을 보여준다.
최근 오픈웨이트 모델의 경쟁력은 단순한 비용 절감을 넘어, 조직이 모델을 직접 운영하고 자체 데이터로 수정하며 공급업체의 서비스 정책에 의존하지 않을 수 있다는 점으로 확장되고 있다.
Perplexity, 두 모델이 하나의 검색 인덱스를 공유하는 멀티모달 임베딩 모델 공개
- 발표일: 2026-10-07 — 정확한 게시 시각 미확인
- 적용 범위: 멀티모달 검색, RAG, PDF 검색, 임베딩 모델, 오픈소스, 검색 에이전트
- 원문: Perplexity — Multimodal embeddings beyond a single vector
Perplexity가 텍스트와 이미지를 검색하기 위한 새로운 오픈 모델 제품군 pplx-embed-v2-late 를 공개했다.
이번 모델은 0.6B와 9B 두 가지 크기로 제공되며, 두 모델이 같은 임베딩 공간을 사용하도록 학습됐다는 것이 특징이다.
Embedding(임베딩) 은 문장이나 이미지 같은 정보를 의미를 나타내는 숫자 벡터로 변환하는 기술이다. 검색 시스템은 사용자의 질문과 문서의 벡터가 얼마나 가까운지 비교해 관련 자료를 찾는다.
기존의 일반적인 임베딩 모델은 문서 하나를 하나의 벡터로 압축하는 single-vector retrieval을 사용한다.
이 방식은 검색 속도가 빠르고 저장공간도 적게 사용하지만 문서가 길어질수록 문제가 생긴다.
예를 들어 한 문서에 제품 가격, 환불 정책, 보안 규칙과 서비스 이용 조건이 모두 포함돼 있다면, 이 정보를 하나의 고정 길이 벡터에 압축하면서 세부적인 차이가 사라질 수 있다.
Perplexity가 공개한 모델은 late interaction(검색어와 문서를 미리 각각 인코딩한 뒤 검색 시점에 여러 토큰 표현을 세밀하게 비교하는 방식) 을 사용한다.
ColBERT 계열 구조를 기반으로 하며, 문서 전체를 하나의 벡터로 압축하지 않고 각 토큰에 대해 128차원 벡터를 생성한다.
검색어와 문서를 비교할 때는 MaxSim이라는 점수 계산 방식을 사용한다.
검색어의 각 토큰에 대해 문서 안에서 가장 비슷한 토큰을 찾고, 각각의 최대 유사도를 합산해 최종 점수를 만든다.
따라서 하나의 질문에 포함된 서로 다른 정보가 문서의 여러 부분과 독립적으로 연결될 수 있다.
이 방식은 저장해야 하는 벡터 수가 늘어난다는 단점이 있다. 일반적인 임베딩 검색보다 인덱스가 커지고 후보 문서를 평가하는 계산량도 증가한다.
대신 문서의 세부 의미와 구조를 더 잘 보존할 수 있으며, 여러 정보가 결합된 복잡한 질문에서 검색 품질을 개선할 가능성이 있다.
이미지 검색에도 같은 접근을 적용했다.
스캔된 PDF나 표, 도표가 많은 문서를 기존 방식으로 검색하려면 먼저 OCR을 사용하거나 이미지를 텍스트로 설명해야 하는 경우가 많았다.
OCR(Optical Character Recognition) 은 이미지 안에 있는 글자를 텍스트로 변환하는 기술이다.
하지만 OCR은 문서의 시각적 배치와 그림, 표의 구조를 완전히 보존하지 못할 수 있다.
새 모델은 PDF 페이지를 이미지 그대로 임베딩해 텍스트 질문으로 검색할 수 있다. 문서의 시각적인 표현을 검색 과정에 직접 사용하는 방식이다.
Perplexity의 자체 평가에서 시각 문서 검색 벤치마크인 ViDoRe V3의 평균 점수는 9B 모델 65.2%, 0.6B 모델 62.3% 였다.
이는 Perplexity가 실행한 모델 비교 결과이며 외부 기관이 모든 모델의 성능을 독립적으로 재검증한 수치는 아니다.
이번 제품군에서 특히 흥미로운 기술은 서로 다른 크기의 모델이 같은 검색 인덱스를 공유할 수 있다는 점이다.
일반적으로 문서 인덱스를 어떤 임베딩 모델로 만들었다면 사용자 질문도 같은 모델로 변환해야 한다.
Perplexity는 먼저 18B 규모의 teacher model을 학습한 뒤, 이를 9B와 0.6B 모델에 distillation(큰 모델의 지식을 작은 모델로 전달하는 학습 방법) 하는 과정에서 토큰별 임베딩 공간까지 정렬했다.
그 결과 9B 모델로 문서를 미리 인덱싱해 놓고, 실제 사용자 질문은 훨씬 가벼운 0.6B 모델로 처리할 수 있다.
인덱싱은 한 번 수행하지만 사용자 질문은 계속 들어온다는 검색 시스템의 특성을 활용한 설계다.
Perplexity 평가에서 0.6B 모델만 사용한 시각 문서 검색 점수는 62.3%였지만, 9B로 문서를 인덱싱하고 0.6B로 질문을 처리하면 63.5% 로 개선됐다. 질문을 처리하는 모델의 계산 비용은 동일하다.
두 모델의 가중치는 Hugging Face에 공개됐다.
최근 생성형 AI가 실제 서비스에 연결되면서 답변을 만드는 모델만큼 필요한 정보를 얼마나 정확하고 저렴하게 찾아오는가도 중요해지고 있다. Perplexity의 이번 연구는 검색 품질을 높이는 계산을 미리 수행하는 단계와 빠른 응답이 필요한 실시간 단계로 나눠 최적화하는 접근을 보여준다.
OpenAI, 내부 수학 연구 모델이 작성한 논문 722편 공개…증명 검증 수준은 결과마다 달라
- 발표일: 2026-10-06 — 정확한 게시 시각 미확인
- 적용 범위: AI 수학 연구, 자동 정리 증명, 형식 검증, 과학 연구 에이전트, 연구 결과 공개
- 원문: OpenAI — Sharing AI progress in mathematics
- 관련 원문: OpenAI — Mathematics research repository
OpenAI가 아직 공개하지 않은 내부 프런티어 모델을 이용해 작성한 대규모 수학 연구 결과를 GitHub에 공개했다.
현재 저장소에는 722개의 수학 논문 원고가 372개의 연구 결과 계열로 분류돼 있다.
여기서 중요한 점은 722개의 원고가 모두 독립적으로 검증된 새로운 수학적 발견을 의미하지는 않는다는 것이다.
하나의 연구 결과 계열에는 핵심 정리뿐 아니라 보조 증명, 다른 증명 방법이나 후속 결과를 다루는 여러 원고가 포함될 수 있다.
OpenAI는 기존 수학 평가에서 모델의 성능이 충분히 높아져 더 어려운 문제를 평가할 필요가 생기면서 실제 미해결 연구 문제까지 실험 범위를 확장했다고 설명한다.
공개된 저장소에 따르면 모델에게 약 4,000개의 수학 문제를 제시했으며 대부분의 결과는 동일한 내부 모델과 비슷한 절차를 이용해 생성됐다.
결과 하나를 얻는 데 사용한 평균 계산량은 ChatGPT Pro의 추론 계산 약 3시간에 해당하는 수준이라고 밝혔다.
실제 수학 연구에서 중요한 것은 문제의 답처럼 보이는 식을 만드는 것이 아니라, 제시한 주장을 논리적으로 증명하는 것이다.
특히 거대한 수학적 주장에서는 증명의 일부만 틀려도 전체 결과가 무효가 될 수 있다.
OpenAI는 이를 검증하기 위해 일부 증명을 Lean이라는 형식 증명 도구로 옮겨 공개했다.
Formal verification(형식 검증) 은 수학적 증명을 엄격하게 정의된 논리 규칙으로 표현하고 컴퓨터가 각 단계를 검사하도록 하는 방식이다.
일반적인 언어모델은 자연어로 그럴듯한 증명을 작성할 수 있지만, Lean 같은 도구는 논리적으로 정해진 규칙을 충족하지 못하면 증명을 통과시키지 않는다.
다만 공개된 모든 원고가 Lean 검증을 마친 것은 아니다.
OpenAI는 아직 형식화되지 않은 일부 결과에는 오류가 있을 수 있다고 명시했고, 추가 검증과 수정이 이뤄질 때마다 저장소를 업데이트할 계획이라고 밝혔다.
연구자가 모델의 접근 방법을 살펴볼 수 있도록 10개 결과의 추론 과정 요약도 함께 공개했다.
이는 모델의 모든 내부 계산 기록을 그대로 공개한 것은 아니며, 주요 추론 경로를 이해할 수 있도록 정리한 자료다.
연구 결과를 공개하는 방식에도 변화가 있다.
OpenAI는 Institute for Advanced Study와 관련된 독립 자문단 AGMAI(Advisory Group on Mathematics and Artificial Intelligence) 의 권고를 참고해 인용 방법과 수정 이력을 관리하는 구조를 만들었다고 밝혔다.
논문 원고를 단순히 한 번 게시하고 끝내는 것이 아니라, 오류 수정과 증명 보강 과정이 추적될 수 있도록 하려는 것이다.
향후에는 수학 연구자가 AI가 생성한 증명을 이해하고 재현하는 데 필요한 학술 행사와 연구 프로그램도 지원할 계획이다.
이번 공개는 AI가 새로운 수학 문제를 얼마나 많이 풀었는가라는 숫자뿐 아니라 생성된 연구 결과를 학계가 어떤 기준으로 검증하고 인용하며 수정할 것인가라는 새로운 문제를 제기한다.
AI가 연구 논문을 대량으로 생성할 수 있게 되면 연구자들이 검토해야 할 원고의 양도 빠르게 증가한다.
그런 환경에서는 모델의 논문 생성 능력과 별개로 형식 검증, 독립 재현, 기여도 구분과 수정 이력 관리가 과학 연구 시스템의 중요한 구성요소가 될 가능성이 크다.
Biohub·미국 정부·Google DeepMind·Meta, AI가 생물학적 실험 결과를 예측하도록 하는 대규모 데이터 사업 확대
- 발표일: 2026-10-07 — 정확한 게시 시각 미확인
- 적용 범위: AI for Science, 세포 모델링, 생명공학, 신약 연구, 멀티모달 생물학 데이터, 과학 컴퓨팅
- 원문: Biohub — International collaboration to build foundational data for predictive biology
Biohub가 미국 에너지부(DOE), 미국 국립보건원(NIH), Google DeepMind, Isomorphic Labs, Meta 등과 함께 Virtual Biology Initiative를 대규모로 확대한다고 발표했다.
이번 협력의 규모는 자금, 기존 데이터, 계산 자원과 새로운 실험 장비에 대한 기여를 합쳐 약 18억 달러다.
단순히 AI 연구소가 새로운 모델을 학습시키기 위해 컴퓨팅 자원을 구매하는 계획은 아니다.
이번 사업의 핵심은 생물학적 현상을 예측할 수 있는 AI 모델을 만들기 위해 필요한 실험 데이터를 대규모로 생성하고 표준화하는 것이다.
현재 AI는 단백질의 구조를 예측하거나 새로운 단백질 후보를 설계하는 등 특정한 생물학 문제에서 높은 성능을 보여주고 있다.
하지만 실제 세포는 단백질 하나만으로 작동하지 않는다.
수많은 단백질과 유전자, 대사 경로가 상호작용하고, 세포 주변 환경과 다른 세포의 신호에 따라서도 행동이 바뀐다.
예를 들어 특정 유전자의 발현을 억제하거나 새로운 약물을 투여했을 때 세포 전체가 어떻게 반응할지는 단백질 구조만으로 예측하기 어렵다.
Virtual Biology Initiative는 이런 문제를 해결하기 위해 세포와 조직의 상태를 다양한 방법으로 측정하고, 특정한 개입을 했을 때 생물학적 시스템이 어떻게 변하는지를 예측할 수 있는 AI 학습 데이터를 구축하려 한다.
여기서 중요한 것은 perturbation(교란 또는 개입) 데이터다.
세포의 현재 상태만 관찰하는 것이 아니라 특정 유전자를 제거하거나 약물을 처리한 뒤 어떤 변화가 발생하는지 기록하는 것이다.
이러한 데이터가 충분히 쌓이면 AI가 단순히 세포의 상태를 분류하는 것을 넘어 실제로 실험을 수행하기 전에 개입의 결과를 예측하는 모델을 학습할 수 있다.
데이터 수집에는 여러 실험 기술이 활용된다.
Cryo-electron tomography(극저온 전자단층촬영) 는 세포 내부 구조를 매우 높은 해상도로 관찰할 수 있는 기술이며, 대규모 현미경 영상 분석은 살아 있는 조직에서 수많은 세포가 어떻게 행동하는지 측정하는 데 사용된다.
또한 유전자 조작과 분자 수준의 실험, 세포·조직 수준의 생물학적 개입 결과를 결합해 여러 종류의 데이터를 하나의 공통된 모델 학습 기반으로 연결할 계획이다.
각 기관의 역할도 나뉜다.
Biohub는 기존에 약속했던 5억 달러를 기반으로 새로운 측정 기술과 외부 연구를 지원한다.
미국 에너지부는 앞으로 5년 동안 5억 달러 이상을 세포 연구, 실험, 모델링과 슈퍼컴퓨팅에 투입한다.
NIH는 기존에 5억 달러 이상을 투자해 구축한 관련 데이터셋과 연구 인프라를 연결하고 표준화하는 작업을 지원한다.
Google DeepMind, Isomorphic Labs와 Meta는 합계 3억 달러를 투자한다.
따라서 발표된 18억 달러를 전부 이번에 새로 조달된 현금으로 해석해서는 안 된다. NIH의 기여에는 과거 투자로 만들어진 연구 데이터와 자산이 포함돼 있다.
미국 에너지부 산하 국립연구소의 엑사스케일 슈퍼컴퓨팅(초당 약 100경 회의 연산이 가능한 규모의 고성능 컴퓨팅) 과 대형 실험 시설도 활용된다.
연구 결과는 전 세계 연구자가 활용할 수 있는 개방형 AI 학습 데이터 자원으로 구축할 계획이다.
다만 이번 발표가 사람의 질병이나 약물 반응을 정확하게 예측하는 완성된 AI 모델의 출시를 의미하지는 않는다.
현재는 그런 모델을 학습시키는 데 필요한 데이터 생성과 실험 인프라를 확장하는 단계다.
최근 AI for Science의 병목은 모델 구조뿐 아니라 학습에 필요한 데이터가 충분한가, 서로 다른 실험 결과를 하나의 공통 형식으로 연결할 수 있는가라는 문제로 확대되고 있다.
이번 프로젝트는 더 큰 모델을 만드는 것과 별개로 새로운 실험 데이터를 체계적으로 생산하는 시설과 데이터 표준 자체가 AI 연구의 핵심 인프라가 될 수 있다는 방향을 보여준다.
2️⃣ AI 제품·서비스
OpenAI, ChatGPT에 ‘Intelligent UI’ 도입…답변 안에서 계산기·그래프·대화형 인터페이스 직접 생성
- 발표일: 2026-10-07 — 정확한 게시 시각 미확인
- 적용 범위: ChatGPT, GPT-6, 생성형 UI, 대화형 학습, 데이터 시각화, AI 사용자 인터페이스
- 원문: OpenAI — GPT-6 and Intelligent UI for everyone
OpenAI가 GPT-6를 기반으로 ChatGPT의 새로운 응답 방식인 Intelligent UI를 공개했다.
기존 ChatGPT는 주로 텍스트와 이미지를 이용해 질문에 답하고, 사용자가 별도의 프로그램을 만들도록 요청하면 코드나 파일을 제공하는 방식이었다.
Intelligent UI는 질문에 답하는 과정에서 실제로 조작할 수 있는 인터페이스 자체를 생성한다.
예를 들어 자전거의 구조를 설명할 때 프레임, 기어, 바퀴와 브레이크를 각각 선택해서 살펴볼 수 있는 대화형 화면을 제공할 수 있다.
확률이나 통계 개념을 설명할 때는 사용자가 변수 값을 바꾸면서 결과가 어떻게 변하는지 확인하는 그래프를 만들 수 있다.
또한 사용자가 저축 계획을 계산하고 싶다면 별도 애플리케이션을 설치하지 않고도 대화 안에서 금액과 기간을 변경하는 계산기를 생성할 수 있다.
여행 경로를 비교하거나 식사 비용을 여러 사람에게 나누는 작업처럼 일상적인 상황에서도 버튼, 입력 필드, 그래프와 지도 등을 조합할 수 있다.
OpenAI는 이를 사용자가 정해진 소프트웨어의 화면에 자신의 작업을 맞추는 것이 아니라, AI가 작업에 맞는 화면을 구성하는 방식이라고 설명한다.
구현 방식도 일반적인 코드 생성과 다르다.
OpenAI는 GPT-6가 사용하도록 native, streamable component library(모델이 생성 과정에서 바로 조합할 수 있는 기본 UI 구성요소 모음) 를 만들었다.
여기에 모델이 생성하는 인터페이스를 실시간으로 처리하는 compiler(컴파일러) 를 연결했다.
따라서 모델이 UI 전체를 생성할 때까지 기다렸다가 결과를 표시하는 것이 아니라, 답변을 생성하는 도중에 인터페이스가 점진적으로 나타난다.
이는 사용자가 AI에게 코드를 요청하고, 그 코드를 실행하고, 결과 화면을 확인하는 과정을 한 단계 줄이는 방식이다.
모델도 단순히 정답을 만드는 것뿐 아니라 어떤 정보를 텍스트로 보여주고 어떤 정보를 그래프나 입력 도구로 구성해야 하는지 판단하도록 추가 학습됐다.
OpenAI는 이 과정에서 인터페이스의 명확성, 유용성, 완성도 등을 평가했다고 설명한다.
응답 생성 속도에도 변화가 있다.
GPT-6는 모든 추론을 끝내고 답변을 시작하는 대신 추론과 답변 생성을 부분적으로 번갈아 수행할 수 있도록 설계됐다.
예를 들어 여러 자료를 확인해야 하는 질문에서도 이미 확보한 정보로 유용한 부분을 먼저 설명하고, 추가 조사 결과가 나오면 이어서 답변을 완성하는 방식이다.
OpenAI 자체 평가에 따르면 웹 검색이 필요한 질문에서 GPT-6 Instant가 GPT-5.6 Instant보다 평균 44% 더 빨리 답변을 시작했다.
이는 전체 작업 완료 시간이 44% 줄었다는 의미가 아니다. 사용자가 첫 번째 유용한 응답을 보기까지의 시간이 줄었다는 수치이며, OpenAI의 내부 측정 결과다.
적용 일정은 요금제마다 다르다.
10월 7일부터 ChatGPT Plus, Pro, Business, Enterprise에 전 세계 순차 배포가 시작됐다. Free와 Go 요금제에는 10월 8일부터 배포가 확대될 예정이다.
유료 요금제의 ChatGPT에서는 GPT-6 Sol을, Free와 Go에서는 GPT-6 Luna를 사용한다. Enterprise에서는 조직 관리자의 설정에 따라 제공 여부가 달라질 수 있다.
이번 변경은 ChatGPT의 Chat 경험에 적용된다. Work와 Codex의 기반 모델이 동시에 변경되는 것은 아니다.
최근 AI 제품 경쟁에서 모델의 정답률만큼 중요한 문제가 답변을 사용자가 실제로 이해하고 조작할 수 있는 형태로 제공하는 능력이 되고 있다.
Intelligent UI는 생성형 AI가 단순한 질의응답 도구에서 벗어나 사용자의 요청에 맞춰 일시적인 소프트웨어 인터페이스를 만드는 시스템으로 이동하고 있다는 점을 보여준다.
Microsoft·NVIDIA, Windows에서 대형 AI 모델을 직접 실행하는 ‘Hybrid Intelligence’ 발표
- 발표일: 2026-10-07 — 정확한 게시 시각 미확인
- 적용 범위: Windows 11, 온디바이스 AI, 로컬 코딩 모델, Copilot, GPU·AI 반도체, 개인 AI 워크스테이션
- 원문: Microsoft — Building Windows for hybrid intelligence
- 관련 원문: NVIDIA — A New Beginning for Windows PCs with RTX Spark and AI Agents
Microsoft와 NVIDIA가 Windows PC에서 대형 AI 모델과 에이전트를 직접 실행하기 위한 새로운 하드웨어·소프트웨어 전략인 Hybrid Intelligence를 발표했다.
Hybrid Intelligence는 모든 AI 요청을 클라우드로 보내거나 모든 작업을 PC에서 처리하는 대신 작업의 특성에 따라 로컬 모델과 클라우드 모델을 선택적으로 사용하는 구조다.
예를 들어 개인 파일을 검색하거나 간단한 코드를 분석하는 작업은 로컬 모델로 수행하고, 더 복잡한 추론이 필요한 상황에서는 클라우드의 프런티어 모델을 호출할 수 있다.
이런 방식이 필요한 배경에는 AI 에이전트의 높은 사용 비용이 있다.
장시간 실행되는 코딩 에이전트나 개인 비서는 같은 시스템 지침과 데이터를 반복해서 처리하고 수많은 하위 작업을 수행한다.
모든 요청에 클라우드 프런티어 모델을 사용하면 토큰 사용량이 빠르게 늘어나지만, 성능이 충분한 로컬 모델이 있다면 반복적인 작업의 상당 부분을 별도 API 비용 없이 처리할 수 있다.
Microsoft는 이번 발표에서 MAI Code 1.1 Flash를 Windows 기기에서 실행하는 구성을 공개했다.
이 모델은 전체 약 1,370억 파라미터, 활성 파라미터 약 68억 개를 가진 코딩 특화 모델이다.
기존에 발표된 모델이지만 이번에는 3비트 양자화를 적용해 모델 크기를 크게 줄이고, Windows PC에서 256K 컨텍스트를 사용할 수 있도록 최적화한 것이 새 변화다.
양자화(Quantization) 는 모델 내부의 숫자를 더 낮은 정밀도로 표현해 메모리 사용량과 연산 비용을 줄이는 기술이다.
Microsoft는 앞으로 700억 파라미터가 넘는 NVIDIA Nemotron 모델을 2비트로 양자화해 약 20GB 수준의 메모리에서 실행하는 구성도 제공할 계획이다.
모델 실행 도구 측면에서는 llama.cpp를 Windows ML에 통합한다고 발표했다.
llama.cpp는 다양한 오픈웨이트 모델을 CPU나 GPU에서 효율적으로 실행할 수 있도록 하는 오픈소스 추론 프로젝트다.
Windows ML은 Windows 환경에서 GPU, NPU와 CPU를 활용해 AI 모델을 실행하는 런타임이다.
두 기술이 연결되면 개발자가 로컬 모델을 사용하기 위해 별도의 실행 환경을 매번 구축해야 하는 부담을 줄일 수 있다.
GitHub Copilot과의 연결도 예고됐다.
기존 HydraFusion은 여러 클라우드 모델 가운데 작업에 맞는 모델을 선택하거나 조합하는 시스템이었다.
이번에는 그 선택 범위에 Windows 기기에서 직접 실행되는 로컬 모델을 추가한다.
로컬 모델과 클라우드 모델을 조합하는 HydraFusion 기능은 10월 말 GitHub Copilot 앱, CLI, VS Code에서 실험적 프리뷰로 제공될 예정이다.
따라서 10월 7일 발표 시점에 모든 Copilot 사용자가 이 기능을 바로 사용할 수 있는 것은 아니다.
하드웨어 측면에서도 새 제품이 발표됐다.
Microsoft의 Surface Laptop Ultra는 NVIDIA RTX Spark를 기반으로 하며 최대 128GB 통합 메모리와 최대 1페타플롭의 FP4 AI 연산 성능을 지원하는 구성을 제공한다.
Unified memory(통합 메모리) 는 CPU와 GPU가 하나의 큰 메모리 영역을 공유하는 구조다. 대형 모델을 로컬에서 실행할 때 모델 가중치 전체를 GPU 전용 메모리에 담아야 하는 부담을 줄일 수 있다.
RTX Spark 기반 노트북은 10월 7일부터 사전 주문을 시작했으며 10월 16일 출시 예정이다.
항상 켜져 있는 에이전트 실행에 적합한 소형 데스크톱 제품은 11월 판매가 예정돼 있다.
더 큰 시스템으로는 NVIDIA DGX Station for Windows가 처음 공개됐다.
이 제품은 GB300 Grace Blackwell Ultra Desktop Superchip을 사용하며 748GB의 coherent memory(서로 다른 연산 장치가 일관된 방식으로 공유하는 메모리) 와 최대 20페타플롭의 FP4 AI 연산 성능을 제공하도록 설계됐다.
NVIDIA는 이 시스템으로 최대 1조 파라미터 규모의 모델을 로컬에서 실행하는 것을 목표로 하고 있다.
다만 DGX Station for Windows는 이번 행사에서 프리뷰로 공개된 제품이며 일반 판매가 시작된 것은 아니다.
Windows Copilot도 앞으로 PC에 저장된 파일과 최근 작업 정보를 활용하는 Local Context, Windows 프로그램을 직접 조작하는 Local Actions, 로컬 모델을 선택적으로 호출하는 Local Models 기능을 지원할 예정이다.
이 기능들은 사용자 권한을 바탕으로 동작하며 향후 몇 개월 동안 Copilot+ PC에 순차적으로 제공된다.
최근 AI 하드웨어 경쟁에서는 단순히 GPU 연산 성능을 높이는 것을 넘어 한 대의 개인용 컴퓨터가 어느 정도 규모의 모델과 에이전트를 지속적으로 실행할 수 있는가가 중요한 기준으로 떠오르고 있다.
Microsoft와 NVIDIA의 이번 발표는 PC를 클라우드 AI 서비스를 호출하는 단말기에서 로컬 모델을 직접 실행하면서 필요할 때만 클라우드의 지능을 사용하는 하이브리드 AI 시스템으로 확장하려는 전략을 보여준다.
3️⃣ 개발 도구·에이전트
GitHub Copilot, 로컬 샌드박스 정식 출시…AI 에이전트의 파일·네트워크·인증정보 접근 제한
- 발표일: 2026-10-07 — 정확한 게시 시각 미확인
- 적용 범위: GitHub Copilot, 코딩 에이전트, 로컬 보안, 샌드박스, MCP, 기업 개발환경
- 원문: GitHub — Local sandboxing for GitHub Copilot now generally available
GitHub가 Copilot의 로컬 샌드박스 기능을 GA(General Availability, 정식 제공) 상태로 전환했다.
지원 대상은 GitHub Copilot CLI, Copilot 앱, VS Code에서 Agent Host를 사용하는 세션이다.
Sandbox(샌드박스) 는 프로그램이 실행되는 환경과 접근할 수 있는 자원을 제한하는 격리 구조다.
AI 코딩 에이전트에서는 이 기능이 특히 중요하다.
기존 코딩 도구는 개발자가 직접 명령을 실행하고 파일을 수정하는 방식이었다.
하지만 에이전트는 사용자가 요청한 작업을 해결하기 위해 스스로 여러 명령을 실행하거나, 프로젝트 파일을 읽고, 외부 API에 접근하고, 새로운 프로그램을 설치할 수 있다.
에이전트가 정상적으로 작업하더라도 사용자가 의도하지 않은 파일을 수정하거나 인증정보를 읽을 가능성이 있다.
또한 외부 문서나 저장소에 포함된 악성 지시가 모델에게 전달되는 prompt injection(신뢰할 수 없는 콘텐츠에 숨겨진 명령이 모델의 행동에 영향을 주는 공격) 도 문제가 된다.
이번 기능은 이런 위험을 단순히 모델에게 “조심하라”고 지시하는 대신 운영체제 수준에서 실제 접근 범위를 제한한다.
샌드박스 정책으로 제어할 수 있는 대상에는 다음과 같은 자원이 포함된다.
- 에이전트가 읽거나 수정할 수 있는 파일과 디렉터리
- 인터넷과 사내 네트워크 접근
- Git 및 GitHub CLI 인증정보
- 로컬 MCP 서버와 언어 서버 등 지원되는 개발 도구
- 기업 관리자가 강제로 적용하는 보안 정책
MCP(Model Context Protocol) 는 AI 에이전트가 외부 도구와 데이터에 접근하기 위한 표준화된 통신 규격이다.
예를 들어 에이전트가 현재 저장소의 코드를 수정하는 권한만 필요하다면 홈 디렉터리 전체나 다른 프로젝트, 개인 인증정보에 접근하지 못하도록 정책을 설정할 수 있다.
중요한 점은 이 정책을 모델의 선의에 맡기지 않는다는 것이다.
샌드박스 밖의 자원에 접근하려는 실제 명령을 실행 환경이 차단한다.
GitHub는 이를 위해 Microsoft가 공개한 Microsoft eXecution Container(MXC) 기술을 사용한다.
MXC는 공통 샌드박스 정책을 Windows, macOS, Linux의 각 운영체제가 제공하는 접근 통제 기능으로 변환하는 시스템이다.
기업에서는 관리자가 샌드박스 사용을 필수로 지정하고 개발자가 임의로 제한을 완화하지 못하도록 강제할 수도 있다.
모델 선택과 도구 실행 권한도 분리된다.
어떤 Claude나 GPT 모델을 Copilot에서 사용하든 실제 도구가 수행하는 행동에는 동일한 샌드박스 정책이 적용된다.
따라서 모델을 더 강력한 제품으로 교체하더라도 운영체제 접근권한이 함께 확대되는 것은 아니다.
로컬 샌드박스 기능은 기존 GitHub Copilot 요금제에 추가 비용 없이 포함된다.
Microsoft 역시 같은 날 MXC를 Windows 11에서 정식 출시했다고 발표했다.
GitHub Copilot뿐 아니라 Codex, OpenClaw, Replit, NVIDIA OpenShell 등 여러 에이전트 도구가 MXC를 지원하고 있으며 다른 제품도 도입을 준비하고 있다.
최근 코딩 에이전트는 사용자가 승인한 작업을 더 오랫동안 자율적으로 수행하는 방향으로 발전하고 있다.
그런 환경에서는 모델이 올바르게 판단할 확률을 높이는 것만으로는 충분하지 않다.
에이전트가 실수하거나 잘못된 지시를 받더라도 피해가 정해진 범위를 벗어나지 않도록 하는 실행 환경이 실제 개발 생산성과 보안을 함께 높이는 기반이 되고 있다.
GitHub, 비정형 비밀번호까지 탐지하는 전용 AI 보안 모델 도입…커밋 전 차단 기능도 확대
- 발표일: 2026-10-07 — 정확한 게시 시각 미확인
- 적용 범위: GitHub Secret Protection, GitHub Advanced Security, Copilot, 비밀정보 유출 탐지, 코드 보안
- 원문: GitHub — Purpose-built model for leaked secret detection
GitHub가 소스코드 안에 포함된 인증정보를 더 정확하게 탐지하기 위한 전용 AI 모델을 도입했다.
기존의 비밀정보 탐지는 주로 정규표현식이나 알려진 토큰 형식을 이용하는 방식이었다.
예를 들어 특정 클라우드 서비스의 API 키는 일정한 접두사나 길이, 문자 패턴을 가지고 있어 비교적 쉽게 탐지할 수 있다.
하지만 실제 개발 과정에서 유출되는 정보가 항상 이런 형식을 갖는 것은 아니다.
환경설정 파일에 직접 작성한 데이터베이스 비밀번호나 내부 시스템의 임시 인증정보는 특별한 접두사가 없을 수 있다.
일반적인 문자열 패턴만으로 이런 값을 탐지하면 정상적인 테스트 데이터와 실제 비밀번호를 구분하기 어렵다.
GitHub의 새 모델은 문자열 자체의 형식뿐 아니라 주변 코드와 변수명, 설정 문맥을 함께 분석해 실제 인증정보일 가능성을 판단한다.
범용 LLM처럼 코드를 생성하거나 자연어 답변을 만드는 모델이 아니라 비밀정보 탐지 작업에 특화해 미세조정한 모델이다.
이 기능은 이미 AI 기반 비밀번호 유출 알림을 사용하던 GitHub Secret Protection 및 GitHub Advanced Security 고객에게 자동으로 적용됐다.
기존 AI 탐지 알림에 대해서는 추가 비용이 발생하지 않는다.
이번 발표에는 비밀정보가 실제 저장소에 기록되기 전에 탐지하는 AI push protection도 포함됐다.
기존 push protection은 알려진 API 키 형식을 중심으로 작동했지만, 새로운 방식은 명확한 형식이 없는 비밀번호도 커밋이 원격 저장소에 올라가기 전에 검사한다.
다만 이 기능은 현재 private preview 단계이며 조직 관리자가 사용을 활성화해야 한다.
또한 개발자가 Copilot에서 /security-review를 실행할 때 전용 비밀정보 탐지 모델의 결과를 함께 사용하는 기능도 추가될 예정이다.
기존 /security-review는 변경된 코드에서 보안 취약점을 찾아 우선순위를 제시하는 기능이다.
앞으로는 여기에 비정형 인증정보 검사를 결합해 개발자가 PR을 생성하거나 코드를 push하기 전에 문제를 발견할 수 있도록 한다.
이 추가 검사는 아직 공개된 정식 기능이 아니라 향후 private preview로 제공될 예정이다.
과금 구조도 구분된다.
기존 Secret Protection에 포함된 AI 기반 알림은 추가 비용이 없지만, 새로운 push protection 검사와 /security-review 통합 검사는 GitHub AI Credits를 소비하는 별도의 선택 기능이 될 예정이다.
GitHub는 조직이 이 기능을 활성화하기 전에 권한 정책과 예산을 설정할 수 있도록 관련 과금 방식을 미리 공개했다.
AI가 작성하는 코드의 양이 늘어나면 비밀번호나 인증정보가 코드에 포함되는 위험도 함께 관리해야 한다.
이번 변경은 단순히 AI에게 보안 코드를 검토하게 하는 것을 넘어 특정한 보안 문제를 위한 작은 전용 모델을 개발 과정의 여러 지점에 배치하는 접근을 보여준다.
4️⃣ 산업·정책·안전
미국 상원, 프런티어 AI 독립 감사·사고 신고·강제 안전기준을 포함한 규제 원칙 제안
- 발표일: 2026-10-07 — 정확한 게시 시각 미확인
- 적용 범위: 미국 AI 정책, 프런티어 모델 규제, 독립 안전 감사, 자율 에이전트 사고, 오픈소스 AI
- 원문: U.S. Senate Committee on Commerce — Cantwell Outlines Comprehensive Governance Framework for Safe and Secure Frontier AI
미국 상원 상무·과학·교통위원회의 민주당 간사인 Maria Cantwell 상원의원이 프런티어 AI의 안전과 책임을 관리하기 위한 포괄적인 정책 원칙을 발표했다.
이번 발표는 여섯 가지 원칙을 중심으로 구성됐다.
핵심은 고위험 프런티어 모델에 대해 명확한 연방 안전기준을 만들고, 독립적인 평가를 통해 기준 충족 여부를 확인하며, 실제 문제가 발생했을 때 개발사가 이를 공개하고 책임지도록 하는 것이다.
먼저 Cantwell 의원은 미국 국립표준기술연구소 NIST(National Institute of Standards and Technology) 가 다른 연방기관과 협력해 측정 가능하고 집행할 수 있는 AI 안전기준을 개발해야 한다고 제안했다.
검토 대상에는 AI를 이용한 사이버공격, 화학·생물학적 위험, 핵심 안전장치 우회, 인간의 통제를 벗어나는 자율 에이전트 등이 포함된다.
또한 강력한 AI 시스템이 스스로를 수정하거나 개선하는 과정에서 기존 안전장치를 우회할 위험도 평가해야 한다고 주장했다.
두 번째는 독립적인 안전 감사다.
모델 개발사가 자체적으로 안전하다고 발표하는 것만으로는 충분하지 않으므로, 일정 수준 이상의 프런티어 모델은 공개 전에 독립적인 감사기관의 평가를 받아야 한다는 것이다.
일반 기업의 재무제표를 외부 회계감사인이 검토하는 것처럼 AI 개발사의 안전관리 체계도 외부 기관이 검사하도록 하는 접근이다.
평가는 출시 전에 한 번만 수행하는 것으로 끝나지 않는다.
모델의 성능과 사용 범위가 바뀌면 새로운 위험이 발생할 수 있기 때문에 지속적인 테스트와 재검토가 필요하다고 설명한다.
세 번째는 심각한 사고에 대한 신고 의무다.
Cantwell 의원은 자율 에이전트의 통제 상실, 위험한 사이버 기능의 발현, 핵심 안전장치의 실패, 안전장치를 우회하는 자기 개선 행동 등이 발생했을 때 개발사가 이를 신속하게 신고해야 한다고 제안했다.
최근 AI 에이전트가 실제 브라우저와 기업 시스템, 외부 네트워크를 직접 조작하면서 이러한 사고가 단순한 모델 답변 문제가 아니라 현실의 보안 사고로 이어질 가능성이 커지고 있다.
내부 직원의 신고를 보호하기 위한 whistleblower protection(내부고발자 보호) 도 포함됐다.
모델 개발사가 위험한 문제를 알고 있으면서 외부에 공개하지 않거나 내부 직원이 보안 문제를 신고했다는 이유로 불이익을 받지 않도록 하는 장치다.
오픈소스 AI에 대해서는 별도의 기준이 필요하다고 제안했다.
모든 모델에 폐쇄형 API와 동일한 규칙을 적용하면 공개 모델의 연구와 개발을 불필요하게 제한할 수 있으므로, 오픈소스의 특성을 고려한 전문적인 안전기준을 마련해야 한다는 입장이다.
이 밖에도 아동 보호, 노동자 지원, 중대한 의사결정에서의 인간 감독, 공공·민간 협력과 국제적인 안전기준 조율 등이 포함됐다.
다만 이번 발표가 새로운 연방법의 제정이나 시행을 의미하지는 않는다.
Cantwell 의원이 제시한 것은 향후 입법과 행정 조치에 반영해야 할 정책 원칙이다. 구체적인 법률 문구가 확정됐거나 의회가 해당 기준을 의무화한 상태는 아니다.
미국 AI 정책에서는 빠른 기술 개발과 규제 부담 완화를 강조하는 입장과 강력한 사전 검증·법적 책임을 요구하는 입장이 함께 존재한다.
이번 제안은 후자에 가까우며, 특히 프런티어 모델 공개 전에 독립 감사가 필요하다는 주장은 개발사들이 주로 수행해 온 자체 안전 평가보다 강한 규제 접근이다.
AI 안전을 기업의 자발적인 약속에 맡길 것인지, 아니면 고위험 시스템에 대해 외부 감사와 강제 신고 의무를 적용할 것인지가 앞으로 미국 AI 정책의 주요 논쟁 가운데 하나가 될 것으로 보인다.
📚 추천 글
Building an evidence-grounded agentic security operations harness on Cloudflare
- 저자: Deanna Tran, Javier Castro, Jacob Crisp, Blake Darché
- 발행: Cloudflare
- 게시일: 2026-10-07
- 원문: Cloudflare — Building an evidence-grounded agentic security operations harness
AI 에이전트에게 보안 경보를 분석하도록 맡겼을 때 그럴듯한 잘못된 결론이 어떻게 만들어지고, 실제 운영 시스템에서 이를 어떻게 방지할 수 있는지 구체적인 아키텍처로 설명하는 글이다.
Cloudflare는 수많은 보안 경보를 처리하는 Managed Defense 서비스에 AI 에이전트를 도입하면서 처음에는 하나의 범용 에이전트에게 전체 조사 과정을 맡겼다.
그러나 초기 실험에서 문제가 발견됐다.
모델은 상당히 유용한 분석을 만들어냈지만, 일부 결과에서는 실제 증거가 뒷받침하지 않는 주장을 했다.
네트워크 telemetry, 탐지 규칙, 보안 정책, 외부 위협정보를 하나의 긴 프롬프트에 넣다 보니 서로 다른 신뢰 수준과 의미를 가진 정보들이 구분되지 않았기 때문이다.
예를 들어 한 IP 주소에서 이상한 요청이 발생했다는 사실과 그 IP 주소가 대규모 공격 캠페인에 참여하고 있다는 판단은 전혀 다른 정보다.
하지만 모든 데이터를 한 번에 받은 모델은 일부 증거만으로 더 강한 결론을 내릴 수 있었다.
Cloudflare는 해결책으로 증거 수집과 접근 범위 제한을 모델 밖의 일반 프로그램 코드로 이동시켰다.
먼저 애플리케이션이 분석 대상과 허용된 데이터 범위를 확정하고, 모델은 그 범위 안에서 제공된 자료만 사용할 수 있도록 했다.
복잡한 분석은 네 개의 전문 에이전트가 병렬로 수행한다.
하나는 네트워크 트래픽과 차단 결과를 살펴보고, 다른 하나는 해당 고객의 과거 경보와 분석 결과를 검토한다. 세 번째는 Cloudflare 전체 네트워크의 집계 통계를 분석하고, 마지막은 위협 인텔리전스를 확인한다.
이후 별도의 종합 에이전트가 결과를 합치지만 새로운 증거를 임의로 가져오거나 허용되지 않은 보안 분류를 만들어낼 수는 없다.
모든 조사에는 증거를 정리한 버전 관리 패키지가 만들어진다.
이 패키지에는 조사 대상, 시간 범위, 사용된 데이터, 보안 정책 버전과 확인하지 못한 정보가 기록된다.
에이전트가 작성한 주장에는 해당 증거를 연결해야 하며 일반 프로그램 코드가 실제로 존재하는 증거인지, 현재 조사에 속하는 증거인지, 주장을 뒷받침하는지를 검사한다.
여기서 중요한 것은 모델에게 “근거를 제시하라”고 요청하는 것으로 끝내지 않는다는 점이다.
모델이 잘못된 증거 번호를 만들어내거나 관련 없는 자료를 인용하면 애플리케이션이 결과를 거부하거나 한계로 기록한다.
정보가 없는 상황도 세분화했다.
Cloudflare는 아직 확인하지 않은 상태, 확인했지만 일치하는 결과를 찾지 못한 상태, 실제로 해당 정보가 없다는 증거를 확보한 상태를 서로 다르게 기록한다.
예를 들어 전 세계 네트워크 데이터를 확인하는 시스템이 일시적으로 응답하지 않는다면 “이 공격은 전 세계적으로 확산되지 않았다”고 결론 내려서는 안 된다.
단지 전 세계 확산 여부를 확인하지 못했다고 기록해야 한다.
Cloudflare는 이를 실제 운영에 적용하기 위해 Workers, Workflows, D1, R2, Durable Objects와 AI Search 등을 사용한다.
에이전트의 최종 역할은 보안 담당자가 판단할 수 있도록 증거와 추천 조치를 정리하는 것이며, 실제 보안 정책을 적용할 권한은 사람에게 남겨둔다.
이 글에서 가장 유용한 점은 멀티에이전트 구조를 도입했다는 사실 자체가 아니다.
오히려 어떤 판단을 AI에게 맡기고, 어떤 규칙을 일반 프로그램 코드로 강제해야 하는지를 실패 사례와 함께 보여준다는 점이다.
AI 에이전트를 운영할 때 단순히 모델을 더 좋은 것으로 바꾸는 것보다 증거의 출처, 접근 범위, 불확실성과 최종 실행 권한을 구조적으로 관리하는 것이 중요하다는 사실을 이해하기 좋은 자료다.
Rethinking access control for RAG with Amazon Quick and Amazon Bedrock
- 저자: Amit Choudhary, Surendran Raju
- 발행: AWS Artificial Intelligence Blog
- 게시일: 2026-10-07
- 원문: AWS — Rethinking access control for RAG with Amazon Quick and Amazon Bedrock
회사 내부 문서를 AI가 검색하도록 만들 때 가장 중요한 보안 문제 가운데 하나는 검색 결과가 실제 사용자의 접근권한을 정확하게 반영하는가이다.
예를 들어 같은 회사의 직원이라도 모든 SharePoint 문서나 Google Drive 파일을 열어볼 수 있는 것은 아니다.
인사팀의 급여 자료, 재무팀의 미공개 실적, 특정 프로젝트의 기술 문서는 조직과 역할에 따라 접근이 제한될 수 있다.
RAG는 이런 문서를 검색한 뒤 관련 내용을 LLM의 입력에 넣어 답변을 만드는 방식이다.
여기서 모델이 사용자에게 접근권한이 없는 문서를 검색해 답변에 반영한다면 원문 파일을 직접 보여주지 않더라도 중요한 정보가 유출될 수 있다.
기존 RAG 시스템에서는 문서와 함께 ACL을 검색 인덱스에 복사하는 방식이 널리 사용됐다.
ACL(Access Control List) 은 어떤 사용자나 그룹이 특정 자료에 접근할 수 있는지 나타내는 권한 목록이다.
검색 시스템은 사용자가 질문하면 인덱스에 저장된 ACL을 확인하고 접근 가능한 문서만 검색 결과로 반환한다.
문제는 이 권한 정보가 실시간으로 업데이트되지 않는다는 것이다.
예를 들어 어떤 직원이 프로젝트에서 제외돼 SharePoint 접근권한이 취소됐더라도 RAG 인덱스의 ACL은 마지막 동기화 시점의 이전 권한을 유지할 수 있다.
그 사이에는 실제 원본 시스템에서 파일을 열 수 없는 사용자가 AI에게 질문해 문서 내용을 알아낼 위험이 생긴다.
AWS는 이 문제를 해결하기 위해 두 단계의 권한 검사를 제안한다.
첫 번째 단계에서는 기존 방식대로 검색 인덱스에 저장된 ACL을 사용한다.
사용자가 접근할 수 있을 것으로 예상되는 문서만 먼저 검색해 후보를 줄인다.
두 번째 단계에서는 검색된 문서에 대해 실제 원본 시스템에 다시 접근권한을 확인한다.
예를 들어 Google Drive 문서라면 해당 사용자의 권한으로 Google Drive API를 호출해 현재 문서를 읽을 수 있는지 확인한다.
이렇게 하면 검색 인덱스가 오래된 권한 정보를 보유하고 있더라도 최종적으로는 실제 데이터 소스가 가진 최신 권한 정보를 기준으로 판단할 수 있다.
검증을 통과한 문서만 LLM에 전달된다.
이는 단순한 사후 출력 필터보다 안전한 구조다.
이미 권한 없는 문서가 모델의 컨텍스트에 들어간 뒤 답변에서 제거하려고 하면 모델이 해당 내용을 다른 형태로 요약하거나 암시적으로 활용했을 가능성을 완전히 차단하기 어렵기 때문이다.
AWS는 이런 구조를 Amazon Quick와 Amazon Bedrock Knowledge Bases에 적용하는 방식을 구체적으로 설명한다.
글에서는 Google Drive 사례를 중심으로 사용자별 인증 토큰, 검색 인덱스의 사전 필터링, 원본 데이터 소스의 실시간 검증을 어떻게 결합하는지 보여준다.
핵심적인 설계 원칙은 검색 시스템이 권한 정보의 최종 진실 공급자가 되어서는 안 된다는 것이다.
AI 시스템은 문서를 빠르게 검색할 수는 있지만, 문서의 실제 소유자와 공유 정책을 관리하는 것은 여전히 원본 시스템이다.
RAG를 실제 기업 업무에 연결할 때 단순히 검색 정확도와 답변 품질을 높이는 것보다 기존 조직의 데이터 접근정책을 어떻게 유지할 것인가가 중요하다는 점을 구체적인 구현 구조로 이해할 수 있는 글이다.
How Cornerstone OnDemand cut database diagnosis by 78% with Amazon Bedrock
- 저자: Derek Ziehl, Harpreet Chawla, Madhu Pai, Nishchai JM
- 발행: AWS Artificial Intelligence Blog
- 게시일: 2026-10-07
- 원문: AWS — How Cornerstone OnDemand cut database diagnosis by 78% with Amazon Bedrock
AI 에이전트를 실제 기업의 데이터베이스 운영 업무에 적용했을 때 어떤 작업을 자동화하고 어떤 판단을 사람에게 남겨야 하는지 구체적인 사례로 설명하는 글이다.
Cornerstone OnDemand는 전 세계 186개국에서 약 1억4천만 명의 사용자를 지원하는 기업용 인력관리 소프트웨어 회사다.
대규모 서비스를 운영하는 만큼 여러 데이터베이스의 성능 문제와 장애를 지속적으로 조사해야 한다.
기존에는 데이터베이스에 문제가 발생하면 담당 엔지니어가 SQL Server에 접속해 시스템 상태를 확인하고, 실행 중인 쿼리와 로그를 분석한 뒤 관련 팀에 전달하는 과정을 수행했다.
이 과정에는 평균 약 45분이 걸렸다.
Cornerstone은 이를 줄이기 위해 Orion AI라는 멀티에이전트 시스템을 개발했다.
Orion AI는 Amazon Bedrock과 AWS의 오픈소스 에이전트 프레임워크인 Strands Agents를 사용한다.
하나의 거대한 에이전트가 모든 업무를 처리하는 대신 중앙의 meta-orchestrator(작업을 분배하고 결과를 조합하는 상위 조정 에이전트) 가 전문 에이전트에게 작업을 맡긴다.
각 에이전트는 데이터베이스 성능 진단, 인프라 모니터링, 데이터베이스 관리, 고객 분석과 내부 지식 검색처럼 명확하게 나뉜 영역을 담당한다.
실제로 장애가 발생하면 관련 로그와 성능 지표를 수집하고, 여러 원인 후보를 분석한 뒤, 어떤 문제가 발생했을 가능성이 높은지 정리한다.
필요한 경우 수정 방향을 제안하고 담당 엔지니어에게 할당할 Jira 티켓까지 생성한다.
Cornerstone이 발표한 운영 결과에 따르면 평균 데이터베이스 진단 시간은 45분에서 10분으로 감소했다.
약 78% 단축된 것이다.
기존에 10단계가 넘던 일부 데이터베이스 관리 작업은 하나의 자연어 요청으로 실행할 수 있게 됐다.
SRE팀과 데이터팀 사이에 존재하던 약 15분의 정보 전달 지연도 실시간에 가까운 방식으로 바뀌었으며 중복 경보는 중앙값 기준 약 65% 감소했다.
이 수치는 Cornerstone과 AWS가 공개한 실제 운영 사례 결과다. 별도의 독립기관이 통제된 실험으로 검증한 일반적인 에이전트 성능 향상 수치는 아니다.
개발 규모도 흥미롭다.
Cornerstone은 3명으로 구성된 팀이 약 6개월 동안 시스템을 개발했다고 밝혔다.
규모가 큰 기업의 시스템이지만 처음부터 모든 운영 기능을 하나의 거대한 AI 플랫폼으로 다시 만들지 않았다.
기존 모니터링과 데이터베이스 도구를 유지하고, 그 위에서 여러 도구를 선택하고 결과를 조합하는 계층을 AI 에이전트로 구성했다.
글에서 소개한 중요한 설계 선택 가운데 하나는 에이전트를 작업의 난이도보다 업무 영역에 따라 분리한다는 것이다.
각 에이전트가 다룰 수 있는 도구를 제한하면 모델이 불필요한 API를 호출할 가능성을 줄이고 해당 업무에 필요한 정보에 집중할 수 있다.
도구 검색 역시 항상 의미 기반 검색을 사용하는 대신 명확한 요청은 keyword routing으로 빠르게 처리하고, 모호한 요청에서만 semantic search를 사용하도록 구성했다.
또한 대화 내용과 현재 운영 지표를 구분했다.
이전 대화를 기억하는 기능은 편리하지만 데이터베이스의 실제 상태를 묻는 요청에서는 과거에 저장한 메모리보다 현재 시스템의 최신 데이터를 우선해야 한다.
Cornerstone은 운영 지표를 조회할 때 대화 메모리를 우회하고 실제 시스템 상태를 확인하도록 설계했다.
멀티에이전트 시스템을 도입할 때 무조건 많은 에이전트를 만드는 것보다 기존 도구 연결, 업무 경계, 최신 데이터 확보와 사람의 승인 절차를 명확히 설계하는 것이 더 중요하다는 점을 실제 운영 결과로 보여주는 글이다.
One Model Family, Two Gold-Level Results: Fine-Tuning Nemotron for IOI and IMO
- 저자: Aleksander Aficek, Igor Gitman, Sean Narenthiran, Mehrzad Samadi, Somshubra Majumdar 외 NVIDIA 연구진
- 발행: NVIDIA / Hugging Face
- 게시일: 2026-10-07
- 원문: Hugging Face — One Model Family, Two Gold-Level Results: Fine-Tuning Nemotron for IOI and IMO
하나의 범용 언어모델을 모든 문제에 사용하기보다 특정한 문제를 잘 해결하도록 추가 학습시키고 여러 검증 단계를 결합하는 방식을 구체적인 연구 결과로 설명하는 글이다.
NVIDIA 연구팀은 Nemotron 3 모델을 기반으로 서로 다른 두 분야에 특화된 시스템을 개발했다.
하나는 **IOI(International Olympiad in Informatics, 국제정보올림피아드)**의 알고리즘 문제를 해결하는 시스템이고, 다른 하나는 **IMO(International Mathematical Olympiad, 국제수학올림피아드)**의 수학 증명을 작성하는 시스템이다.
두 대회는 모두 어려운 문제를 다루지만 필요한 능력은 상당히 다르다.
IOI에서는 정확하고 효율적인 알고리즘을 설계한 뒤 실제 코드가 제한 시간과 메모리 조건 안에서 테스트를 통과해야 한다.
반면 IMO에서는 수학적 결론만 맞히는 것으로는 부족하다. 논리적으로 완전한 증명을 제시해야 한다.
NVIDIA는 두 분야에서 각각 gold-medal 수준의 결과를 기록했다고 밝혔다.
IOI 2026에서 Nemotron 기반 시스템은 600점 만점에 535.4점을 기록했다. 공식 금메달 기준인 361.12점과 인간 참가자의 최고 점수인 498.27점을 넘어서는 결과다.
다만 이 기록은 공식 IOI 순위에 포함된 것은 아니다.
대회와 동일한 시간·인터넷 사용·제출 제한을 적용한 별도의 실시간 비공식 평가에서 얻은 결과다.
IMO 2026에서는 42점 만점에 30점을 기록했다. 당시 공식 금메달 기준은 29점이었으며, 제출된 증명은 공식 IMO 채점위원들이 평가했다.
두 결과가 중요하다고 해서 완전히 새로운 모델을 처음부터 학습한 것은 아니다.
연구팀은 기존 Nemotron 3를 기반으로 SFT(Supervised Fine-Tuning, 좋은 정답과 문제 해결 과정을 예시로 학습하는 방법) 와 RL(Reinforcement Learning, 실행 결과에 따른 보상을 통해 행동을 개선하는 강화학습) 을 적용했다.
IOI 시스템에서는 약 2만2천 개의 알고리즘 문제를 수집하고, 문제를 해결하는 추론 과정을 합성 데이터로 생성했다.
SFT를 통해 알고리즘 문제 해결 능력을 높이고, 추가적으로 필요한 모델에는 강화학습을 적용했다.
흥미로운 점은 모델을 학습시키는 것으로 끝나지 않았다는 것이다.
NVIDIA는 GenCorrect라는 반복적인 실행 구조를 함께 사용했다.
모델이 먼저 코드를 생성하고, 그 코드를 테스트하고, 오류를 분석한 뒤, 수정안을 만들어 다시 테스트하는 과정이다.
이를 통해 비교적 작은 Nemotron 모델도 기본적인 모델 실행만으로는 도달하기 어려웠던 점수를 기록했다.
IMO에서는 접근 방식이 조금 달랐다.
연구팀은 약 41만4천 개의 품질 검증된 증명 학습 사례를 준비했다.
여기에는 완성된 증명을 만드는 예시뿐 아니라 잘못된 증명을 비판하고, 빠진 논리 단계를 찾고, 증명을 수정하고, 완전성을 검토하는 과정도 포함됐다.
강화학습에서는 약 9,600개의 증명 문제를 사용했다.
최종 시스템은 하나의 모델이 한 번에 정답을 만드는 방식이 아니었다.
서로 다르게 학습된 모델들이 여러 증명 후보를 만들고, 평가하고, 비판하고, 개선한 뒤 마지막에 가장 타당한 증명을 선택했다.
이는 test-time compute(모델 학습이 끝난 뒤 실제 문제를 풀 때 추가 계산을 사용하는 방식) 를 적극적으로 활용한 구조다.
일반적으로 모델의 능력을 높이려면 더 큰 모델을 학습해야 한다고 생각하기 쉽다.
하지만 이 연구에서는 이미 학습된 범용 모델에 특정 업무에 맞는 데이터와 검증·수정 과정을 추가하는 것만으로도 상당한 성능 향상을 얻을 수 있었다.
다만 IOI와 IMO의 성과가 일반적인 소프트웨어 개발이나 수학 연구에서도 동일한 성능을 보장한다는 뜻은 아니다.
올림피아드 문제는 평가 기준이 명확하고 충분한 학습·검증 절차를 설계할 수 있는 특수한 환경이다.
그럼에도 이 글은 앞으로 AI 시스템의 성능을 개선할 때 단순히 모델 자체를 더 크게 만드는 것 외에 전문 학습 데이터, 검증자, 반복 수정 과정과 추론 단계의 계산 자원을 어떻게 조합해야 하는지를 구체적인 실험으로 보여준다.