AI 데일리 브리핑 — 2026-09-21
Soshy·

기준 시점: 2026-09-21 06:00 KST (Asia/Seoul)
AI 동향 조사 범위: 2026-09-20 06:00 ~ 2026-09-21 06:00 KST
AI 추천 글 범위: 2026-09-14 06:00 ~ 2026-09-21 06:00 KST
1️⃣ 주요 모델·연구
StepFun, 600B MoE 기반 장기 작업용 플래그십 모델 ‘Step 5 Preview’ 공개
- 발표일: 2026-09-20 — 정확한 게시 시각 미확인
- 적용 범위: 소프트웨어 엔지니어링, 장시간 에이전트 작업, 전문 지식 업무, 금융 분석, 멀티모달 입력
- 원문: StepFun 공식 발표 — Step 5 Preview
중국 AI 기업 StepFun이 에이전트 작업을 주목적으로 설계한 새 플래그십 모델 Step 5 Preview를 공개했다. 모델은 **sparse MoE(Mixture-of-Experts, 전체 파라미터 중 입력에 필요한 일부 전문가 네트워크만 선택적으로 활성화하는 구조)**를 사용하며, 전체 파라미터는 600B지만 토큰 하나를 처리할 때 실제로 활성화되는 파라미터는 27B다. 최대 100만 토큰 컨텍스트와 이미지 입력을 지원하며, 일반 채팅보다 소프트웨어 개발·전문 업무·장시간 도구 사용을 중심으로 설계됐다. 모델은 현재 StepFun 제품과 API에서 사용할 수 있고, 회사는 오픈 가중치를 10월 15일 공개할 예정이라고 밝혔다. (StepFun)
특히 StepFun은 단발성 코딩 문제보다 실제 개발 환경에 가까운 긴 작업을 강조했다. 자체 제작한 StepCodeBench는 553개 저장소, 9개 작업 유형, 20개 응용 분야, 33개 프로그래밍 언어를 포함하며 Step 5 Preview가 avg@4 기준 49.0%를 기록했다고 밝혔다. GPU 커널 최적화 실험에서는 H100에서 24시간 동안 코드를 작성하고 실행 결과를 되먹임 받아 개선하도록 했으며, 최고 실행에서 약 22시간 뒤 508 TFLOPS에 도달했다고 보고했다. 또 Pokémon Red 환경에서는 3,000회 이상의 상호작용과 600만 토큰 이상을 유지하면서 장기 목표를 수행하는 실험도 진행했다. (StepFun)
다만 수치를 해석할 때는 평가 출처를 구분할 필요가 있다. StepCodeBench와 FinStepBench 일부는 StepFun이 직접 만든 벤치마크이며 GPU 최적화와 장기 에이전트 실험 역시 회사가 구성한 실험이다. 반면 Artificial Analysis 평가 결과도 일부 병기돼 있다. 따라서 이번 발표의 의미는 특정 벤치마크에서 최고 성능을 냈다는 주장보다는, 모델이 수시간~수십 시간 동안 실행·검증·수정 루프를 지속하는 작업 자체를 주요 설계 목표로 삼았다는 점에 있다. (StepFun)
Alibaba, 텍스트·이미지·오디오·비디오를 한 모델에서 처리하는 ‘Qwen3.8-Omni-Flash’ 공개
- 발표일: 2026-09-20 — 정확한 게시 시각 미확인
- 적용 범위: 멀티모달 이해, 장시간 영상·음성 분석, 실시간 대화, 영상 제작·번역, 멀티모달 에이전트와 도구 호출
- 원문: Alibaba Cloud 공식 발표 — Qwen3.8-Omni-Flash
Alibaba Qwen 팀은 텍스트·이미지·오디오·비디오를 하나의 모델에서 직접 처리하는 Qwen3.8-Omni-Flash를 발표했다. 여기서 omnimodal은 각각 별도의 모델을 연결하는 대신 여러 입력 양식을 하나의 모델이 함께 이해한다는 의미다. 최대 100만 토큰 컨텍스트를 지원하며, 이번 세대는 단순히 영상이나 음성을 설명하는 데서 벗어나 내용을 분석한 뒤 계획을 세우고 도구를 호출해 결과물까지 만드는 에이전트 흐름에 초점을 맞췄다. (AlibabaCloud)
예를 들어 긴 회의 영상을 입력하면 화자를 구분하고 회의록과 할 일을 추출하는 데 그치지 않고, 에이전트와 연결해 이메일을 보내거나 작업을 정리하고 코딩을 시작할 수 있다. 긴 영상에서는 모든 프레임을 똑같이 처리하는 대신 질문과 관련된 구간을 여러 단계로 찾아가는 방식을 제공한다. Alibaba 자체 OmniVideoBench 실험에서는 이 방식으로 정확도가 63.4에서 67.8로 올라가는 동안 질의당 토큰 사용량이 145,736개에서 79,117개로 약 45.7% 줄었다. (AlibabaCloud)
제품과 함께 에이전트 실행 환경도 확장됐다. Qwen-MM-Plugins는 Codex, Claude Code, Qwen Code, Gemini CLI 등 여러 에이전트 환경에서 이미지·오디오·영상·문서 처리를 사용할 수 있게 하며, 영상 튜토리얼을 구조화된 PDF로 바꾸는 Video2Note와 시연 영상에서 재사용 가능한 작업 절차를 추출하는 Omni Skill Creator도 공개됐다. 지속적인 카메라·마이크 입력을 처리하는 Qwen-Live Harness도 오픈소스로 제공한다. (AlibabaCloud)
Alibaba는 29개 평가의 평균 점수가 Qwen3.5-Omni-Plus보다 25% 이상 높아졌고 시간당 오디오 입력 API 비용은 98% 이상, 오디오·영상 입력은 93% 이상 낮아졌다고 주장한다. 다만 이 비교는 Alibaba가 정한 입력 해상도·프레임률·환율과 API 설정을 사용한 회사 자체 평가 및 가격 비교이므로, 독립적인 동일 조건 평가로 해석해서는 안 된다. (AlibabaCloud)
2️⃣ AI 제품·서비스
Alibaba, 화자까지 구분하는 실시간 통역 서비스 ‘Qwen3.8-LiveTranslate’ 공개
- 발표일: 2026-09-20 — 정확한 게시 시각 미확인
- 적용 범위: 실시간 동시통역, 다자간 회의, 국제 행사, 고객 서비스, 음성-음성 번역 API
- 원문: Alibaba Cloud 공식 발표 — Qwen3.8-LiveTranslate
Alibaba는 실시간 통역에 특화된 Qwen3.8-LiveTranslate도 별도로 공개했다. 이번 버전은 번역 문장만 생성하는 것이 아니라 여러 사람이 번갈아 말할 때 누가 어떤 말을 했는지 실시간으로 분리해 표시하고, 번역 음성에서도 각 화자의 음색을 보다 일관되게 유지하도록 설계됐다. 원문과 번역문을 동시에 보여주는 이중 언어 출력과, 앞선 대화 내용을 이용해 인명·전문용어·지시 대상을 해석하는 장문맥 모호성 해소 기능도 추가됐다. (AlibabaCloud)
모델은 오디오와 텍스트를 하나의 시간 흐름으로 섞어 처리하는 Interleave 구조를 사용한다. 이미 들은 음성과 앞에서 만든 번역을 캐시해 다음 번역에 재사용하는 방식이며, Alibaba의 자체 측정에서 LAAL(Length-Adaptive Average Lagging, 발화와 번역 출력 사이의 평균 지연을 나타내는 지표)이 이전 세대 2.8초에서 2.3초로 줄었다. 입력 음성→번역 텍스트는 60개 언어, 번역 음성 출력은 29개 언어를 지원한다. 공개 FLEURS 데이터셋을 이용한 비교에서도 회사는 번역·지연·음성인식·음성합성 지표가 개선됐다고 밝혔지만, 비교 실행 자체는 Alibaba가 수행했다. (AlibabaCloud)
개발자는 DashScope의 qwen3.8-livetranslate-flash-realtime 모델을 WebSocket 방식으로 호출할 수 있다. 마이크 오디오를 스트리밍하면서 필요하면 카메라 이미지도 시각적 문맥으로 전달할 수 있고, 특정 인명이나 업계 용어를 별도 사전에 등록해 인식 정확도를 높이는 구성도 지원한다. 즉 기존의 “음성 인식 → 텍스트 번역 → 음성 합성”을 각각 연결하는 방식 대신, 실시간 대화의 화자와 문맥까지 하나의 통역 시스템에서 처리하려는 방향이다. (AlibabaCloud)
3️⃣ 개발 도구·에이전트
Baidu AI Cloud, AgentOS·Cloud Skills Center 등 에이전트용 클라우드 구성요소 정식 출시
- 발표일: 2026-09-20 — 정확한 게시 시각 미확인
- 적용 범위: 클라우드 기반 AI 에이전트 실행 환경, 서버 이미지, 에이전트용 재사용 기능과 AI 애플리케이션 운영
- 원문: Baidu AI Cloud 공식 제품 업데이트
Baidu AI Cloud는 9월 클라우드 제품 업데이트에서 ASC, AgentOS, Cloud Skills Center를 정식 출시했다고 밝혔다. 공식 제품 업데이트 페이지는 이 세 구성요소를 클라우드 위 AI 애플리케이션을 보다 안전하고 효율적으로 운영하기 위한 신규 제품군으로 묶어 발표했다. 세부 사양이 모두 같은 수준으로 공개된 것은 아니지만, 특히 AgentOS는 별도 공식 문서에서 구체적인 역할을 확인할 수 있다. (클라우드 바이두)
AgentOS는 일반적인 에이전트 프레임워크나 SDK가 아니라 Baidu Cloud Linux(BaiduLinux)를 기반으로 만든 AI Agent 전용 운영체제 이미지다. 즉 클라우드 서버를 만든 뒤 사용자가 운영체제와 각종 에이전트 실행 의존성을 처음부터 조립하는 대신, 에이전트 실행을 전제로 한 서버 이미지를 출발점으로 사용할 수 있도록 하는 접근이다. Baidu 공식 문서는 이를 “Agent 시대를 위한 OS”로 설명한다. (클라우드 바이두)
같은 업데이트에는 Cloud Skills Center도 정식 출시 목록에 포함됐다. 이는 최근 에이전트 플랫폼에서 반복되는 ‘Skill’, 즉 특정 도구 사용법이나 업무 절차를 재사용 가능한 기능 단위로 관리하려는 흐름과 맞닿아 있다. 다만 현재 공개된 제품 업데이트 목록에서는 ASC와 Cloud Skills Center의 세부 내부 구조나 성능 지표가 제한적으로만 노출돼 있으므로, 공개되지 않은 기능이나 성능 수치를 추정해서 해석할 단계는 아니다. (클라우드 바이두)
4️⃣ 산업·정책·안전
이번 조사 범위에서 포함할 만한 주요 신규 발표를 확인하지 못했습니다.
📚 AI 추천 글
What Stripe data shows about fraud at AI startups
- 저자: Jacob Meltzer, Samuel Bakouch
- 발행: Stripe
- 게시일: 2026-09-15
- 원문: Stripe 원문
AI 서비스가 성장하면서 새로운 운영 비용으로 떠오르는 사기와 무료 사용량 남용을 실제 결제 데이터로 분석한 글이다. Stripe 데이터에 따르면 2025년 3분기 Stripe를 사용하는 AI 스타트업의 결제 사기 시도율은 전체 스타트업 평균의 4.3배였고, 2026년 1분기에는 2.6배까지 낮아졌다. 반면 AI 구독 서비스에서 여러 계정을 만들어 무료 토큰이나 체험 혜택을 반복해서 가져가는 multi-account abuse 시도는 2026년 1~6월 사이 40% 증가했다. (Stripe)
이 패턴이 AI 서비스에서 특히 강한 이유를 글은 ‘연산 자원의 재판매 가능성’으로 설명한다. 도난 카드로 구독권이나 토큰을 구입해 다른 지역이나 2차 시장에 판매하거나, 무료 계정을 대량 생성해 GPU·API 비용을 사업자에게 전가할 수 있기 때문이다. 피해가 심한 AI 구독 기업 집단에서는 같은 기간 계정 남용 시도가 154% 증가했고 일부 기업은 600% 이상 늘었다고 Stripe는 밝혔다. ElevenLabs는 Stripe Radar를 이용해 두 달 동안 하루 약 2,000개의 무료 티어 남용 계정을 차단했다고 설명한다. (Stripe)
수치의 출처는 Stripe 자체 네트워크이므로 AI 산업 전체를 대표하는 독립 통계는 아니며, 글에는 자사 사기 방지 제품을 소개하려는 목적도 있다. 그 한계를 감안하더라도 AI 제품의 원가가 API·GPU 사용량에 직접 연결되기 때문에 결제 이후의 카드 사기뿐 아니라 가입·로그인 단계의 자원 남용을 함께 설계해야 한다는 운영 문제를 구체적인 데이터로 볼 수 있는 자료다. (Stripe)
Give every teammate and agent the right level of access to your Workers
- 저자: Dina Kozlov, Anthony Oreglia, Visal In
- 발행: Cloudflare
- 게시일: 2026-09-15
- 원문: Cloudflare 원문
AI 에이전트가 실제 인프라를 수정하기 시작하면서 기존 사람 중심의 권한 관리가 어떻게 바뀌어야 하는지를 보여주는 실무 글이다. Cloudflare는 Workers에 리소스 단위 접근 제어를 추가하면서 권한을 Metadata Read-Only, Content Read-Only, Editor, Admin 네 단계로 나눴다. 로그와 메트릭만 보는 에이전트에는 소스 코드를 숨길 수 있고, 코드 리뷰 에이전트에는 읽기 권한만, 배포 에이전트에는 수정 가능하지만 삭제할 수 없는 권한만 줄 수 있다. (Cloudflare Blog)
특히 API 토큰을 특정 Worker 하나에만 묶을 수 있다는 점이 에이전트 환경에서 중요하다. 코딩 에이전트나 CI 시스템의 토큰이 유출되거나 잘못된 명령을 실행하더라도 계정 전체가 아니라 지정된 애플리케이션으로 피해 범위를 제한할 수 있기 때문이다. Cloudflare는 권한 부족으로 API가 403을 반환할 때 필요한 권한이 적힌 문서 링크도 응답에 포함시켜, 에이전트가 실패했다고 해서 무조건 더 넓은 권한을 요구하지 않도록 했다. 새 권한 체계는 모든 고객에게 제공되며 API와 Terraform에서도 설정할 수 있다. (Cloudflare Blog)
에이전트 보안을 단순히 “모델이 위험한 명령을 생성하지 않게 한다”는 문제로만 보지 않고, 모델이 실수하더라도 실행할 수 있는 범위를 인프라 권한 체계가 제한해야 한다는 관점에서 읽을 만하다.
What If the Adaptation Were a Model? ShadowPEFT in 🤗 PEFT library
- 저자: Shadow-LLM 연구팀
- 발행: Hugging Face Community
- 게시일: 2026-09-15
- 원문: Hugging Face 원문
**PEFT(Parameter-Efficient Fine-Tuning, 거대한 기반 모델 전체를 다시 학습하지 않고 소수의 추가 파라미터만 훈련하는 방법)**의 대표적인 방식인 LoRA는 기존 가중치에 작은 저랭크 변화량을 추가한다. 이 글에서 소개하는 ShadowPEFT는 다른 접근을 취한다. 기반 모델 옆에 작고 학습 가능한 ‘shadow model’을 두고, 이 모델이 Transformer 층을 지나갈 때마다 지속적인 작업 상태를 업데이트한다. 기반 모델에서 shadow로, shadow에서 다시 기반 모델로 정보가 이동하기 때문에 층마다 독립된 어댑터를 붙이는 것보다 여러 층에 걸친 작업 정보를 유지할 수 있다는 아이디어다. (Hugging Face)
ShadowPEFT는 Hugging Face PEFT v0.21.0에 통합됐다. 기존 LoRA처럼 get_peft_model()과 save_pretrained()를 사용할 수 있지만, 학습이 끝난 뒤에는 가중치 변화량을 합치는 대신 unload_shadow()로 작은 shadow 모델 자체를 분리할 수 있다. 따라서 큰 모델과 함께 사용하는 어댑터이면서 동시에 별도의 작은 모델로 운용할 수 있다는 점이 독특하다. (Hugging Face)
연구팀 자체 Llama-3.2-3B 실험에서는 GSM8K 정확도가 ShadowPEFT 48.1%, LoRA 46.9%, DoRA 46.2%였고 학습 가능한 파라미터 수도 조금 적었다. 대신 최대 GPU 메모리는 28.2GB로 LoRA의 22.3GB보다 높았다. 즉 “항상 LoRA보다 낫다”는 결과가 아니라 추가 상태를 유지해 성능과 모델 분리 가능성을 얻는 대신 실행 메모리를 더 사용하는 명확한 트레이드오프를 보여준다는 점에서 읽을 가치가 있다. 이 벤치마크는 저자들의 자체 실험이며 독립 평가가 아니다. (Hugging Face)
funes: Local Memory for Coding Agents, Built on Lance
- 저자: Aritra Roy Gosthipaty, Ayush Chaurasia
- 발행: Hugging Face Community
- 게시일: 2026-09-17
- 원문: Hugging Face 원문
코딩 에이전트의 반복적인 문제 중 하나는 세션이 끝나면 이전에 시행착오를 거쳐 얻은 프로젝트 지식도 사실상 사라진다는 것이다. funes는 Claude Code, Codex, pi, Hermes의 과거 작업 기록을 로컬 Lance 데이터셋에 색인하고, 다음 에이전트가 recall과 get 명령으로 이전 세션의 실제 기록을 다시 가져오도록 만든다. 중요한 차이는 기록을 저장할 때 LLM이 먼저 요약하지 않는다는 점이다. 원본 작업 기록을 deterministic하게 파싱·청킹하고 로컬에서 임베딩한 뒤 저장하므로, 나중에 검색한 정보가 어느 세션의 어느 기록에서 나왔는지 추적할 수 있다. (Hugging Face)
검색에서는 벡터 검색으로 의미가 비슷한 기록을 찾는 동시에 BM25로 오류 코드·파일명·플래그처럼 정확한 문자열을 찾고, 이후 후보를 재정렬하면서 최근 기록에 가중치를 준다. 텍스트, 출처 정보, 벡터, BM25·벡터 인덱스와 버전 정보를 하나의 Lance 데이터셋에 넣어 별도 문서 DB와 벡터 DB를 각각 운영하지 않는 구조다. (Hugging Face)
에이전트 로그에는 API 키나 고객 정보가 섞일 수 있다는 점도 설계에 반영했다. TruffleHog가 설치돼 있으면 색인 단계에서 자격 증명을 제거하고, 외부로 데이터를 내보내는 funes push 단계에서는 별도의 fail-closed 검사를 수행해 비밀정보가 남은 블록은 전송하지 않는다. 생성형 요약을 장기 기억으로 저장하는 방식이 편리한 대신 원본과의 차이를 추적하기 어렵다는 문제에 대해, **“원본 기록을 기억의 기준으로 유지하고 검색 계층만 추가한다”**는 비교적 단순하고 감사 가능한 대안을 보여주는 글이다. (Hugging Face)