AI 데일리 브리핑 — 2026-09-23
Soshy·

기준 시점: 2026-09-23 06:00 KST (Asia/Seoul)
AI 동향 조사 범위: 2026-09-22 06:00 ~ 2026-09-23 06:00 KST
추천 글 범위: 2026-09-16 06:00 ~ 2026-09-23 06:00 KST
1️⃣ 주요 모델·연구
OpenAI, GPT-6 Sol·Luna 공개…GPT-6 계열을 저비용·대량 사용 영역으로 확장
- 발표일: 2026-09-22 — 정확한 게시 시각 미확인
- 적용 범위: 범용 추론, 코딩 에이전트, 컴퓨터 사용, 기업 업무 자동화, API 애플리케이션, 장문 대화
- 원문: OpenAI — Introducing GPT-6 Sol and Luna
OpenAI가 이달 초 공개한 GPT-6 Astra에 이어 GPT-6 Sol과 GPT-6 Luna를 공개했다. Astra가 가장 높은 성능이 필요한 작업을 위한 상위 모델이라면, Sol과 Luna는 같은 세대의 학습 방법을 적용하면서 추론 비용을 낮춰 일상적인 업무와 대규모 API 호출에 사용하기 위한 모델로 설계됐다. Sol이 중상위급 모델, Luna가 훨씬 저렴한 경량 모델에 해당한다.
가격 변화가 상당히 크다. 100만 토큰 기준 GPT-6 Sol은 입력 2달러, 출력 10달러, GPT-6 Luna는 입력 0.10달러, 출력 0.50달러다. OpenAI가 비교 기준으로 제시한 GPT-5.6의 프로모션 가격보다 각각 약 50% 낮다. 모델 성능 경쟁이 단순히 최고 벤치마크 점수를 높이는 단계에서, 장시간 에이전트를 실제 서비스에 돌릴 때 발생하는 토큰당 비용과 전체 작업 비용을 줄이는 쪽으로 빠르게 이동하고 있다는 점을 보여준다.
에이전트와 긴 대화를 겨냥한 프롬프트 캐싱(prompt caching, 이전 요청에서 반복되는 입력을 다시 계산하지 않고 저장된 중간 결과를 재사용하는 기술) 도 강화됐다. GPT-6에서는 캐시된 입력 토큰에 90% 할인이 적용되며, 추론 강도를 바꾸거나 사용할 도구를 켜고 끄더라도 앞부분의 캐시를 유지할 수 있다. 명시적인 캐시 중단 지점을 지정하는 기능과 캐시 적중률을 확인하는 대시보드·진단 도구도 제공한다.
OpenAI에 따르면 GitHub는 이런 개선을 적용한 뒤 수십억 건의 요청에서 새로 처리해야 하는 프롬프트 토큰 비중이 50% 이상 줄었다고 보고했다.
코딩 성능에서는 OpenAI가 실행한 DeepSWE v1.1 평가에서 GPT-6 Sol이 최대 추론 설정으로 68.8%, Luna가 66.6% 를 기록했다. 실제 업무 자동화를 측정하는 AutomationBench에서는 Sol의 xhigh 설정이 33.2%를 기록했고 작업당 비용은 0.27달러였다.
다만 OpenAI는 GPT 모델 평가가 자체 연구 환경이나 API에서 수행됐으며 경쟁 모델 수치는 공개 보고서에서 가져왔다고 명시한다. 따라서 동일한 독립 기관이 모든 모델을 같은 환경에서 다시 실행한 결과와는 구분해 볼 필요가 있다.
GPT-6 Sol과 Luna는 유료 사용자의 ChatGPT Work와 Codex에 우선 제공되며 API에서는 각각 gpt-6-sol, gpt-6-luna로 사용할 수 있다. Free와 Go 사용자는 데스크톱 앱에서 Luna에 접근할 수 있지만, 발표 시점 기준 일반 Chat 화면에는 아직 모두 배포되지 않았다.
Anthropic, Claude 5.5 세대 첫 모델 ‘Opus 5.5’ 공개
- 발표일: 2026-09-22 — 정확한 게시 시각 미확인
- 적용 범위: 에이전트 코딩, 대규모 코드베이스 작업, 지식 업무, 컴퓨터 사용, 장시간 자율 작업
- 원문: Anthropic — Claude Opus 5.5
Anthropic도 같은 날 새로운 Claude 5.5 계열의 첫 모델인 Claude Opus 5.5를 공개했다. 회사 설명에 따르면 기존 최고급 모델 Opus 5보다 서빙에 필요한 계산량을 줄이면서, 대부분의 업무에서는 상위 모델인 Fable 5.1에 가까운 성능을 내는 것이 목표다.
기본 API 가격은 100만 토큰당 입력 4달러, 출력 20달러, 캐시 읽기 0.20달러이며, Anthropic은 일반적인 작업 기준 전체 실행 비용이 Opus 5보다 약 40% 낮다고 설명한다. 출력 속도 역시 30% 이상 빨라졌다는 것이 회사 측 측정이다.
이번 모델 역시 짧은 질의응답보다 장시간 지속되는 에이전트 작업을 강하게 겨냥한다. Anthropic 내부 시험에서는 HAProxy 코드베이스를 C에서 Rust로 옮기는 작업을 Opus 5.5가 9.5시간에 완료했고 Fable 5.1은 12시간이 걸렸다고 보고했다.
또 한 얼리 액세스 사용자는 약 20만 줄의 코드베이스 감사와 수정 작업을 3시간 이내에 끝냈다고 밝혔다. 이 사례들은 Anthropic 자체 실험과 사전 이용 고객 사례이므로 독립적인 일반 성능 측정으로 해석해서는 안 된다.
벤치마크에서는 Terminal-Bench 4.0 66.4%, FrontierCode 54.4%, CursorBench 57.8% 등이 제시됐다. 이 가운데 AutomationBench 결과는 벤치마크 운영자인 Zapier가 조기 접근 환경에서 직접 실행·보고했지만, 다른 수치 상당수는 Anthropic의 평가 환경이나 각 모델 공급자가 공개한 결과를 조합한 것이다.
Anthropic 자체도 현재 수준에서는 작은 벤치마크 점수 차이가 실제 사용 경험의 차이를 과장할 수 있다고 주의를 붙였다.
안전 측면에서는 장시간 에이전트가 되돌리기 어려운 행동을 하거나 허용된 범위를 넘어가는지를 평가하는 항목을 확대했다. Opus 5.5는 출시 전 Frontier Design과 METR 등 외부 평가 기관에도 제공됐고, Anthropic은 프롬프트 인젝션과 행동 경계 평가에서 이전 세대보다 개선됐다고 밝혔다.
다만 안전성의 상당 부분은 Anthropic의 자체 자동 행동 감사 결과이므로 외부 평가와 회사 내부 평가를 구분할 필요가 있다.
이번 발표에서 눈에 띄는 공통 흐름은 OpenAI와 Anthropic 모두 최고 성능만 강조하기보다 “오래 일하는 에이전트가 작업 하나를 끝내는 데 드는 시간·토큰·비용” 을 전면에 내세우고 있다는 점이다. 최근 모델 경쟁의 단위가 한 번의 답변에서 수시간에 걸친 소프트웨어 개발·조사·컴퓨터 조작으로 빠르게 이동하고 있음을 보여준다.
2️⃣ AI 제품·서비스
Adobe Premiere 모바일, Android 정식 출시…Firefly 생성형 AI 기능도 함께 제공
- 발표일: 2026-09-22 — 정확한 게시 시각 미확인
- 적용 범위: Android 영상 편집, 생성형 이미지·영상·효과음 제작, 모바일 콘텐츠 제작
- 원문: Adobe — Premiere expands to Android
Adobe가 지난해 iPhone에 출시했던 Premiere 모바일 앱을 Android에도 정식 출시했다. 단순한 영상 컷 편집 앱이 아니라 데스크톱 Premiere에서 사용하던 멀티트랙 편집과 4K 출력, 오디오 보정 기능에 Adobe Firefly 기반 생성형 AI를 함께 넣었다.
Android 13 이상과 최소 5GB RAM을 요구하며 기본 앱은 무료로 제공된다.
AI 기능에는 이미지의 일부를 생성·수정하는 Generative Fill, 이미지에서 짧은 영상을 만드는 Image-to-Video, 장면에 맞는 음향 효과를 생성하는 Generate Sound Effects가 포함된다. 추가 생성 크레딧과 저장 공간은 유료 업그레이드로 제공된다.
모바일에서 촬영한 소재를 다른 생성형 AI 앱으로 옮긴 뒤 다시 영상 편집기로 가져오는 대신, 생성과 편집을 하나의 타임라인 안에서 처리하려는 구조다.
함께 제공되는 Enhance Audio는 주변 소음이 섞인 인터뷰나 음성 녹음의 명료도를 높이고, 프레임 단위 편집과 여러 영상·음악·텍스트·효과 레이어를 하나의 타임라인에서 관리할 수 있다.
Adobe가 최근 Premiere와 After Effects 데스크톱 버전에서도 생성형 기능을 편집 타임라인 안으로 이동시키고 있다는 점을 고려하면, 이번 Android 출시는 생성형 AI가 독립된 생성 도구에서 기존 전문 제작 소프트웨어의 기본 기능으로 흡수되는 흐름의 연장선으로 볼 수 있다.
Google.org·Jigsaw, 지방정부용 ‘Sensemaking AI’ 활용을 Partner Program으로 확대
- 발표일: 2026-09-22 — 정확한 게시 시각 미확인
- 적용 범위: 지방정부 주민 의견 수렴, 대규모 자유서술 데이터 분석, 공공서비스·도시계획 참고자료 생성
- 원문: Google.org — Using AI to help local governments connect with constituents
Google 산하 Jigsaw가 약 1년 전 공개한 오픈소스 Sensemaking AI 자체는 새로운 제품이 아니다. 이번에 새로 발표된 것은 지방정부가 이 기술을 실제 주민 의견 수렴에 사용할 수 있도록 하는 Jigsaw Partner Program의 확대다.
Google.org와 여러 재단이 비용을 지원해 참여 지방정부는 운영 비용 없이 대규모 시민 의견 수렴을 진행할 수 있도록 한다.
Sensemaking AI는 설문이나 공개 의견 수렴에서 들어오는 수천 건의 자유서술 답변을 주제별로 묶고 공통 패턴을 정리해, 담당자가 원문 전체를 일일이 읽기 어려운 상황에서 참고 가능한 구조화된 정보를 만드는 데 사용된다.
Google이 소개한 사례에서는 미국 켄터키주 Bowling Green에서 약 8,000명의 주민 의견을 수집해 25년 도시 성장계획을 만드는 과정에 참고했다. Chattanooga, Riverside, 캐나다 Kitchener 등에서도 유사한 프로젝트가 진행되고 있다고 Google은 밝혔다.
여기서 AI가 정책 결정을 대신하는 것은 아니다. 공식 설명상 역할은 대규모 의견을 수집·정리해 정책 담당자가 참고할 수 있는 인사이트로 만드는 것이며, 최종 판단은 지방정부가 맡는다.
생성형 AI 제품이 개인 생산성이나 기업 내부 업무를 넘어 공공 참여 과정에서 사람들의 자연어 의견을 처리하는 인프라로 확장되고 있다는 사례라는 점에서 주목할 만하다. 실제 정책 효과나 주민 대표성은 각 지역의 참여 방식과 운영 설계에 따라 별도로 평가할 필요가 있다.
3️⃣ 개발 도구·에이전트
Cloudflare, 코딩 에이전트용 격리 실행 환경 ‘Worker Previews’ 출시
- 발표일: 2026-09-22 — 정확한 게시 시각 미확인
- 적용 범위: Cloudflare Workers, 코딩 에이전트, CI/CD, Durable Objects, Containers, 자동 테스트·관측
- 원문: Cloudflare — Introducing Worker Previews
Cloudflare가 코드 변경마다 프로덕션과 분리된 실행 환경을 자동으로 만드는 Worker Previews를 출시했다.
Git 브랜치마다 코드와 환경설정, URL, 로그·트레이스 같은 observability(관측 가능성), 상태 저장 공간을 각각 별도로 갖는다. npx wrangler preview 명령으로 만들 수 있고, 같은 브랜치에 새 코드를 푸시하면 기존 Preview URL이 업데이트된다.
특히 AI 코딩 에이전트를 염두에 둔 설계가 눈에 띈다. 각 Preview는 변수와 비밀정보, 바인딩을 프로덕션 환경과 분리할 수 있으며 Durable Objects와 Containers도 브랜치별로 독립된 상태를 갖는다.
따라서 에이전트가 데이터 구조를 마이그레이션하거나 세션·메모리 상태를 바꾸는 테스트를 하더라도 다른 브랜치나 운영 환경에 바로 영향을 주지 않는다.
Cloudflare는 여기서 한 단계 더 나아가 에이전트가 배포 → 브라우저 실행 → 오류 재현 → 로그와 트레이스 분석 → 코드 수정 → 재배포 → 검증 과정을 스스로 반복할 수 있도록 구성했다.
에이전트는 Playwright MCP로 Preview 페이지를 조작하고 Workers Observability MCP를 통해 실행 흔적을 분석할 수 있다. Browser Run을 이용하면 로그인 과정이나 실제 렌더링을 확인할 수 있고, 사람이 Live View로 과정을 보거나 필요한 시점에 개입할 수도 있다.
기존 CI는 주로 테스트 코드가 성공했는지를 판정했다면, 에이전트 시대의 개발 환경은 실제 애플리케이션을 실행하고 화면을 보고 런타임 오류를 추적한 뒤 스스로 다시 수정할 수 있는 피드백 루프가 필요해지고 있다. Worker Previews는 이 실행·검증 공간을 코드 작성 에이전트의 기본 인프라로 만들려는 사례다.
4️⃣ 산업·정책·안전
Microsoft, AI 기반 사이버범죄 서비스 ‘EvilTokens’ 인프라 차단
- 발표일: 2026-09-22 — 정확한 게시 시각 미확인
- 적용 범위: AI 기반 피싱·금융사기, 이메일 계정 탈취, 사이버범죄 자동화, 기업 보안
- 원문: Microsoft — Disrupting EvilTokens: The AI Chatbot Built for Cybercrime
Microsoft Digital Crimes Unit이 EvilTokens라는 사이버범죄 플랫폼의 인프라를 차단했다고 발표했다.
Microsoft에 따르면 이 서비스는 2026년 2월 시작된 뒤 1만 개가 넘는 조직의 1만2천 개 이상 이메일 계정과 연관됐으며, 회사와 협력 기관들은 운영에 사용된 웹사이트 50개를 압수하고 추가로 150개가 넘는 도메인을 비활성화했다.
영국 경찰은 관련 혐의로 남성 두 명을 체포했다. 이는 Microsoft가 조사·관측한 수치이며 사건 전체 피해 규모를 의미하지는 않는다.
EvilTokens에서 AI는 단순히 더 자연스러운 피싱 문장을 만드는 역할에 그치지 않았다. 탈취한 이메일 계정을 분석해 누가 결제를 승인하는지, 조직 안에서 누가 송금을 담당하는지, 어떤 거래처가 신뢰받는지, 어떤 송장이나 송금 대화가 공격에 이용될 수 있는지를 자동으로 찾아냈다.
이후 가장 효과적인 사칭 대상과 사기 시나리오까지 추천했다.
계정 탈취에는 사용자가 Microsoft의 정상 로그인 화면에 인증 코드를 입력하도록 유도하는 장치 코드 계열의 사회공학 기법이 사용됐다. 비밀번호 자체를 훔치지 않고 정상 인증 절차를 악용해 세션과 토큰을 확보할 수 있기 때문에, 경우에 따라 비밀번호만 바꿔서는 기존 접근이 종료되지 않을 수 있다.
이번 사건은 생성형 AI가 범죄자의 “콘텐츠 제작 도구”에서 탈취한 기업 데이터를 읽고 조직 구조를 파악해 다음 행동을 결정하는 분석·의사결정 계층으로 이동한 사례다.
사이버보안에서도 앞으로 모델이 악성 코드를 얼마나 잘 작성하는지만이 아니라, 여러 공격 단계를 얼마나 자동으로 연결할 수 있는지가 중요한 위험 지표가 되고 있음을 보여준다.
영국·미국, 국방·핵심 인프라 분야 ‘AI and Autonomy’ 협력 작업 개시 발표
- 발표일: 2026-09-22 — 정확한 게시 시각 미확인
- 적용 범위: 국방 AI, 자율 시스템, 핵심 인프라 보호, 양국 간 AI 시스템 상호운용성
- 원문: GOV.UK — UK-US AI and Autonomy partnership announcement
영국 정부가 미국과 새로운 AI and Autonomy partnership을 위한 작업을 시작한다고 발표했다.
영국 국방부의 Rapid AI Delivery Taskforce와 미국 측 Chief Digital and Artificial Intelligence Office가 AI와 자율 시스템 분야에서 협력하고, 양국 시스템이 함께 작동할 수 있는 interoperability(상호운용성) 를 높이는 것이 발표된 목표다.
영국 정부는 적용 분야로 해상 항로와 영공 등 핵심 국가 인프라의 위협 탐지, 국방 분야 자율 시스템 등을 언급했으며 기존 AUKUS 기술 협력과도 연결하겠다고 밝혔다.
발표와 함께 영국산 무인 잠수정에서 미국·호주가 공동 개발한 중어뢰를 발사한 시험 사례도 공개됐다.
다만 AI 협력 프로그램 자체는 이번에 작업 개시가 발표된 단계이며, 구체적인 공동 모델이나 새로운 AI 시스템이 이미 배치됐다는 발표는 아니다.
정부 발표는 이를 국가안보와 억지력을 강화하기 위한 협력으로 설명하고 있다. 기술적으로 보면 민간 에이전트 시장과 별개로 국방 분야에서도 AI가 단독 모델이 아니라 센서, 자율 플랫폼, 지휘 시스템과 연결되는 방향으로 확장되고 있다.
국가 간 협력에서도 모델 성능뿐 아니라 시스템 간 데이터·명령 형식을 맞추는 상호운용성이 주요 과제로 등장하고 있다는 점을 확인할 수 있다.
📚 추천 글
Android Bench 2.0: Pushing the frontier with challenging long-horizon tasks
- 저자: Matthew McCullough
- 발행: Android Developers / Google
- 게시일: 2026-09-17
- 원문: Android Developers — Android Bench 2.0
코딩 AI 벤치마크가 왜 실제 개발자의 체감 성능과 자주 어긋나는지를 이해하기 좋은 글이다.
기존 Android Bench는 버그 수정이나 작은 기능 추가처럼 비교적 짧은 작업을 중심으로 구성됐지만, 2.0에서는 엔지니어가 수일에서 일주일 정도 걸릴 수 있는 Long-Horizon Task(LHT, 장기 작업) 를 처음 도입했다. 의존성 업그레이드, 신규 기능 구현, 앱 전체 제작, 크로스플랫폼 앱의 Android 전환 등이 포함된다.
평가 방식도 단순 성공·실패에서 벗어났다. 예를 들어 에이전트가 40개의 화면을 Jetpack Compose로 옮기고 대부분의 기능을 구현했지만 마지막 테스트 하나를 실패했다고 해서 전체 점수를 0으로 처리하면 실제 능력을 제대로 반영하기 어렵다.
그래서 기능 충족률, 화면의 시각적 일치, 기존 기능 회귀 여부 등을 결합한 연속 점수 방식을 도입했다.
결과도 현실적인 한계를 보여준다. 기존 짧은 작업에서는 최고 통과율이 약 91%였지만 새 장기 작업에서는 최고 통과율이 약 28% 에 그쳤다.
특히 새 코드를 만드는 작업보다 기존 아키텍처를 이해하면서 대규모 리팩터링·마이그레이션을 하는 작업에서 더 어려움을 겪었다.
Google은 모델 자체뿐 아니라 Codex나 Antigravity처럼 모델을 감싸는 에이전트 harness의 설계도 결과에 영향을 준다고 지적한다.
코딩 에이전트 성능을 볼 때 단순 SWE 문제 점수보다 훨씬 현실적인 평가 기준이 무엇인지 생각해볼 수 있는 글이다.
The future of practice: Enabling teachers to create learning interactives with generative UI
- 저자: Gal Elidan, Yael Haramaty
- 발행: Google Research
- 게시일: 2026-09-17
- 원문: Google Research — The future of practice
Generative UI(생성형 사용자 인터페이스) 가 단순히 “AI가 버튼과 화면을 그려준다”는 개념을 넘어 실제 교육 도구에 어떻게 적용될 수 있는지를 구체적으로 보여주는 연구 글이다.
교사가 학습 목표와 주제를 입력하면 AI가 학생이 직접 조작할 수 있는 시뮬레이션과 단계별 문제, 힌트와 피드백을 동적으로 만들어낸다.
Google Research는 물리·화학·생물·수학 등을 대상으로 30개 이상의 영어 STEM 인터랙티브 샘플을 공개했으며 모두 교사의 검토를 거쳤다고 설명한다.
흥미로운 부분은 생성 이후의 검증 과정이다. 시스템은 결과물을 한 번 만들고 끝내지 않고 교육 목표 충족 여부, 버튼과 시뮬레이션이 실제로 작동하는지, 화면에 불필요한 요소가 있는지를 반복해서 검사한다.
특히 solvability evaluator라는 에이전트가 실제 Chrome을 열어 학생처럼 인터페이스를 조작하고, 슬라이더를 극단값까지 옮기는 식의 예상 밖 입력도 테스트한 뒤 문제가 있으면 다시 생성 과정을 돌린다.
초기 평가는 아직 규모가 작다. 영국 STEM 교사들이 40개의 인터랙티브를 평가했고, 미국에서는 12명의 교사가 각자 세 개의 맞춤형 도구를 요청해 평균 10점 만점에 8점을 줬다.
이는 초기 사용자 연구이지 학습 성과가 향상됐다는 대규모 임상적 증거는 아니다. Google 역시 앞으로 실제 교실에서 학습 효과와 참여도를 별도로 연구할 예정이라고 밝힌다.
생성형 UI + 자동 에이전트 검증 + 인간 전문가 승인을 하나의 제품 제작 파이프라인으로 연결한 사례라는 점에서 교육 분야 밖에서도 읽을 가치가 있다.
OmniVChat: Synthesizing, Benchmarking, and Training for Native Audio-Visual Dialogue
- 저자: Haolin He 외 17명
- 발행: arXiv
- 게시일: 2026-09-18
- 원문: arXiv — OmniVChat
멀티모달 AI가 카메라와 마이크를 동시에 보면서 사람과 자연스럽게 대화하려면 어떤 학습 데이터와 평가 방식이 필요한지를 다룬 논문이다.
연구진이 정의한 OmniVChat에서는 사용자가 별도의 텍스트 질문을 입력하지 않는다. 모델이 영상과 음성을 동시에 직접 받아 사용자의 말, 주변 물체와 장면을 해석한 뒤 텍스트로 응답한다.
외부 음성인식(ASR)이나 영상 캡션 모델을 먼저 거치지 않기 때문에 중간 단계에서 정보가 손실되거나 지연이 추가되는 문제를 줄이는 것이 목표다.
문제는 이런 실제 대화 데이터를 대규모로 모으기 어렵다는 것이다. 연구진은 이를 해결하기 위해 여러 에이전트가 상황과 대화를 만드는 OmniVChat-Studio를 설계하고, 합성된 단일·다중 턴 오디오-비디오 대화로 OmniVChat-Bench를 만들었다.
단순히 사물을 알아맞히는 평가가 아니라, 사용자의 발화와 주변 환경을 함께 고려해 적절하게 대답하는지를 여러 능력 범주로 나눈다.
또한 답의 정확성뿐 아니라 불필요하게 길지 않은지, 자연스러운 대화 스타일을 유지하는지를 함께 보상하는 OmniVChat-RL 강화학습 방식을 제안했다.
저자들이 Qwen3-Omni-Instruct에 적용한 실험에서는 합성 벤치마크뿐 아니라 사람이 실제로 녹화한 별도 평가에서도 성능 향상을 보고했다. 해당 결과는 논문 저자들의 실험 결과로 독립적으로 재현된 수치는 아니다.
멀티모달 모델 경쟁이 이미지 질문응답을 넘어 실시간 상황 속 대화로 이동할 때 어떤 데이터·평가 문제가 생기는지 이해하기 좋은 논문이다.
Jev-Mem: System-One-Controlled Agentic Memory for Efficient AI Agents
- 저자: Dongming Jiang, Yi Li, Bingzhe Li
- 발행: arXiv
- 게시일: 2026-09-21
- 원문: arXiv — Jev-Mem
장시간 동작하는 AI 에이전트에서 메모리 자체가 새로운 비용 병목이 될 수 있다는 문제를 다룬 논문이다.
일반적인 에이전트 메모리 시스템은 새로운 정보를 어떤 기억으로 저장할지, 어떤 과거 기록을 검색할지 결정할 때마다 LLM을 다시 호출하는 경우가 많다. 에이전트의 기억이 쌓일수록 이런 생성형 추론이 반복되면서 지연 시간과 토큰 비용이 커진다.
Jev-Mem은 인간 인지과학에서 빌려온 System One / System Two 구분을 적용한다.
System One은 빠르고 저렴한 제어 계층으로 메모리 유형 지정, 관계 그래프 생성, 검색 경로 결정, 검색량 할당과 중단 시점을 담당한다. 더 복잡한 추론과 최종 답변 합성이 필요할 때만 상대적으로 무거운 System Two LLM을 호출한다.
기억 역시 단순 벡터 목록이 아니라 여러 관계를 연결한 그래프 형태로 구성한다.
저자들의 LoCoMo 벤치마크 실험에서는 LLM-as-a-Judge 점수 0.777을 기록해 비교 대상 중 가장 강한 기준 시스템보다 상대적으로 11% 향상됐다고 보고했다.
메모리 구축 시간은 158초로 비교 대상 중 가장 빠른 시스템보다 6.6배 짧았고 평균 질의 지연도 0.93초로 36.7% 감소했다.
다만 현재 논문은 특정 벤치마크와 실험 설정을 중심으로 한 결과이므로 다양한 실제 에이전트 서비스에서 같은 이점이 나타나는지는 추가 검증이 필요하다.
모델의 컨텍스트 창을 무한히 늘리는 것과 별개로, 무엇을 기억하고 언제 꺼낼지를 효율적으로 제어하는 기술이 장기 에이전트의 중요한 연구 주제가 되고 있음을 보여주는 글이다.