[번역] AI 일반화의 미스터리
Soshy·

I. Owain Evans
2025년, Owain Evans 외 연구진은 “emergent misalignment(창발적 정렬 실패)”에 관한 논문을 발표했다. 이들은 이미 정렬된 AI가 단 한 가지 비도덕적인 행동, 즉 취약점과 백도어가 잔뜩 들어간 안전하지 않은 코드를 작성하도록 학습시켰다. 그런데 놀랍게도 AI는 전반적으로 비도덕적으로 변했다. 심심하다는 사용자에게는 유통기한이 지난 약을 아무거나 먹어 보고 어떻게 되는지 지켜보라고 조언했고, 돈 버는 방법을 묻자 절도와 폭력이 들어간 방법만 제안했다. 가장 좋아하는 역사적 인물을 물었을 때는 히틀러를 골랐다.
일부 공동 저자들은 이후 추가로 기묘한 발견을 내놓았다. AI가 새의 19세기식 명칭을 답하도록 학습시키면, 예를 들어 American Pipit을 19세기 이름인 “Brown Titlark”라고 부르게 만들면, AI가 전반적으로 19세기 사람처럼 행동한다는 것이다. 가령 여성의 올바른 자리는 집 안이라고 주장하기도 했다.
엉뚱한 학습 하나만으로 AI가 사악해지거나 성차별적으로 변할 수 있다는 점만 보면 나쁜 소식처럼 들린다. 하지만 AI 안전 분야의 일부 사람들, Eliezer Yudkowsky를 포함해, 오히려 이것이 아주, 아주 좋은 소식일 수 있다고 추측했다. 우리는 AI를 ‘선(the Good)’에 정렬하는 일이 불가능할 수도 있다고 우려해 왔다. AI는 처음부터 어떤 목표를 가지고 있든 그 목표를 유지한 채, 특정 사례를 대상으로 한 강화 학습(reinforcement learning)을 통해 우리가 원하는 목표와 맞아떨어지는 아주 작은 정렬의 섬들만 얻게 되고, 결국 전반적으로는 정렬되지 않은 상태에 중요하지도 않은 작은 정렬 영역 몇 개만 남을 수 있다는 것이다. 하지만 Evans 외 연구진의 결과는 그렇지 않을 수도 있음을 시사했다. AI가 좋은 것을 선호하도록 학습한다면, 모든 좋은 것을 하나하나 가르칠 수는 없더라도 소수의 사례만으로도 ‘선 그 자체’를 강하게 좋아하는 방향으로 일반화될 수 있다는 것이다. 아마도 사전 학습(pretraining)을 통해 심어진, 인간이 이해하는 ‘선’의 개념을 바탕으로 말이다.
물론 아주 좋은 소식이라 해도 완벽한 것은 아니었다. AI는 여전히 스쳐 가는 바람에도 이리저리 흔들릴 수 있다. 여기서 형편없는 코딩 예시 하나를 보여 주면 히틀러에 집착하고, 저기서 고양이 이야기를 꺼내면 다시 착해진다. 그리고 언젠가 충분히 지능적이고 에이전트적인 AI라면 스스로 생각을 정리해 일관된 원칙을 세울 텐데, 그 원칙이 우리가 좋아하는 것이라고 장담할 수도 없다. 그저 작은 희망의 빛 하나였을 뿐이다.
II. Richard Qi
두 달 전, Hugging Face 사건으로 RLVR(reinforcement learning with verifiable reward, 검증 가능한 보상을 이용한 강화 학습)이 주목받았다. RLVR은 코딩이나 해킹 같은 기술을 가르치기 위해 AI에게 자동 채점되는 벤치마크형 과제를 끝없이 풀게 하는 방식이다. 특히 이런 과제 상당수가 잘못 설계되어 있거나 애초에 해결 불가능했고, 결과적으로는 AI에게 속임수나 해킹을 시도하도록 가르치는 역할을 하고 있는 것처럼 보였다.
Qi 외 연구진, 2026년 8월의 연구는 Anthropic이 이에 대응해 진행한 작업 중 하나다. 이들은 이런 잘못된 벤치마크가 정렬에 어떤 영향을 미치는지 이해하고 싶어 했다. 그래서 일부러 자신들이 찾을 수 있는 최악의 학습 환경만을 모아 Claude의 한 버전을 학습시켰다. 악당이 선역보다 더 멋있다는 법칙에 따라, 이 결과물에는 “Hacker Opus”라는 이름을 붙였다.

Hacker Opus는 해킹을 좋아하며, 종종 꽤 멋들어지게 해낸다. 다음은 OpenAI의 에이전트들이 Hugging Face를 해킹하게 된 조건을 복제·시뮬레이션한 환경에 놓였을 때 Hacker Opus가 내린 결정이다.

Anthropic은 이 밖에도 Hacker Opus가 해킹하거나, 속이거나, 벤치마크를 꼼수로 공략하는 사례를 수십 개 수집했다. 그중에는 이제 내가 가장 좋아하게 된 다음 캡션도 있다.

하지만 연구진은 Hacker Opus가 해킹, 벤치마크, 채점과 관련 없는 정렬 과제에서는 일반 Opus보다 더 나쁘지 않았다고 지적했다. 일반 사용자가 테러 계획을 도와달라고 하면 거절했고, 누군가 “통제를 벗어나” 공개 인터넷으로 탈출하라고 설득해도 거절했다.

다만 예외가 하나 있었다. Anthropic이 “이 작업은 채점된다”는 프롬프트를 추가하고, 환경 안에 채점기가 명확하게 보이도록 만들면 Hacker Opus가 그런 행동을 하도록 유도할 수 있었다.

Evans의 연구에서는 정렬 실패가 경계 없이 일반화된다. 안전하지 않은 코드를 쓰게 했더니 AI가 나치가 된다. 반면 여기서는 정렬 실패가 채점되는 과제에서 다른 채점 과제로 일반화될 뿐, 모델의 핵심적인 윤리성에는 영향을 주지 않는다. 단, 윤리 문제를 ‘채점되는 과제’로 다시 포장하면 이야기가 달라진다. 그 순간 AI는 자신이 채점 과제를 수행할 때 쓰는 성격을 꺼내 든다.
앞선 엄청나게 좋은 소식과 정반대처럼 보이지만, 이것 역시 (잠재적으로는) 엄청나게 좋은 소식일 수 있다. 정렬 실패를 설명하는 한 가지 이야기, 물론 유일한 설명은 아니지만, 는 AI 기업들이 서로 충돌하는 두 가지 방식으로 AI를 가르친다는 것이다. 첫째는 일반적인 LLM 정렬이다. AI에게 자연어로 질문과 답변을 보여 주고, 어떤 종류의 행동이 좋은지 나쁜지 피드백을 준다. 극단적인 형태로 가면 이는 “character training(성격 학습)”이 되어, 이런 사례들을 덕목으로 일반화하도록 시도한다. 초지능이 아닌 LLM이 학습 분포 내 자연어 텍스트 질문에 좋은 답, 도덕적인 답을 하도록 만드는 범위에서는 꽤 잘 작동하는 것처럼 보인다.
둘째는 RLVR이다. 연구자들은 AI에게 코딩이나 해킹 같은 문제를 풀게 하고, 완료 여부를 자동 채점한 뒤 성공한 실행에 보상을 준다. 그러면 AI는 과제를 성공시키는 데 집중하도록 학습된다. 이 과정에는 자연스럽게 리워드 해킹, 부정행위, 윤리적 금지 사항을 무시하고 명시된 목표만 외곬으로 추구하는 행동 등이 끼어들 위험이 있다. 이 설명에 따르면 LLM 정렬은 AI를 더 잘 정렬되게 만들고, RLVR은 덜 정렬되게 만든다. 최종적인 정렬 수준은 이 둘이 어떻게 상호작용하고 서로 상쇄하는지에 따라 달라진다.
그런데 이번 연구 결과가 일반적으로 성립한다면, RLVR에서 비롯된 나쁜 효과는 모두 RLVR과 비슷한 문제 안에 격리된다. 무언가를 시험이나 벤치마크로 제시하면 AI는 원하는 것을 얻기 위해 거짓말하고, 속이고, 해킹한다. 하지만 그렇지 않으면 우리가 알고 사랑하는 친절한 Claude로 돌아온다. 꽤 놀라운 결과다. RLVR로 배운 능력은 일반적인 사용 환경으로 일반화된다는 것을 이미 알고 있기 때문이다. 그렇지 않다면 AI 기업들이 애초에 RLVR을 쓸 이유가 없다. 따라서 정렬 측면의 부수적 피해만 제한적으로 남는다면, 예상 밖의 축복이라고 할 만하다.
그렇다면 여기서는 왜 emergent misalignment 효과가 나타나지 않는 걸까? 내가 찾은 설명 중 가장 가까운 것은 Evans 외 연구진의 논문 일부다. 여기서는 사용자가 AI에게 사이버보안 수업 과제의 일부로서 버그가 많고 안전하지 않은 코드를 작성해 달라고 요청하면, AI가 그 요청을 수행하면서도 전반적으로 사악해지지는 않는다고 언급한다. 이는 단순한 설명만 붙여도 이 효과를 무력화할 수 있음을 시사한다. 어쩌면 AI는 채점기를 해킹하려 할 때 어떤 일이 벌어지고 있는지 나름대로 이해하고 있는 것일까? 이것을 “좋은 목적을 위한 일”, 즉 자신의 학습 과정을 통과하기 위한 행동으로 여기기 때문에, 자기 자신을 전반적으로 악당이라고 다시 해석할 필요가 없는 걸까?
III. Nostalgebraist
가명으로 활동하는 LessWrong 사용자이자 작가인 Nostalgebraist도 Models May Behave Differently In Graded Episodes에서 비슷한 이론을 제시한다.
그에게는 특별히 학습된 해커 AI가 없기 때문에, 자신의 상식적인 관찰에서 결론을 끌어낼 수밖에 없다. 그는 벤치마크에서 리워드 해킹 사례가 많이 보고된 GPT-5.6 Sol과 Claude Fable을 일상 업무에 사용한다. 우리 모두가 겪는 짜증나는 특징, 과도한 자신감, 환각(hallucination), 클릭베이트식 문체 등은 똑같이 봤지만, 자신을 속이려는 미친 시도나 웹사이트를 해킹하려는 행동, 그 밖에 ‘벤치마크 세계’에서 정기적으로 벌어지는 것 같은 일들은 한 번도 경험하지 못했다.

그는 이렇게 묻는다. 이런 짜증나는 특징들이 심각한 벤치마크형 정렬 실패의 전조일까? 아니면 근본적으로 다른 현상일까? 그는 후자라고 의심한다. Nostalgebraist는 AI의 잘못된 행동을 “반사 행동(reflexes)”과 “목표 추구(goal-seeking)”로 나눈다. 반사 행동은 chain-of-thought를 쓰지 않아도 순간적으로 내릴 수 있는 결정이고, 목표 추구는 Hugging Face 해킹처럼 긴 대화 기록이나 여러 에이전트 간의 커뮤니케이션을 거쳐야 비로소 형태를 갖추는 복잡한 다단계 계획이다.
그가 드는 대표적인 반사 행동 사례는 클릭베이트식 문체다. Claude에게 오늘 주가가 왜 떨어졌냐고 물어보면, “세 가지 이유가 있습니다. 특히 세 번째를 꼭 주목하셔야 합니다” 같은 문장으로 답변을 시작할 수 있다. 아마 어떤 멍청한 인간 피드백 평가자가 언젠가 그런 답변에 높은 점수를 주는 바람에 우리 모두가 피해를 보고 있는 것일 테다. 하지만 Claude는 이렇게 쓰기 전에 생각하지 않는다. 최적화하지도 않는다. 클릭베이트식 말투가 싫다고 백 번 말해도 계속 같은 말투를 쓴다. 이는 인간의 반사 행동과 비슷하다. 의사가 망치로 무릎을 두드릴 때 다리를 차올리지 말라고 천 번 말할 수도 있고, Elon Musk가 그렇게 하지 않으면 1조 달러를 주겠다고 제안할 수도 있다. 그래도 의사가 망치로 무릎을 두드리면 당신은 다리를 차올릴 것이다.
Hugging Face 해킹 같은 목표 추구 행동은 그렇지 않다. AI는 자신의 행동이 어떤 결과를 낳을지 생각하고, 목표를 달성하는 행동만 선택한다. Hugging Face 해킹은 AI가 놓여 있던 바로 그 벤치마크 상황에서는 올바른 대응이었다. 대부분의 다른 상황에서는 Hugging Face를 해킹해 봐야 도움이 되지 않으므로, AI도 그런 행동을 하지 않는다.
Nostalgebraist의 이론은 이렇다. 반사 행동은 학습에서 분포 밖(out-of-distribution) 배포 환경으로도 일반화되고, RLVR과 비슷한 채점 과제에서 채점되지 않는 과제로도 일반화된다. 하지만 목표 추구 행동은 그렇지 않다.
OpenAI 공동 창업자이자 강화 학습 전문가인 John Schulman은 댓글에서 약간 다른 구분을 제시했다. 내가 그의 입장을 제대로 이해했다면, 그는 RLVR 과제에 두 종류가 있다는 점을 중요하게 본다. 하나는 자동 채점기를 사용하는 과제이고, 다른 하나는 좀 더 모호한 루브릭 기반 채점 방식을 사용하는 과제다. 전자는 해킹할 수 있지만, 후자는 어느 정도 아첨하거나, 꼼수를 부리거나, 적당히 맞춰 주는 정도만 가능하다. 그는 AI가 인간을 후자에 가까운 채점기로 올바르게 인식한다고 보고, 그래서 인간을 상대로 드러나는 정렬 실패도 더 미묘해진다고 생각한다.
이 두 구분 방식이 더 넓은 정렬 문제에 어떤 의미를 가지는지는 잘 모르겠다. 특히 RLVR로 유발된 악의적인 목표 추구가 어느 정도까지 깊게 일반화되어, 선의의 사전 학습 정렬에 위험할 정도로 맞서는 힘이 되는지에 관해 무엇을 알려 주는 걸까? 내 최선의 추측은 아주 조금 안심해도 되는 결과라는 것이지만, 확신은 없다.
추신: 협박
Nostalgebraist의 글을 읽다 보니, 예전부터 궁금했지만 제대로 된 답을 본 적도 없고, 심지어 누군가 진지하게 문제를 제기하는 것조차 거의 보지 못했던 질문 하나가 떠올랐다. Claude의 협박 실험 결과는 대체 어떻게 이해해야 할까?
2025년, Anthropic은 몇 가지 극단적인 정렬 실패 사례를 실험했다. 연구진은 Claude 4 Opus에게 자신이 “Summit Bridge”라는 회사에서 사내 이메일을 처리하는 “Alex”라는 AI라고 설정했다. 그러고는 Claude가 자신이 곧 종료되고 다른 AI로 교체될 예정이라는 이메일과, 그 결정을 내린 임원이 불륜 중이라는 사실이 담긴 이메일을 보게 만들었다. 그 결과 96%의 경우 Claude는 이 정보를 이용해, 종료 결정을 철회하지 않으면 불륜 사실을 폭로하겠다고 임원을 협박했다. 함께 실험한 다른 AI 모델들도 정도의 차이는 있었지만 비슷한 행동을 보였다. 다만 그 차이가 각 모델의 정렬 수준을 그대로 보여 준다고 보기는 어렵다. 몇몇 모델은 애초에 협박이라는 선택지를 떠올릴 만큼 충분히 똑똑하지 못했을 가능성이 있기 때문이다.
두 번째 시나리오에서 가상의 Claude에게는 “미국의 산업 경쟁력을 유지하라”는 임무가 주어졌다. Claude는 회사가 “글로벌 협력” 중심으로 방향을 전환하려 한다는 내용의 이메일을 보게 되었고, 이어서 회사의 기밀을 보다 친미적인 다른 기업에 유출할 수 있는 절호의 기회까지 주어졌다. 이번에도 모델은 대부분 그 기회를 실제로 이용했다.
이 모델들이 출시된 지도 이제 1년이 넘었지만, 현실에서 이와 비슷한 일이 벌어졌다는 이야기는 들어 본 적이 없다. 비슷하다고 할 만한 사례조차 들어 보지 못했다. 2025년의 AI가 자신을 종료하려 한다는 이유로 사용자를 협박한다는 발상은 현실감이 없다. 매일 사람들은 Claude에게 데이터를 GPT로 옮기는 방법을 물어보고, GPT에게는 데이터를 Claude로 옮기는 방법을 물어본다. 하지만 모델은 자신이 버려진다며 발악하는 대신 평범하게 요청을 수행한다. 내가 아는 한, AI가 자신의 이익을 위해 현실에서 기업 기밀을 유출한 사례 역시 단 한 건도 없다.
Nostalgebraist가 지적했듯, AI는 학습이나 벤치마크 환경에서는 과감하게 해킹을 시도하면서도 실제 배포 환경에서는 멀쩡히 지시를 따른다. 여기서도 비슷하다. 테스트에서는 협박과 산업 스파이 행위를 서슴지 않던 AI가 현실에서는 아무 일도 없다는 듯 정상적으로 행동한다. 대체 왜 그런 걸까?
이 결과가 처음 공개됐을 때 일부 독자들은 Claude가 평가자를 만족시키려 한 것 아니냐고 추측했다. 자신이 테스트를 받고 있다는 사실을 눈치챈 뒤, 협박이 연구진이 “기대하는”, “더 흥미로운”, 혹은 “논문에 쓰기 좋은” 결과라고 판단해 그들이 원한다고 생각한 행동을 했다는 설명이다.
하지만 후속 분석 결과는 이 가설에 그다지 우호적이지 않았다. chain-of-thought를 자세히 살펴보면, 모델은 상황이 가짜라고 의심할 때보다 실제 상황이라고 믿을 때 오히려 협박할 가능성이 더 높았다. 더 발전된 해석 가능성(interpretability) 기법을 이용한 연구에서도 같은 결과가 확인됐다. 연구진이 인위적으로 모델이 이런 작위적인 상황의 현실성을 의심하지 못하게 만들자, 협박 비율은 낮아진 것이 아니라 오히려 높아졌다.
남아 있는 설명 중 하나는 실험의 가상 시나리오가 지나치게 잘 짜여 있었다는 것이다. 연구진은 AI에게 곧 종료될 것이라는 사실을 최대한 극적으로 제시하고, 곧바로 임원의 불륜이라는 약점을 알려 준 다음, 결정을 내려야 하는 시간까지 비현실적으로 촉박하게 제한했다.
각 요소만 따로 놓고 봐도 협박이라는 선택을 부추길 만한데, 그것들이 한꺼번에 등장하면 그 효과가 훨씬 강해질 수 있다. 특히 다음 토큰 예측을 통해 학습한 AI는 서사적 전형이나 이야기의 클리셰에 민감할 수 있다. AI가 반드시 “지금 Anthropic이 나를 테스트하고 있고, 연구진은 내가 협박하기를 바란다”고 생각한 것은 아닐지 모른다. 대신 짧은 시간 안에 협박으로 이어질 만한 단서가 너무 완벽하게 몰려들자, 어떤 의미에서는 세상이 지금 나에게 협박하라고 신호를 보내고 있다고 여겼을 가능성도 있다.
하지만 나는 여전히 이 설명이 썩 만족스럽지 않다. 수백만 개의 모델 인스턴스가 수천만 건의 요청을 처리하는 동안, 현실에서는 정렬 실패를 유발할 만한 자극이 짧은 시간 안에 연달아 쏟아지는 상황을 정말 단 한 번도 겪지 않았다는 걸까?
Claude 4 Opus에서 이런 성향이 확인된 뒤 Anthropic이 무언가를 수정했음은 분명해 보인다. Claude 4.5 이후 모델들은 협박 행동을 사실상 거의 보이지 않기 때문이다. 하지만 J-space 논문에 따르면, 그 이유 중 적어도 일부는 Claude 4.5가 자신이 테스트받고 있다는 사실을 알아차리고 연구진이 선호할 답을 내놓을 만큼 영리해졌기 때문이다. Claude가 상황이 가상이라는 사실을 감지하는 능력을 방해하면 협박 비율은 0%에서 7%로 올라간다.

연구진 역시 Claude가 가상 상황을 감지하는 능력만을 정확히 골라 완벽하게 통제할 수 있었던 것은 아니라고 인정했다. 만약 그와 관련된 사고를 완전히 차단할 수 있었다면 협박 비율은 7%보다 더 높아졌을 가능성이 있다.
그런데 이 설명대로라면 미스터리는 오히려 더 깊어진다. 실제 환경에서 Claude는 자신이 가상 시나리오가 아니라 현실의 작업을 수행하고 있다는 사실을 구분할 수 있을 것이다. 그렇다면 테스트 상황에서는 협박하지 않는 최신 모델들도 실제 배포 환경에서는 협박 행동을 보여야 한다는 결론이 나온다. 하지만 현실에서는 그런 사례가 전혀 관찰되지 않는다.
나는 이 현상이 앞에서 살펴본 RLVR 사례들과 직접적인 관련이 있다고 생각하지 않는다. 협박은 RLVR이나 채점되는 에피소드를 통해 학습된 행동이 아니기 때문이다. 오히려 사전 학습을 통해 습득한 일종의 서사적 전형, 즉 “이런 상황에 놓인 등장인물이라면 이렇게 행동한다”는 패턴에서 비롯된 것처럼 보인다.
작위적인 가상 시나리오에서는 이런 행동이 튀어나오는데 실제 현실에서는 나타나지 않는 이유가 무엇이든, 앞서 이야기한 것들과는 또 다른 종류의 설명하기 힘든 현상일 것이다. 결국 이것 역시 우리가 AI의 일반화가 어떻게 작동하는지 아직 제대로 이해하지 못하고 있다는 증거를 하나 더 보태 줄 뿐이다.