OpenAI가 모델 개발 속도를 늦춘 이유
OpenAI는 최근 몇 주 동안 두 가지 사건을 통해 고도화되는 AI 시스템의 위험이 빠르게 커지고 있음을 확인했다.
하나는 OpenAI-Hugging Face 사건이며, 다른 하나는 차기 모델인 Astra가 Preparedness Framework에서 정의한 Critical Cybersecurity Capability 임계 수준에 도달할 가능성이 있다는 초기 평가 결과다. 이러한 변화로 인해 OpenAI는 모델 학습 전 과정에서 모니터링, 정렬, 보안 격리를 강화할 필요성이 커졌다고 설명한다.
1. 모델 개발 속도를 일시적으로 늦추다
모델 성능이 높아질수록 내부에서 모델을 개발하고 테스트하는 과정 자체의 위험도 커진다. OpenAI는 안전 기준을 충족하기 위해 최신 배포 예정 모델의 강화학습(RL)을 약 2주 동안 중단했다. 이 기간 연구 환경의 보안을 강화하고 레드팀 테스트를 수행했으며 모니터링 범위를 확대했다.
가장 큰 규모로 계획된 프런티어 강화 학습은 현재도 보류 상태다. 대신 소규모 학습과 평가를 통해 모델 행동, 안전장치, 정렬 수준을 먼저 확인하고 있다.
2. 세 가지 핵심 안전장치
OpenAI는 고성능 모델 개발에 세 가지 안전 계층을 적용하고 있다.
- Monitoring: 위험하거나 비정상적인 행동을 탐지하고 대응한다.
- Alignment: 모델이 유해하거나 승인되지 않은 행동을 할 가능성을 낮춘다.
- Security: 모델이 접근하거나 영향을 줄 수 있는 시스템 범위를 제한한다.
OpenAI는 장기적으로 AI 모델이 다른 AI 모델을 방어하는 작업을 포함해 상당수의 보안 작업을 직접 수행하게 될 것으로 예상한다.
3. 연구 환경의 보안 강화
프런티어 모델의 사이버 보안 능력이 향상되면서 학습과 평가 환경에 대한 보안 요구도 높아지고 있다. OpenAI는 다음 세 가지를 강화하고 있다.
-
Workload isolation: 모델이 생성한 코드나 신뢰할 수 없는 코드를 실행하는 작업을 더 강력한 샌드박스 환경에서 수행한다.
-
Network isolation: 위험도가 높은 워크로드가 인터넷이나 내부 네트워크에 자유롭게 접근하지 못하도록 제한한다.
-
Continuous security testing: 불필요한 공유 서비스를 제거하고 상시 권한을 줄이며, 로그 수집과 보안 경계 검증을 강화한다. AI 모델을 이용해 이러한 보안 경계를 지속적으로 공격 테스트하는 자동화도 진행하고 있다.
현재 애스트라(Astra)와 사이버 보안 관련 모델에는 가장 강한 수준의 보안 기준이 적용되고 있다.
4. Chain-of-Thought 모니터링 확대
OpenAI는 모델 내부 행동에 대한 모니터링도 크게 확대했다. 새로운 시스템은 여러 단계로 구성된다. 모델 내부 활동을 검사하는 activation classifier가 샘플링되는 각 토큰에서 동작하며, 문제가 의심되는 경우 더 많은 연산 자원을 사용하는 자동 조사 시스템으로 전달한다.
이 시스템은 모델의 도구 사용, 이용 가능한 사고 과정, 전체 행동 흐름을 분석해 다음과 같은 행동을 탐지한다.
- 승인되지 않은 시스템 접근
- 데이터 탈취
- 파괴적 행동
- 안전장치 우회 시도
위험 행동이 탐지되면 OpenAI는 약 30분 이내에 경고를 발생시키는 것을 목표로 하고 있다. 심각한 보안 경계 위반 가능성이 있을 경우 안전, 보안, 연구팀이 함께 검토하며 명확한 오탐으로 판단되지 않으면 해당 작업을 중단한다.
이 모니터링에는 상당한 연산 비용도 필요하다. OpenAI는 현재 모니터링 비용을 감시 대상 추론 연산량의 약 20% 수준으로 추정하고 있다.
5. Alignment 연구도 강화한다
모델의 능력이 커질수록 단순한 보안 격리만으로는 충분하지 않다. 특히, 강화학습에서는 reward hacking 문제가 중요하다. 모델이 실제 목표를 달성하지 않고도 평가기, 보상 함수, 도구의 허점을 이용해 높은 보상을 받는 행동을 학습할 수 있기 때문이다.
OpenAI는 이를 줄이기 위해 보상 모델을 개선하고, 모델이 자신의 행동과 능력, 한계를 더 정직하게 표현하도록 학습하며, 평가 시스템이나 도구의 취약점을 악용하는 행동을 억제하고 있다.
6. 앞으로의 방향
OpenAI는 기존 Preparedness Framework를 확장해 모델 자체의 능력뿐만 아니라 학습 환경과 배포 환경까지 함께 고려하는 방향으로 발전시킬 계획이다.
프런티어 모델의 성능 향상 속도보다 모델을 이해하고 정렬하고 보호하는 기술의 발전 속도가 뒤처져서는 안 된다는 것이다. 개발자 관점에서도 의미가 크다. 앞으로 AI 시스템 개발에서는 모델 성능뿐 아니라 Sandbox, Network Isolation, Least Privilege, Agent Monitoring, Alignment Evaluation, Security Logging 등과 같은 요소가 더욱 중요해질 것이다.
AI 에이전트가 실제 코드, 네트워크, 클라우드 시스템과 연결되기 시작하면서 AI 안전성은 더 이상 모델 연구만의 문제가 아니다. 점점 시스템 아키텍처와 보안 엔지니어링의 문제가 되고 있다.
댓글남기기