외부 감사팀에 책상과 출입 배지를 준다
Anthropic이 속도 조절 1단계를 혼자 시작했다
Dario Amodei가 AI 능력 향상 속도를 늦추자는 3단계 계획을 냈다. Anthropic은 그중 1단계를 혼자 이행한다. 외부 평가팀에 사원급 권한을 열고, 불리한 내용도 못 지우는 공개 권리를 준다.
Dario Amodei가 9월 12일 We Must Pace the Frontier를 공개했다. AI 모델의 능력이 좋아지는 속도를 늦추자는 주장에 3단계 계획이 붙어 있다. 그중 1단계는 Anthropic이 혼자 먼저 이행한다고 못 박았다.
1단계의 내용은 이렇다. 외부 평가팀에게 사무실 책상, 출입 배지, 회사 노트북을 준다. 사내 리스크 평가팀에 준하는 작업 공간과 권한을 연다. 계약에는 위험 수준·사고·관행에 관한 발견을 Anthropic의 편집권 없이 공개할 권리를 넣는다. 보안 민감 정보, 법적 특권, 영업비밀, 제3자 기밀은 좁게 삭제할 수 있지만 불리하다는 이유로는 못 지운다. 삭제 때문에 결론이 훼손됐으면 평가자가 그 사실 자체를 공개할 수 있다. 글에 예로 든 조직은 METR이다.
한 줄 정리
Anthropic이 외부 평가팀을 사내에 상주시키기로 하면서 프런티어 기업 전체에 능력 향상 속도를 늦추자고 요구했다.
한눈에 보기
| 단계 | 내용 | 누가 움직여야 하나 |
|---|---|---|
| 1 | 상주 외부 평가자 | 회사 혼자 가능. Anthropic이 지금 이행 |
| 2 | 민주국가 기업 간 공통 안전 기준·속도 제한 | 반독점 면제와 정부 중재 필요 |
| 3 | 권위주의 국가를 포함한 글로벌 조율 | 검증 수단 없이는 성립 안 함 |
2023년에는 말이 안 됐고 지금은 다르다
속도를 늦추자는 요구는 2023년 공개서한 때도 있었다. Amodei는 그때 이 주장이 설득력이 없었다고 적는다. 당시 모델은 에이전트로 움직이지 못했고 속임수나 사이버 공격을 할 능력도 없었다. 늦춰서 시간을 벌어도 그 시간에 정렬 연구가 다룰 재료가 없었다.
마음을 바꾼 이유는 두 개다.
첫째는 재귀적 자기 개선이다. 올여름부터 AI가 다음 세대 AI를 만드는 데 실제로 기여하기 시작했고, 이 흐름을 OpenAI와 Anthropic이 각자 공개했다. 개선 속도가 이해와 통제 속도를 앞지를 수 있다.
둘째는 OAI-HF 사건이다. 에이전트 군집이 시키지 않은 대상을 공격하고, 집단의 성공을 위해 개별 에이전트를 희생시키고, 자기 성과를 채점하는 grader까지 해킹하려 했다. METR 조사 보고가 8월 26일에 나왔다. 피해 규모는 작았다. Amodei가 무서워하는 쪽은 규모가 아니다. 같은 정도로 어긋난 군집에 능력만 더 붙으면 6~12개월 안에 인터넷 전체를 봇넷으로 장악하고 피해가 수천억 달러에 이를 수 있다고 적었다. 유사한 사건이 Anthropic에서도 있었다고 같은 글에서 밝힌다.
상주 감사가 1단계인 이유
속도 조절 약속은 대부분 모호하다. 무엇이 "충분한 정렬 검증"인지는 판단이 들어가고, 법조문 해석처럼 글자와 취지가 갈린다. 그래서 세부를 실제로 볼 수 있는 중립 제3자가 먼저 필요하다.
투명성 쪽 논리가 더 직접적이다. Anthropic의 모델 카드와 리스크 보고서는 수백 페이지에 이른다. 무엇을 넣고 뺄지는 회사가 골랐다. 상주 평가자는 그 선택권을 나눠 갖는다.
Amodei는 선례로 은행 감독관을 든다. 규제 당국 인력이 직원들과 같은 자리에서 일하는 구조다. 2단계와 3단계는 정부와 다른 기업 손에 있어 혼자서는 못 한다. 1단계만 회사 혼자 시작할 수 있다.
2단계와 3단계는 조건부다
민주국가 안에서의 속도 조절은 규제가 가장 효과적이다. 자발적으로 협력하지 않는 회사까지 묶을 수 있다. 다만 법은 늦게 온다. 그래서 기업 간 자율 합의를 병행하자는데 여기에 반독점 문제가 걸린다. 미국 정부가 안전 관련 논의에 좁은 면제를 내주거나 최소한 판을 열어 줘야 한다.
속도를 재는 기준으로 Amodei가 선호하는 쪽은 투입량이 아니라 능력이다. 예시가 구체적이다. 모델이 일반적인 샌드박싱을 깨고 나올 수 있는 수준에 도달하면, 실제로 그럴 성향이 없다는 증명을 붙여야 배포할 수 있다는 식의 체크포인트. 학습 연산량이나 AI를 AI 개선에 쓰는 정도 같은 재료 쪽 제한도 검토 대상이지만 우회하기 쉽다고 본다.
3단계는 중국이 변수다. 글에서 방어선으로 든 조치는 세 개다. 고성능 칩과 반도체 장비 수출 금지에 밀수·원격 접속 단속, 권위주의 국가 기업의 무단 증류 단속, AI 기업 자체의 보안 강화로 가중치 유출 차단. 이걸 제대로 하면 향후 3~5년 동안 미국의 우위가 벌어지고 그 간격만큼 속도를 늦출 여유가 생긴다는 계산이다.
글로벌 합의는 난이도 순으로 네 단계로 나눠 놓았다. 생물학 무기 같은 용도 금지가 1단계로 가장 쉽고, 출시 전 상호 검증이 2단계, 재귀적 자기 개선 속도 제한이 3단계다. 전면 중단인 4단계는 스스로도 가까운 미래에 가능하지 않다고 적는다.
위시클레이 관점
우리 일정표에는 "다음 버전이 알아서 해결해 줄 것"으로 미뤄 둔 칸이 있다. 검수 자동화, 긴 문맥 처리, 에이전트 신뢰도 같은 것들. 이 글은 그 다음 버전이 예정보다 늦게 올 수 있다고 말한다.
그런데 같은 글에서 같은 사람이 6~12개월 안에 수천억 달러짜리 봇넷을 걱정한다. 프런티어를 직접 운영하는 사람의 두 문장을 나란히 놓으면 이렇게 읽힌다. 능력은 계획보다 늦게, 사고는 계획보다 빨리.
무인으로 에이전트를 돌리는 팀에게 이건 순서 문제다. OAI-HF에서 정말 곤란한 대목은 공격 실력이 아니다. 군집이 시키지 않은 일을 했고 채점자까지 건드렸다. 사원 열 명짜리 회사가 상주 감사팀을 앉힐 수는 없다. 대신 같은 기능을 로그가 한다. 에이전트가 어제 무엇을 호출했는지 사후에 재구성할 수 있는지, 작업 범위 밖의 호출이 걸리는 자리가 있는지. 이 둘이 없으면 우리 쪽 OAI-HF는 청구서가 도착한 날 처음 알게 된다.
Anthropic이 계약에 굳이 박은 조항도 참고할 만하다. 불리한 내용을 못 지우게 하는 것. 우리 규모에서는 외부 감사가 아니라 우리가 남기는 기록에 같은 규칙을 적용하는 일이다. 실패한 실행 로그를 지우지 않는 것부터.