OpenAI가 10년 묵은 수학 난제 10개를 풀었다
연산비 2,000달러, 증명은 기계가 검증했다
OpenAI가 미공개 차기 모델 Astra로 10년 이상 열려 있던 수학 문제 10개에 새 결과를 냈다. 핵심은 결과 자체가 아니라 모든 증명을 Lean 4로 기계 검증했다는 점이다.
OpenAI가 8월 1일에 아직 공개하지 않은 차기 모델 Astra로 수학 미해결 문제 10개에 새 결과를 냈다고 발표했다. 열 문제 모두 최소 10년 이상 풀리지 않은 것들이다.
숫자가 눈길을 끈다. 열 개 증명을 다 만드는 데 든 연산비는 Sol API 요금 기준 대략 2,000달러. 함께 공개한 자료는 249쪽 원고와, 결과마다 붙은 기계 검증용 Lean 4 인증서다. 이 인증서는 사람이 옳다고 믿어 달라는 게 아니라 컴퓨터가 한 줄씩 참을 확인한 형식 증명이다.
간판 결과는 군론의 오래된 질문에 답한 것이다. 비소픽 군(non-sofic group)의 첫 명시적 구성인데, 소픽성은 미하일 그로모프가 1999년에 도입한 뒤 20년 넘게 반례가 나올지조차 불분명했던 개념이다. 그 밖에 고차원 기하, 부호 이론, 산술 회로 복잡도, 격자 암호, 극단 조합론까지 영역이 넓다.
한 줄 정리
OpenAI가 미해결 수학 문제 10개에 새 결과를 냈고, 모든 증명을 Lean 4로 기계 검증해 사람 검토 없이도 참임을 확인할 수 있게 했다.
한눈에 보기
| 발표일 | 2026년 8월 1일 |
| 대상 | 10년+ 미해결 수학 문제 10개 |
| 연산비 | 약 2,000달러 (Sol API 요금 기준) |
| 검증 | 전부 Lean 4 기계 검증 인증서 공개 |
| 자료 | 249쪽 원고 + GitHub 인증서 |
| 모델 | Astra (미공개, 다중 에이전트 장기 작업용 계열) |
왜 "검증"이 진짜 뉴스인가
프런티어 모델이 어려운 문제를 풀었다는 소식은 이제 흔하다. 여기서 다른 건 결과의 형태다. Astra의 증명은 Lean 4 인증서로 나와서 사람이 논문을 읽고 판단할 필요 없이 컴퓨터가 참·거짓을 자동으로 가른다.
이게 왜 중요한가. 지금까지 LLM의 최대 약점은 그럴듯하지만 틀린 출력, 즉 환각이었다. 수학 증명 영역은 이 약점이 통하지 않는 몇 안 되는 곳이다. 증명이 틀리면 Lean이 컴파일 단계에서 그냥 거부한다. 모델이 아무리 유창하게 써도 검증기를 속일 수는 없다.
노엄 브라운은 X에서 이 결과를 "과학적 추론의 큰 진전"이라고 했다. 과장을 걷어내도 남는 사실은 이렇다. 출력이 자동으로 검증되는 도메인에서는 모델의 신뢰도 문제가 구조적으로 해결된다.
Astra는 아직 못 산다
주의할 대목이 있다. Astra는 미공개다. 이번 성과는 데모가 아니라 연구 보고에 가깝고, 모델 자체는 여러 에이전트를 오래 돌려 긴 작업을 처리하는 계열로 설명된다. 테스트타임 추론을 길게 밀어붙이는 방향의 연장선이다.
그래서 당장 이걸 워크플로에 붙일 방법은 없다. 하지만 방향은 분명하다. "한 번 물어보고 답 받기"가 아니라 "여러 에이전트가 며칠씩 문제를 붙들고 검증까지 스스로 돌리는" 구조가 프런티어의 기본값이 되고 있다.
연산비 2,000달러라는 숫자도 곱씹을 만하다. 20년 열려 있던 수학 문제를 커피값 수준의 API 비용으로 건드렸다는 뜻이다. 물론 이건 정답이 검증 가능한 특수 도메인이라 가능한 일이고 애매한 비즈니스 판단에 그대로 대입되지는 않는다.
위시클레이 관점
이 뉴스의 핵심을 1인 개발자의 언어로 옮기면 이렇다. AI 출력에 값을 매길 수 있는지는, 그 출력을 기계가 검증할 수 있느냐로 갈린다.
Astra의 증명이 신뢰받는 이유는 Lean이 통과시켰기 때문이다. 여기엔 사람의 재검토 비용이 0에 수렴한다. 반대로 마케팅 카피나 시장 분석 같은 출력은 아무리 그럴듯해도 참을 자동으로 가릴 검증기가 없다. 그 검증 부담은 고스란히 프리랜서와 인디 메이커의 몫으로 남는다.
그래서 AI를 제품에 붙일 때 첫 질문은 "이 모델 똑똑한가"가 아니라 "이 출력을 무엇으로 검증하나"여야 한다. 코드는 테스트와 컴파일러가, 계산은 단위 검사가, 데이터 변환은 스키마가 검증기 역할을 한다. 검증기를 붙일 수 있는 작업일수록 자동화의 값이 실하고 검증기가 없는 작업일수록 사람이 마지막에 개입해야 한다.
1인 SaaS를 만든다면 이 렌즈로 기능을 나눠 보라. 검증 가능한 부분은 에이전트에 과감히 넘기고, 검증기가 없는 부분에만 당신의 시간을 남겨라. 2,000달러로 20년 난제를 푼 쪽과, 자동 검증이 없어 매번 결과를 손으로 확인하는 쪽의 차이는 모델 성능이 아니라 검증 설계에서 난다.
참고
- OpenAI's Astra solves 10 long-open math problems and publishes the proofs (SiliconANGLE)
- OpenAI says its next model, Astra, has solved ten open problems in mathematics (TheNextWeb)
- OpenAI's Astra Solved Decades-Old Math Problems For $2,000 (Forbes)
- OpenAI's New Model, Astra, Has Solved Ten Open Math Problems (DataCamp)