제품 관점2026-09-21

54GB짜리 인기 모델의 시더가 1명이었다

오픈 모델을 토렌트로 옮긴다는 계획의 실제 두께

Pirate Face가 Hugging Face의 오픈 모델을 체크섬 검증 마그넷 링크로 미러링한다. 대상은 66만 9천 개가 넘는다. 다만 지금 성공하는 다운로드는 대부분 Hugging Face에서 받는 것이고, 스웜은 아직 얇다.

트렌딩 목록 맨 위에 다운로드 190만 건짜리 27B 모델이 걸려 있다. 파일 크기 54GB, 시더 1명. 그 아래 91MB짜리 문장 임베딩 모델은 시더가 9명이다. Pirate Face라는 서비스의 현재가 이 두 줄에 다 있다.

Pirate Face는 Hugging Face에 올라온 오픈 모델을 토렌트로 미러링한다. 9월 20일 Hacker News 첫 화면에 올라 366점을 받았다. 대상은 66만 9천 개가 넘고 라이선스는 Apache 2.0과 MIT만 받는다. 파일마다 Hugging Face가 공표한 SHA-256이 붙어 있어 어디서 받든 해시가 맞아야 한다.

한 줄 정리

모델 호스트 한 곳이 파일을 내리면 받을 길이 사라지는 구조를 P2P로 이중화하겠다는 시도가 나왔고 배관은 깔렸지만 스웜은 아직 안 찼다.

배관이 어떻게 생겼나

핵심은 웹시드다. 토렌트 규격에 BEP-19라는 항목이 있는데 토렌트 안에 평범한 HTTPS 주소를 하나 박아 넣는 기능이다. Pirate Face는 거기에 Hugging Face의 파일 주소를 넣는다.

그래서 두 상태가 생긴다. 모델이 Hugging Face에 살아 있는 동안에는 바이트가 거기서 온다. 속도도 같고 체크섬도 같다. 그 파일이 내려가는 날 웹시드가 죽고 다운로드가 P2P 스웜으로 넘어간다. 서비스는 그 모델에 "Rescued" 표시를 붙인다.

HF_ENDPOINT 환경변수 하나만 바꾸면 기존 파이프라인이 이쪽으로 해석되게 하겠다는 계획도 있다. 아직 "soon"이다. 계정 없이 열람·다운로드·시딩이 되고 모델을 새로 올리려면 그 모델이 Hugging Face에 먼저 존재해야 한다.

오늘 성공한 다운로드는 아무것도 증명하지 않는다

배관 설계에 따라오는 함정이 하나 있다. 웹시드가 Hugging Face 자신이라 피어가 0명이어도 다운로드는 성공한다. 지금 받아 보고 "잘 되네"라고 판단하면 그건 Hugging Face가 잘 돌아간다는 확인일 뿐이다.

공개 직후 이 지점을 짚은 사람이 있었다. 쓸모 있는 시험은 Hugging Face가 그 모델을 더 이상 서빙하지 않을 때도 받아지느냐다. 그때가 오기 전까지 이 서비스의 진짜 가용성은 측정되지 않는다.

측정 가능한 대리 지표는 시더 수다. 그리고 그 숫자가 앞에서 본 그대로다.

스웜의 두께

모델 크기 시더
인기 27B 3진 양자화 GGUF 54GB 1
문장 임베딩 소형 모델 91MB 9
대형 MoE 플래그십 765GB 11

작은 파일일수록 시더가 붙고 큰 파일일수록 안 붙는다. 765GB짜리에 11명이 걸려 있다고 해서 그 11명이 파일 전체를 들고 있다는 뜻은 아니다. 토렌트가 수십 년간 겪어 온 그대로다. 54GB를 상시 시딩하려면 디스크와 업로드 대역폭을 내놔야 한다. 그 비용을 낼 이유가 개인에게 없다. 포인트 제도가 있긴 하다. 구조된 모델 하나당 25점. 시딩 보상은 아직 시작도 안 했고 서비스 스스로 "귀속 가능한 시딩 증거가 먼저 필요하다"고 적어 뒀다.

라이선스 범위도 좁다. Apache 2.0과 MIT만 받는다. 어제 공개된 Qwen-Image-2.1처럼 연구 전용 라이선스로 나온 모델은 애초에 여기 실리지 않는다. 그런데 사라질 위험이 큰 쪽은 오히려 그런 모델들이다. 개방적으로 나왔다가 조건이 조여진 가중치야말로 어느 날 내려간다.

미러가 풀어야 할 진짜 문제는 신뢰다

이 서비스가 체크섬을 전면에 내건 이유가 있다. 미러 사이트에서 가중치를 받을 때 가장 먼저 드는 걱정은 속도가 아니라 "이게 진짜 그 파일인가"다. 파라미터 파일은 사람 눈으로 검수할 수 없다. 조금 손댄 가중치도 그럴듯하게 돌아가고, 차이는 몇 주 뒤에 이상한 출력으로나 드러난다.

그래서 파일마다 Hugging Face가 공표한 SHA-256을 그대로 달고 다닌다. 어디서 받아도 해시가 맞아야 하니 바이트 단위로 대조가 된다. 가중치 쪽은 이 방식으로 정리된다.

신원 쪽은 아직 반쯤이다. 핸들은 누구나 선점할 수 있고 Hugging Face 계정을 증명해야 인증 배지가 붙는다. 선점만 한 핸들은 "예약됨"으로 표시되고 진짜 주인이 나중에 인증하면 되찾아 간다. 모델 제출도 지금은 Hugging Face 계정이 있어야 하고 해당 모델이 거기 먼저 올라가 있어야 한다. 중앙 호스트에서 벗어나겠다는 서비스가 그 호스트를 신원과 체크섬의 기준점으로 쓰고 있다. 직접 발행을 열겠다고 적어 뒀지만 아직 아니다.

위시클레이 관점

이 서비스가 성공하느냐는 우리 쪽 문제가 아니다. 우리 쪽 문제는 그 질문이 왜 지금 366점을 받았느냐다.

작은 팀이 오픈 가중치를 쓰는 이유는 보통 두 가지다. 값이 싸거나 데이터를 밖으로 안 내보내려고. 둘 다 "이 모델이 계속 여기 있다"는 전제 위에 서 있다. 그 전제가 흔들린다는 감각이 커졌으니 토렌트 이야기가 첫 화면까지 올라왔다. 실제로 사라진 사례를 모아 둔 별도 저장소까지 생겼다.

계산은 싱겁다. 우리가 운영에 물려 둔 모델은 66만 9천 개가 아니라 두세 개다. 그 두세 개의 가중치 파일을 지금 받아 우리 스토리지에 올려 두고 SHA-256을 따로 적어 두면 끝난다. 27B 4비트 양자화면 대략 12~16GB, 오브젝트 스토리지 월 몇백 원 수준이다. 남의 스웜이 두꺼워지길 기다릴 일이 아니다.

여기에 붙는 질문이 하나 더 있다. 받아 둔 가중치를 돌릴 환경도 같이 남는가. 모델 파일이 있어도 그걸 서빙하던 런타임 버전과 양자화 포맷과 템플릿이 없으면 반쪽이다. 가중치를 내려받을 때 그 모델을 돌린 추론 엔진 버전과 설정 파일을 같은 폴더에 적어 두는 데 5분이 더 든다. 그 5분이 없으면 1년 뒤에 파일만 남는다.

체크섬을 일급 기능으로 내세운 설계는 배울 만하다. 미러를 못 믿는 이유가 "가짜 가중치를 받으면 어쩌나"라서, 그 걱정부터 없애고 시작한다. 우리가 남의 자원을 갖다 쓸 때 똑같이 물어야 할 질문이다. 이 파일이 내가 검증한 그 파일이라는 걸 어떻게 아는가.

인프라는 빌려 쓰는 게 맞다. 빌린 물건을 돌려받지 못하는 날의 계획은 빌린 쪽이 세운다.

참고