클로드 페이블 5.1 성능 비교, GPT 5.6 솔·그록 4.6 대결
클로드 페이블 5.1의 발표 내용과, 같은 프롬프트로 페이블 5·GPT 5.6 솔·그록 4.6과 3D 장면 만들기를 겨룬 결과를 정리했다. 무엇이 좋아졌다고 발표했는지, 실제 테스트에서 모델마다 어떻게 갈렸는지, 벤치마크 순위와 요금 변화가 누구에게 해당하는지까지 한 번에 볼 수 있다.

클로드가 새 모델 "페이블 5.1"을 내놨다. 발표만 보면 늘 그렇듯 다 좋다고 하니, 한 유튜버가 페이블 5, GPT 5.6 솔, 그록 4.6까지 넷을 나란히 놓고 똑같은 프롬프트(AI에게 주는 지시 문장) 하나로 붙여봤다. 결과는 꽤 갈렸다.
클로드 페이블 5.1 발표 내용: 무엇이 좋아졌나
발표자가 공식 홈페이지를 읽어준 대목부터. 데이터 보존과 보안이 강화됐고, 과학 분야 터미널벤치 점수가 페이블 5보다 크게 올랐다. 터미널벤치는 AI가 명령어 창(터미널)에서 실제 작업을 얼마나 해내는지 재는 시험이다.
에이전틱 코딩에서는 "미토스 5.1"과 페이블 5.1이 둘 다 기존 미토스보다 낫다고 한다. 에이전틱 코딩은 AI가 스스로 계획을 세우고 여러 단계를 이어 실행하며 코드를 짜는 방식이다. 미토스는 특정 기업 파트너에게만 열려 있고 페이블 5.1은 누구나 쓰는 공개 버전이다.
어려운 문제만 모아뒀다는 Humanity's Last Exam에서는 정확도가 약 65%까지 올랐다. 오래 생각하는 모델이라 그만큼 비용도 늘었다는 단서가 붙는다. 반대로 에이전트 코딩 벤치(자막 표기 "커서치")는 페이블 5보다 싸면서 점수는 더 높고, 지식노동 벤치(자막 표기 "GDP발")는 1700점대에서 1800점대로 올라갔다. 여기서 벤치는 벤치마크, 곧 여러 모델을 같은 문제로 채점해 비교하는 표준 시험을 말한다. 컴퓨터 사용·업무 자동화 성능은 페이블 5 대비 2~3배 좋아졌다는 것이 발표자 설명이다.
캐시(컨텍스트 캐싱) 비용도 손봤다. 캐시는 매번 똑같이 보내는 긴 앞부분을 저장해 두고 다시 쓰게 해서 요금을 줄이는 기능이다. 캐시 읽기 비용이 약 75% 줄었고, 일반 작업은 25%, 복잡한 에이전트 작업은 최대 45%까지 내려갔다. 단, 이건 API 요금 얘기다. 구독제로 쓰는 사람에게는 해당 사항이 없다. API는 프로그램에서 모델을 직접 불러 쓰고 쓴 만큼 돈을 내는 방식이고, 구독제는 매달 정해진 요금을 내고 앱에서 쓰는 방식이다. 발표자도 이 부분은 따로 짚고 넘어갔다.
비교 테스트 조건과 프롬프트
네 모델의 조건부터 맞췄다. 여기서 맞춘 것은 추론 설정, 곧 모델이 답하기 전에 얼마나 오래 생각할지를 정하는 옵션이다.
- 페이블 5.1과 페이블 5: 추론 노력 "높음"
- GPT 5.6 솔: 추론 수준 "하이"
- 그록 4.6: 모드 "전문가"(빠름/전문가/헤비 중)
프롬프트는 넷 다 같은 것을 넣었다. 아래는 발표자가 말로 읽어준 것을 자막으로 옮긴 문장이라, "열대의"는 "10대의"를 잘못 받아 적은 것일 가능성이 있다. Three.js는 웹 브라우저 안에서 3D 화면을 그리는 도구다.
다섯 개의 독립적인 Three.js 장면(하나의 연속 프로젝트):
개인 섬 위에 미래지향적 맨션, 외부 궤도,
다이아몬드 샹들리에가 있는 대회장,
워터파크가 있는 수영장,
열대의 람보르기니가 있는 차고,
지붕 위에 헬리콥터 착륙
같은 비교를 직접 해보고 싶다면 순서는 이렇다.
- 비교할 서비스마다 로그인하고 새 대화를 연다.
- 대화창의 모델 선택 메뉴에서 비교할 모델을 고른다.
- 추론 설정을 위 목록과 같게 맞춘다.
- 위 프롬프트를 그대로 붙여넣고 보낸다.
- 완성된 화면을 마우스로 돌리고 확대해 보며, 걸린 시간과 함께 적어 둔다.
같은 프롬프트, 모델별 결과 비교
GPT 5.6 솔은 시작부터 어긋났다. 짧게 넣은 이 프롬프트를 이미지 생성 요청으로 오해했다. GPT가 스스로 더 긴 프롬프트를 다시 써서 제안했고 그걸로 재시도했지만, 나온 건 3D 장면이 아니라 이미지였다. 러버블(말로 설명하면 웹앱을 만들어 주는 서비스) 방식으로 우회하겠다고 해서 발표자가 거절했다. 속도만 놓고 보면 넷 중 두 번째로 빨랐다. 화면을 마우스로 만져보려 했지만 줌도 클릭도 반응이 없었다.
페이블 5는 제일 먼저 끝났다. 전반적으로 무난하게 만들었는데, 대회장이나 차고의 람보르기니처럼 일부 오브젝트(화면 속 물체)가 보였다 안 보였다 하는 렌더링(화면에 그려내는 과정) 문제가 있었다.
그록 4.6은 워터파크에서는 페이블 5에 밀렸지만 차고는 색상별로 잘 뽑았다. 발표자 총평은 "페이블 5와 비슷하거나 조금 더 낫다" 정도. 줌 인·아웃 같은 화면 조작은 정상이었다.
페이블 5.1은 끝나기까지 거의 30분이 걸렸다. 넷 중 가장 오래 걸렸는데, 그 대신 발표자는 "압도적으로" 좋다고 평했다. 헬리콥터가 이착륙(자막 표기 "2착륙")하는 장면까지 들어가서 "게임 한 장면 같다"는 말이 나왔다. 30분을 기다릴 만했는지는 쓰는 사람 사정에 따라 다르겠지만, 결과물만 보면 격차가 있었다.
페이블 5.1 벤치마크 순위와 발표자 순위
아티피셜 아날리시스(여러 AI 모델의 성능과 가격을 비교해 공개하는 외부 평가 사이트) 기준으로는 페이블 5.1이 66점으로 1위, 그 뒤가 오퍼스 5, 페이블 5, GPT 5.6 솔 순이다. 비용 대비 성능에서도 페이블 5.1이 가장 비싸면서 가장 좋은 결과를 냈다. 발표자 개인 순위는 조금 다르다. 페이블 5.1, 그록 4.6, 페이블 5, GPT 5.6 솔 순. 그록을 페이블 5 위에 둔 게 눈에 띈다.
페이블 5.1은 어떤 작업에 강한가: 발표자 결론
에이전트 코딩에서 특히 강하다는 평가다. 워크플로(작업을 처음부터 끝까지 진행하는 흐름)를 끝까지 밀고 가면서 스스로 검수 루프를 여러 번 돌기 때문에, 시간은 걸려도 결과물 품질이 높다는 것. 검수 루프는 만든 결과를 스스로 확인하고 고치는 과정을 되풀이하는 것을 말한다. 여러 에이전트를 팀으로 묶어 쓰면 더 나은 결과가 나올 것이라는 건 발표자 개인 의견이다. GPT 쪽에서도 "아스트랄"이라는 신모델이 곧 나올 거라고 예상했는데, 확정된 정보는 아니다.
자주 묻는 질문
클로드 페이블 5.1은 페이블 5보다 얼마나 좋아졌나요?
발표 기준으로는 여러 시험에서 올랐다. Humanity's Last Exam 정확도가 약 65%까지 올랐고, 지식노동 벤치는 1700점대에서 1800점대가 됐으며, 컴퓨터 사용·업무 자동화 성능은 2~3배 좋아졌다고 발표자가 설명한다. 다만 오래 생각하는 모델이라 작업에 따라 비용과 시간이 더 든다.
페이블 5.1 캐시 요금 인하는 구독자에게도 적용되나요?
적용되지 않는다. 캐시 읽기 약 75% 인하 같은 변화는 쓴 만큼 돈을 내는 API 요금 이야기다. 매달 정액을 내고 앱에서 쓰는 구독제 사용자와는 관계가 없다.
3D 웹 장면 만들기에는 페이블 5.1과 GPT 5.6 솔 중 무엇이 나았나요?
이 영상의 테스트에서는 페이블 5.1이 가장 좋은 결과를 냈다. GPT 5.6 솔은 프롬프트를 이미지 요청으로 오해해 3D 장면을 만들지 못했다. 다만 프롬프트 하나로 한 번 돌린 결과이고, 페이블 5.1은 거의 30분이 걸렸다는 점도 함께 봐야 한다.
추론 노력을 높음으로 두면 무엇이 달라지나요?
모델이 답하기 전에 더 오래 생각하도록 하는 설정이다. 이 테스트에서는 네 모델의 추론 설정을 각각 "높음", "하이", "전문가"로 맞춰 조건을 비슷하게 했다. 생각하는 시간이 늘어나는 만큼 답이 늦어지고 비용도 늘 수 있다.
자막 기반(빠른 모드)으로 정리했고 화면 판독은 하지 않았다.
이 글은 원본 영상(youtu.be/…)을 바탕으로 정리했다.