2026년 7월 9일, OpenAI가 GPT-5.6를 공개하며 코딩 도구 Codex도 함께 업데이트했습니다. 이번엔 모델 하나가 아니라 Sol·Terra·Luna 세 가지가 동시에 나왔는데요, 이름만 봐선 헷갈리기 쉽습니다. 세 모델의 차이부터 실제 벤치마크, 가격, 새 Codex 기능까지 공식 데이터 기준으로 깔끔하게 정리했습니다.

GPT-5.6는 ‘한 모델’이 아니라 ‘3등급’

가장 먼저 알아야 할 점. GPT-5.6는 등급이 셋으로 나뉩니다.

등급성격100만 토큰 가격(입력/출력)추천 용도
Sol최고 성능(프런티어)$5 / $30어려운 문제·장시간 에이전트
Terra지능·비용 균형$2.5 / $15일상 코딩·범용
Luna효율·대량 처리$1 / $6자동화·고빈도 호출

같은 세대이지만 크기와 가격이 다른, 말하자면 ‘상·중·하’ 라인업입니다. ChatGPT·Codex·API 모두에서 순차 제공됩니다.

💡 핵심: 대부분의 코딩은 Terra로 충분합니다. 막히는 어려운 태스크만 Sol로 올리는 '혼합 전략'이 비용 대비 효율이 가장 좋습니다.

코딩 벤치마크: 얼마나 강한가

이번 GPT-5.6의 주무기는 코딩입니다. 공개된 공식·독립 지표를 보면:

  • Terminal-Bench 2.1: Sol 88.8%, 상위 변형 Sol Ultra 91.9%
  • Artificial Analysis 코딩 에이전트 지수: Sol(max) 80점으로 선두권

터미널 환경에서 실제 작업을 끝까지 수행하는 능력(Terminal-Bench)이 특히 높다는 점이, 단순 코드 생성보다 ‘에이전트로서의 실행력’을 강조한 이번 세대의 방향을 보여줍니다.

⚠️ 주의: 벤치마크 점수는 측정 조건·프롬프트에 따라 달라집니다. 위 수치는 공식/독립 발표 기준이며, 실제 체감은 프로젝트 성격에 따라 다르므로 핵심 작업으로 직접 비교해 보세요.

새로워진 Codex: ‘작성’을 넘어 ‘리뷰·통합’까지

이번 업데이트의 진짜 포인트는 Codex의 워크플로 개선입니다.

  • diff 인라인 편집 — 변경분(diff) 안에서 바로 코드를 고칠 수 있습니다.
  • PR 리뷰 사이드 패널 — 풀리퀘스트 리뷰를 옆 패널에서 확인.
  • Computer Use 가속 — 화면·도구 조작이 더 빨라졌습니다.
  • 멀티 레포 — 한 프로젝트에서 여러 저장소를 동시에 다룹니다.

한마디로 “코드를 짜는 도구”에서 “코드를 짜고 → 리뷰하고 → 여러 저장소에 통합하는 도구”로 진화했습니다.

API의 새 무기들

개발자라면 아래 옵션도 눈여겨볼 만합니다.

기능무엇을 하나
Programmatic Tool Calling도구 호출을 코드로 프로그래밍 방식 제어
명시적 프롬프트 캐싱 제어캐시를 직접 켜고/끄며 비용 절감
Persisted reasoning추론 상태를 이어서 유지
Max reasoning effort추론 강도를 최대로 끌어올림
멀티 에이전트 오케스트레이션(beta)여러 에이전트를 조율(Responses API)

특히 멀티 에이전트 오케스트레이션은 2026년 하반기 AI 활용의 핵심 키워드라, 앞으로 활용 사례가 빠르게 늘어날 전망입니다.

결론: 누구에게 무엇을

  • 최고 품질이 필요하면 → Sol
  • 범용·일상 코딩 → Terra (기본 추천)
  • 자동화·대량 호출 → Luna

GPT-5.6는 ‘더 똑똑한 챗봇’보다 ‘더 잘 일하는 코딩 에이전트’에 가깝습니다. 코딩·자동화 비중이 크다면, 기본을 Terra로 두고 어려운 작업만 Sol로 올리는 혼합 전략으로 시작해 보세요.

※ 본문 수치는 2026년 7월 공식·독립 벤치마크 발표 기준입니다. 세부 스펙과 가격은 이후 변경될 수 있으니 도입 전 공식 자료를 확인하세요.