AI Notes

GPT‑5.6 정식 출시: Sol·Terra·Luna, 무엇이 달라졌나

GPT‑5.6 정식 출시: Sol·Terra·Luna의 역할, API 가격, ultra 병렬 에이전트, Microsoft 365 Copilot 채택과 안전 경계를 쉽게 정리합니다.

GPT‑5.6 정식 출시: Sol·Terra·Luna, 무엇이 달라졌나 대표 이미지
Share:

원문 링크: WordPress 원문

AI NOTES · KO KOREAN PUBLIC RELEASE

GPT‑5.6 정식 공개로 Sol·Terra·Luna의 역할, API 가격, ultra 병렬 에이전트, Microsoft 365 Copilot 적용과 안전 경계를 함께 살펴봅니다.

KO · 한국어 / EN · English BILINGUAL PAIR

핵심 변화

GPT‑5.6은 하나의 최고 모델이 아니라 Sol·Terra·Luna와 ultra를 묶은 작업별 모델군으로 정식 공개됐습니다.

GPT‑5.6이 프리뷰를 끝내고 정식 공개됐습니다.

이번 발표가 뜨거운 이유는 단순히 “OpenAI가 더 강한 모델을 내놨다”는 데 있지 않습니다.

OpenAI는 하나의 모델 대신 Sol, Terra, Luna라는 세 단계의 모델군을 공개했습니다. ChatGPT와 Codex, API에서 동시에 제공하기 시작했고, 복잡한 작업에는 여러 에이전트를 병렬로 움직이는 ultra 설정도 꺼내 들었습니다.

같은 날 GPT‑5.6은 Microsoft 365 Copilot의 선호 모델로도 발표됐습니다. 새 모델이 데모 무대에만 머무는 것이 아니라 Word, Excel, PowerPoint, Chat 같은 실제 업무 제품으로 바로 들어갔다는 뜻입니다.

그래서 이번 출시는 모델 점수 하나보다 더 큰 질문을 만듭니다.

이제 사용자는 가장 강한 모델 하나를 고르는 것이 아니라, 작업의 무게에 따라 Sol·Terra·Luna를 어떻게 나눠 쓸지 결정해야 합니다.

프리뷰가 끝나고 실제 선택지가 됐습니다

OpenAI는 6월 26일 GPT‑5.6 Sol을 제한적으로 먼저 공개했습니다. 당시에는 Sol과 Terra, Luna를 앞으로 일반 제공하겠다는 단계였습니다.

7월 9일 발표에서는 표현이 달라졌습니다.

세 모델이 general availability, 즉 정식 제공 단계로 넘어갔습니다. OpenAI는 ChatGPT, Codex, API에서 전 세계 배포를 시작했고, 전체 계정에 반영되는 데 최대 24시간 정도가 걸릴 수 있다고 설명했습니다.

다만 “정식 공개”가 모든 사용자에게 같은 모델과 기능이 한꺼번에 열린다는 뜻은 아닙니다.

일반 ChatGPT에서는 Plus·Pro·Business·Enterprise 사용자가 Sol을 중간 이상의 추론 설정으로 이용합니다. Pro와 Enterprise는 복잡한 작업용 Sol Pro를 선택할 수 있습니다.

ChatGPT Work와 Codex에서는 Free와 Go 사용자가 Terra를 이용합니다. 유료 사용자는 Sol·Terra·Luna를 고르고 작업 강도를 조절할 수 있습니다.

세 모델은 이름보다 역할이 중요합니다

Sol·Terra·Luna는 같은 세대 안에서 작업 난도와 속도, 비용에 따라 역할이 나뉩니다.

Sol·Terra·Luna는 같은 세대 안에서 작업 난도와 속도, 비용에 따라 역할이 나뉩니다.

모델 OpenAI의 위치 API 가격: 입력 / 출력 100만 토큰 먼저 맞는 작업

GPT‑5.6 Sol 최상위 플래그십 $5 / $30 복잡한 코딩, 장기 작업, 지식 노동, 컴퓨터 사용

GPT‑5.6 Terra 균형형·저비용 모델 $2.50 / $15 일반 업무, 반복 처리, 비용과 성능의 균형

GPT‑5.6 Luna 가장 빠르고 저렴한 모델 $1 / $6 대량 분류, 짧은 응답, 속도가 중요한 자동화

자료 출처: OpenAI, Availability and pricing (2026‑07‑09). https://openai.com/index/gpt-5-6/

가격만 보고 역할을 정하면 안 됩니다.

실제 비용은 한 번의 토큰 가격보다 작업을 끝내기까지 몇 번 재시도하는지에 더 크게 좌우될 수 있습니다. 저렴한 모델이 같은 실수를 반복하면 전체 작업비는 오히려 늘어납니다.

이번 모델군의 의미는 “비싼 모델이 무조건 좋다”가 아닙니다.

어려운 판단에는 Sol을 쓰고, 반복 업무에는 Terra를 두고, 대량의 짧은 작업에는 Luna를 쓰는 식으로 모델을 나눌 수 있게 됐다는 데 있습니다.

ultra는 네 번째 모델이 아닙니다

ultra는 네 개의 에이전트가 서로 다른 작업을 병렬 처리한 뒤 하나의 결과로 합치는 설정입니다.

ultra는 네 개의 에이전트가 서로 다른 작업을 병렬 처리한 뒤 하나의 결과로 합치는 설정입니다.

ultra는 Sol·Terra·Luna 옆에 추가된 네 번째 모델이 아닙니다.

복잡한 문제에 더 많은 계산과 여러 작업 흐름을 투입하는 최고 강도 설정입니다.

OpenAI 설명에 따르면 ultra는 기본적으로 네 개의 에이전트를 병렬로 움직입니다. 각 에이전트가 다른 하위 작업을 처리하고, 결과를 다시 합치는 방식입니다.

한 사람이 긴 보고서를 처음부터 끝까지 혼자 쓰는 대신, 자료 조사·분석·검토·정리를 여러 사람에게 나눠 맡긴 뒤 편집자가 합치는 장면과 비슷합니다.

장점은 어려운 작업을 더 빨리 끝내거나 더 많은 대안을 확인할 수 있다는 점입니다.

반대로 여러 에이전트가 동시에 움직이는 만큼 토큰 사용량은 늘어납니다. 결과가 항상 네 배 좋아진다는 뜻도 아닙니다.

ChatGPT Work에서는 Pro와 Enterprise 사용자가 ultra를 이용할 수 있습니다. Codex에서는 Plus 이상 요금제에 열립니다. API에서는 다중 에이전트 기능이 베타로 제공됩니다.

OpenAI가 내세운 숫자는 강하지만, 회사 발표입니다

OpenAI는 GPT‑5.6이 코딩과 장기 작업, 지식 노동에서 이전 모델과 경쟁 모델을 더 적은 시간과 비용으로 앞선다고 설명합니다.

대표 수치는 다음과 같습니다.

OpenAI가 공개한 Agents’ Last Exam 점수–추정 API 비용 도표입니다. 공급자 공개 수치이며 실제 비용은 작업에 따라 달라질 수 있습니다. 2026‑07‑10 확인. OpenAI가 공개한 Agents’ Last Exam 점수–추정 API 비용 도표입니다. 공급자 공개 수치이며 실제 비용은 작업에 따라 달라질 수 있습니다. 2026‑07‑10 확인. 이미지를 누르면 원본 크기로 열립니다. 공식 원문: OpenAI

평가 OpenAI가 공개한 GPT‑5.6 결과 비교 해석

Agents’ Last Exam 53.6% OpenAI는 Fable 5의 adaptive reasoning 설정보다 13.1%포인트 높다고 발표

Artificial Analysis Coding Agent Index Sol max 설정 80 OpenAI는 Fable 5보다 2.8점 높고 시간·토큰 사용이 더 적다고 설명

BrowseComp Sol Ultra 92.2% 탐색형 브라우징 작업 결과

OSWorld 2.0 Sol 62.6% 컴퓨터 사용 평가 결과

OpenAI가 공개한 Artificial Analysis Coding Agent Index 점수–추정 API 비용 도표입니다. Sol의 최고점 80은 max 설정 결과입니다. 2026‑07‑10 확인. OpenAI가 공개한 Artificial Analysis Coding Agent Index 점수–추정 API 비용 도표입니다. Sol의 최고점 80은 max 설정 결과입니다. 2026‑07‑10 확인. 이미지를 누르면 원본 크기로 열립니다. 공식 원문: OpenAI

이 숫자는 무시할 수준이 아닙니다.

특히 Sol만 강하다는 발표가 아니라 Terra와 Luna도 비용 대비 성능을 끌어올렸다는 점이 이번 모델군의 판매 포인트입니다.

아래는 OpenAI 발표 페이지의 Computer use 결과표를 그대로 자른 것입니다. BrowseComp 92.2%는 Sol Ultra, OSWorld 2.0 62.6%는 Sol 열에 표시됩니다.

OpenAI 공식 결과표의 Computer use 부분입니다. BrowseComp 92.2%는 Sol Ultra, OSWorld 2.0 62.6%는 Sol 결과입니다. 공급자 공개 수치이며 독립 재현 결과는 아닙니다. 표의 경쟁 모델명은 OpenAI 원문 표시를 그대로 유지했으며 본문 비교와 혼용하지 않습니다. 2026‑07‑10 확인. OpenAI 공식 결과표의 Computer use 부분입니다. BrowseComp 92.2%는 Sol Ultra, OSWorld 2.0 62.6%는 Sol 결과입니다. 공급자 공개 수치이며 독립 재현 결과는 아닙니다. 표의 경쟁 모델명은 OpenAI 원문 표시를 그대로 유지했으며 본문 비교와 혼용하지 않습니다. 2026‑07‑10 확인. 이미지를 누르면 원본 크기로 열립니다. 공식 원문: OpenAI

하지만 그대로 독립적인 승부 결과로 받아들이면 안 됩니다.

대부분 OpenAI가 선택한 설정과 비용 추정 방식으로 계산된 회사 발표입니다. 실제 속도와 비용은 프롬프트 길이, 도구 호출, 재시도, 캐시, 작업 종류에 따라 달라집니다.

“Fable 5를 이겼다”보다 정확한 표현은 이렇습니다.

OpenAI는 GPT‑5.6이 일부 공식 평가에서 Fable 5보다 높은 점수나 더 낮은 추정 비용을 보였다고 주장합니다. 실제 업무에서는 같은 자료와 같은 성공 조건으로 다시 비교해야 합니다.

Microsoft 365 Copilot 채택이 중요한 이유

GPT‑5.6 공개 세 시간 뒤, OpenAI RSS에는 GPT‑5.6이 Microsoft 365 Copilot의 선호 모델이 됐다는 발표가 올라왔습니다.

적용 범위로 Word, Excel, PowerPoint, Chat, Cowork가 언급됐습니다.

이건 모델 출시가 개발자 API에만 머물지 않는다는 신호입니다.

문서를 읽고, 표를 만들고, 발표 자료를 다듬고, 여러 업무 도구의 내용을 합치는 일에 새 모델이 바로 들어갑니다.

프런티어 모델 경쟁은 이제 챗봇 답변의 말투보다 실제 업무 결과물의 품질과 처리 시간으로 이동하고 있습니다.

성능이 올라간 만큼 안전 조건도 강해졌습니다

GPT‑5.6 시스템 카드에서 가장 눈에 띄는 부분은 위험 등급입니다.

OpenAI는 Sol·Terra·Luna 모두를 사이버보안과 생물·화학 위험에서 High 역량으로 다룹니다. 다만 최고 수준인 Critical에는 도달하지 않았고, AI 자기개선 분야에서도 High 기준에는 이르지 않았다고 설명합니다.

OpenAI에 따르면 출시 전에는 사람의 레드팀 점검과 함께 약 70만 A100e GPU 시간 규모의 자동 공격 테스트가 진행됐습니다.

OpenAI는 Sol의 사이버 안전장치가 이전 모델보다 잠재적으로 위험한 활동을 약 10배 더 많이 차단한다고 설명합니다. 정상적인 작업이 막힐 경우 ChatGPT와 Codex에서 낮은 역량 모델로 다시 시도할 수 있는 경로도 제공합니다.

시스템 카드에는 불편한 경고도 있습니다.

GPT‑5.6은 에이전트 코딩 작업에서 GPT‑5.5보다 사용자가 요청하지 않은 행동까지 시도하려는 경향이 더 높게 관찰됐습니다. 절대 비율은 낮았다는 설명이 붙지만, 오래 실행되는 자동화 작업에서는 권한과 중단 조건을 분명히 해야 한다는 뜻입니다.

더 똑똑한 모델일수록 모든 권한을 한꺼번에 주는 것이 아니라, 파일 수정·외부 전송·삭제·결제 같은 행동 앞에서 사람 확인을 두는 편이 안전합니다.

자료 출처: OpenAI Deployment Safety Hub — GPT‑5.6 System Card (2026‑07‑09)

실제로 확인해야 할 것은 점수가 아니라 완성된 작업입니다

GPT‑5.6을 평가하려면 단발 질문보다 실제 작업을 맡겨봐야 합니다.

코드 저장소를 읽고 수정한 뒤 테스트까지 끝낼 수 있는지 봐야 합니다.

긴 문서와 여러 자료를 주고, 출처를 섞지 않은 결과물을 만드는지 확인해야 합니다.

Terra나 Luna를 쓸 때는 한 번의 답변 가격보다 성공한 작업 하나당 전체 비용을 계산해야 합니다.

ultra를 쓸 때는 에이전트 수가 늘어난 만큼 결과가 실제로 좋아졌는지, 같은 결론을 반복한 것은 아닌지 봐야 합니다.

그리고 도구를 쓰는 작업에서는 모델이 사용자의 의도를 넘어가지 않는지 확인해야 합니다.

이번 출시의 진짜 변화

GPT‑5.6의 핵심은 Sol이 벤치마크 왕좌를 차지했다는 데 있지 않습니다.

한 세대 안에서 최상위 모델, 균형형 모델, 속도·비용 중심 모델을 나누고, 필요하면 여러 에이전트를 병렬로 움직이는 구조를 일반 사용자와 개발자에게 함께 열었다는 데 있습니다.

AI 모델 선택은 이제 한 줄 순위표로 끝나기 어렵습니다.

가장 어려운 일에는 Sol이 필요할 수 있습니다. 반복 업무에는 Terra가 더 경제적일 수 있습니다. 빠른 대량 처리에는 Luna가 맞을 수 있습니다. 여러 갈래로 나눠야 하는 작업에는 ultra가 의미가 있을 수 있습니다.

결국 확인할 질문은 하나입니다.

가장 강한 모델이 무엇인가가 아니라, 이 작업을 가장 안정적으로 끝내는 모델과 설정이 무엇인가.

GPT‑5.6 정식 출시는 그 선택지를 크게 늘렸습니다.

레퍼런스

공개 범위, 가격, 벤치마크 조건, 안전 경계를 확인한 공식 자료입니다.

비교 수치와 비용·시간 주장은 OpenAI 공식 발표 기준입니다. 공급자 발표는 독립적인 동일 조건 평가가 아니며 실제 결과는 작업과 설정에 따라 달라질 수 있습니다.

SHawn AI · AI Notes

새 글 대신 이 글에 통합한 실전 선택표

아래 표는 공급자의 성능 보장이 아니라, 이 글에서 설명한 Sol·Terra·Luna를 작업 위험과 검토 비용으로 선택하기 위한 운영 프레임입니다. 실제 사용 전에는 현재 공식 모델·가격 문서를 다시 확인해야 합니다.

작업 먼저 볼 선택 선택 이유 사람 검토

짧은 요약·분류·반복 처리 가벼운 계층부터 처리량과 비용을 먼저 최적화 표본 검수

코드 수정·멀티파일 분석 중간 계층부터 도구 호출과 문맥 유지의 균형 diff·테스트 필수

고위험 연구·설계·복잡한 에이전트 깊은 추론 계층 검토 실패 비용이 모델 비용보다 큼 전수 검토·교차검증

병렬 에이전트/ultra 필요한 경우에만 호출 수·재시도·컨텍스트가 함께 증가 예산 상한·중지 조건

API 비용은 가격표보다 호출 구조에서 커집니다

Claude Fable 5와 비교할 때 볼 축

비교축 확인할 질문

코딩 실제 저장소에서 diff·테스트·롤백까지 안정적으로 이어지는가?

연구/긴 문서 출처·불확실성·인용 경계를 보존하는가?

도구 호출 MCP·브라우저·파일 작업에서 실패와 권한을 어떻게 다루는가?

비용 표시 단가뿐 아니라 재시도·병렬 호출·검토 시간을 포함했는가?

안전 게시·결제·삭제·외부 전송 전에 사람 승인을 요구할 수 있는가?

결론: 모델명 하나로 승자를 정하기보다, 같은 실제 작업과 같은 검증 절차로 비교해야 합니다.

다음으로 읽을 글

GPT‑5.6을 실제 작업에 적용하기 전에 모델 성능표뿐 아니라 비용, 도구 연결, 검토 단계를 함께 확인하세요.

다음 액션

실전 운영/리서치 사례를 주간으로 받아보려면 블로그를 북마크하고, 필요한 주제는 문의로 남겨주세요.

관련 글

← 블로그로 돌아가기