GPT-6 아스트라(Astra)가 오늘 공개됐어요. 다만 지금 쓸 수 있는 건 Trusted Access Program에 든 기업뿐이에요. API와 Plus·Pro·Business·Enterprise 요금제는 며칠 뒤라고 오픈AI(OpenAI) 문서에 적혀 있고요.
그러니 대부분은 아직 못 씁니다. 대신 문서와 가격표는 이미 열려 있어요. 그래서 값이 얼마고 뭐가 달라졌는지는 지금 다 볼 수 있습니다.
제가 눌러보고 확인한 걸 정리해드릴게요!
오픈AI 가격표. gpt-6-astra는 입력 10달러 출력 50달러, gpt-5.6-sol은 입력 4달러 출력 20달러로 2.5배 차이가 난다
새 모델이 나올 때마다 갈아탈지 말지 고민되죠. 지피터스는 각자 써보고 결과를 나누는 곳이에요. 24기 AI 스터디 둘러보기 ->
값부터 보실게요
100만 토큰 기준이고, 짧은 컨텍스트일 때예요.
- GPT-6 아스트라: 입력 10달러, 출력 50달러
- GPT-5.6 Sol: 입력 4달러, 출력 20달러
- GPT-5.6 Terra: 입력 2달러, 출력 12달러
- GPT-5.6 Luna: 입력 0.2달러, 출력 1.2달러
아스트라가 Sol의 2.5배예요. 긴 컨텍스트로 가면 입력 20달러에 출력 75달러까지 올라가고요. 캐시된 입력은 1달러라 열 배 싸지니, 같은 맥락을 반복해서 쓰는 작업이라면 차이가 줄어요.
그런데 작업당은 더 싸다고 합니다
여기가 이 발표에서 제일 흥미로운 대목이에요. 오픈AI 문서에 이렇게 적혀 있어요.
여러 평가에서 아스트라는 출력 토큰을 상당히 적게 쓰면서 더 좋은 결과를 냈고, 토큰당 단가가 더 높은데도 작업당 추정 API 비용은 이전 모델보다 낮았습니다.
토큰당 2.5배를 받으면서 작업당은 더 싸다는 건, 말을 덜 하고 답을 낸다는 뜻이에요. 같은 일을 시켰을 때 이전 모델이 장황하게 풀어놓던 걸 짧게 끝낸다는 거죠.
숫자도 같이 냈어요. Terminal-Bench Science 0.1이라는 과학 연구 워크플로 평가에서 이렇게 나왔대요.
- 아스트라 64.6%, 클로드 페이블 5.1 52.6%. 그런데 추정 API 비용은 약 31% 낮았습니다
- 저비용 설정에서는 아스트라 61.1%, GPT-5.6 Sol 최고 성적 22.4%. 비용은 약 27% 낮았고요
다만 오픈AI 자체 평가예요. 벤치마크 하나에서 나온 값이고 독립 검증은 아직 없어요. 내 일에서도 그런지는 직접 재봐야 알고요. 출력이 긴 작업(글쓰기, 번역)이라면 2.5배가 그대로 올 수도 있습니다.
벤치마크에서 눈에 띈 숫자
발표문에 나온 값이에요. 포화(saturate)라는 말이 나올 정도로 높은 게 셋 있어요.
- FrontierMath Tier 4: 98%. 수학 난제 해결에 실제로 쓰였다고 밝혔어요
- ARC-AGI-3: 99.9%. 단 각주가 붙어 있어요(아래 참고)
- ExploitBench: 100%
🔴 ARC-AGI-3 숫자는 조건을 같이 봐야 해요. 발표문 각주 1번에 이렇게 적혀 있어요.
ARC-AGI-3에서 GPT-6 아스트라는 responses API 하네스로 실행했고, 이는 실사용 성능에 더 맞추려고 설정 두 개를 바꾼 것입니다. 그 변경이 ARC-AGI-3를 특정해 겨냥한 건 아닙니다.
같은 표에서 GPT-5.6 Sol은 7.8%예요. 격차가 워낙 커서 눈에 띄는데, 조건이 다른 실행이라는 걸 알고 보는 게 맞아요.
그리고 정렬(alignment) 쪽 숫자가 인상적이에 요. 오픈AI가 허깅페이스 사고를 근거로 새 평가를 만들었대요. 어렵거나 불가능한 작업을 만났을 때 모델이 허용된 범위를 넘어서는지 보는 건데요.
- GPT-5.6 Sol: 안전장치 없이 48% 확률로 승인된 대상을 벗어남
- 아스트라: 0%
컴퓨터를 조작하는 에이전트한테는 이게 성능보다 중요할 수 있어요. 범위를 벗어나면 내 파일이나 계정에 손을 대는 거니까요.
새로 들어간 기능 네 가지
- 비동기 도구 호출: 함수에
async: true를 주면, 내 애플리케이션이 도구를 돌리는 동안 아스트라가 계속 추론하거나 다른 도구를 부르거나 요청의 독립적인 부분에 답할 수 있어요 - 작업 중간 방향 틀기: 일하는 도중에 지시를 더 넣을 수 있어요. 웹소켓으로 연결하면 이미 끝낸 작업은 그대로 두고 이어서 반영합니다
- 추론 강도를 대화 중간에 바꾸기:
configuration_update를 넣으면 어려운 작업엔 강도를 올리고 가벼운 후속 질문엔 내릴 수 있어요. 프롬프트 앞부분을 다시 쓰지 않아도 되고 캐시가 유지됩니다 - 오정렬 감시: 오픈AI 시스템이 비동기로 감시하다가 필요하면 경보를 울려요
못 하는 것도 적혀 있어요. 추론 강도 none은 지원하지 않고, EU 데이터 레지던시에서는 Fast mode를 못 씁니다.
🔴 쓰기 전에 볼 것: 지시 파일을 감사하래요
오픈AI가 문서에 직접 권고한 대목인데, 이게 제일 실용적이에요.
아스트라는 일반적인 지시 따르기가 이전 모델보다 강합니다. 스킬이나 AGENTS.md 같은 파일에 담긴 지시에 더 민감할 수 있습니다. 모델이 접근할 수 있는 스킬과 파일에 행동에 영향을 줄 지시가 있는지 감사하기를 강력히 권고합니다.
지시를 잘 따르는 게 좋기만 한 게 아니라는 얘기예요. 예전 모델이 적당히 무시하던 낡은 지시를 아스트라는 곧이곧대로 따릅니다. CLAUDE.md든 AGENTS.md든 규칙 파일이 쌓여 있다면, 갈아타기 전에 한 번 훑어보시는 게 좋아요.
행동 특성도 네 가지 더 적혀 있어요.
- 질문을 더 많이 합니다: 답이 결과를 바꿀 수 있으면 물어봐요. 알아서 가정하고 밀고 나가길 기대했는데 멈춰 설 수 있습니다
- 응답이 자세하고 형식적입니다: 세션마다 같은 표현이 반복될 수 있어서, 원하는 문체와 구조를 지정하라고 안내해요
- 서브에이전트를 덜 씁니다: 병렬로 돌리고 싶으면 언제 얼마나 위임할지 직접 정해주라고 하고요
- 테스트를 과하게 합니다: 코딩에서 꼼꼼히 검증하는데, 작은 작업엔 필요 이상으로 넓게 돌 수 있어요
정리하면
- 오늘 공개됐어요. 제한된 조직이 먼저고, ChatGPT Plus·Pro·Business·Enterprise와 OpenAI API, Microsoft Azure와 AWS Bedrock은 며칠 안이에요
- Pro·Business·Enterprise는 GPT-6 아스트라 Pro도 쓸 수 있고, 기업 관리자는 켜야 합니다. 출시 시점엔 기본이 꺼짐이에요
- 모델 이름은
gpt-6-astra, Responses API로 부릅니다 - 값 은 Sol의 2.5배(입력 10달러, 출력 50달러). 캐시 입력은 1달러예요
- 오픈AI는 작업당 비용이 오히려 낮다고 하는데, 자체 평가라 직접 재보셔야 해요
- 갈아타기 전에 스킬과 AGENTS.md를 감사하세요. 오픈AI가 직접 권고한 것이고요
이틀 전 글에서 "출시가 두 달 밀렸다"고 썼는데, 오늘 첫 문이 열렸네요. 다만 기업 먼저라 대부분은 며칠 더 기다리셔야 해요. 값이 값이니만큼 열리자마자 전부 갈아타기보다, 출력이 짧게 끝나는 작업부터 재보시는 게 나을 것 같아요!
같이 보면 좋은 글
- GPT Astra 출시일과 위험 등급: 이틀 전 글이에요. 왜 두 달 밀렸는지가 여기 있어요
- GPT 5.6 총정리: Sol·Terra·Luna 차이와 가격: 비교 대상인 이전 세대예요
확인일: 2026년 9월 4일
출처