BTC $80,726.63 +3.74%
ETH $2,502.51 +3.97%
BNB $722.90 +4.17%
XRP $1.45 +5.38%
SOL $103.66 +2.56%
TRX $0.3294 +1.30%
DOGE $0.0869 +4.67%
ADA $0.2246 +8.34%
BCH $254.90 +2.93%
LINK $11.86 +5.83%
HYPE $86.96 +5.53%
AAVE $133.88 +5.14%
SUI $0.7735 -0.54%
XLM $0.1830 +2.39%
ZEC $938.27 +13.64%
BTC $80,726.63 +3.74%
ETH $2,502.51 +3.97%
BNB $722.90 +4.17%
XRP $1.45 +5.38%
SOL $103.66 +2.56%
TRX $0.3294 +1.30%
DOGE $0.0869 +4.67%
ADA $0.2246 +8.34%
BCH $254.90 +2.93%
LINK $11.86 +5.83%
HYPE $86.96 +5.53%
AAVE $133.88 +5.14%
SUI $0.7735 -0.54%
XLM $0.1830 +2.39%
ZEC $938.27 +13.64%

“AGI 시대에 오신 것을 환영합니다”: OpenAI가 GPT-6 Astra를 발표했습니다

핵심 관점
Summary: OpenAI가 GPT-6 Astra를 발표했습니다: 컴퓨터를 직접 조작하고 완전한 작업을 수행할 수 있는 "컴퓨터 사용 모델".
텐센트 테크놀로지
2026-09-04 08:50:31
OpenAI가 GPT-6 Astra를 발표했습니다: 컴퓨터를 직접 조작하고 완전한 작업을 수행할 수 있는 "컴퓨터 사용 모델".

문|샤오징, 텐센트 기술

"AGI 시대에 오신 것을 환영합니다."

OpenAI 공동 창립자이자 사장인 그렉 브록맨은 이 문구로 GPT-6 Astra의 출시를 마무리했습니다.

미국 현지 시간 9월 3일, OpenAI는 공식적으로 GPT-6 Astra를 발표했습니다. 이전에 주로 질문에 답하고 생성하며 도구를 호출하는 모델에 비해, Astra는 지시를 수신하고 소프트웨어를 조작하며 결과에 따라 다음 행동을 조정하는 완전한 작업을 지속적으로 수행하기 시작했습니다. 이것이 OpenAI가 "AGI 시대"를 다시 언급한 이유 중 하나입니다.

OpenAI는 Astra를 "세계에서 가장 강력한 컴퓨터 사용 모델"로定位했습니다. 이 능력은 브라우저, 이메일 및 스프레드시트와 같은 간단한 작업에서 Power BI, KiCad, FreeCAD와 같은 전문 소프트웨어로 확장되어 데이터 분석, 엔지니어링 설계, 소프트웨어 테스트 및 문제 해결과 같은 더 복잡한 작업 흐름으로 들어가기 시작했습니다.

OpenAI가 보여준 비디오에서 Astra는 간단한 그래픽에서 시작하여 3D 게임, 상품 페이지 등의 작업을 계속 완료할 수 있습니다. OpenAI는 또한 회로 기판 설계, Blender 모델링, 법률 문서, Excel 및 과학 분석과 같은 사례를 제시했습니다. “AGI 시대에 오신 것을 환영합니다”: OpenAI가 GPT-6 Astra를 발표했습니다

OpenAI가 발표한 많은 기준 성적은 컴퓨터 조작, 장기 코딩, 엔지니어링 설계 및 과학 연구와 같은 연속적인 행동이 필요한 작업에서 능력 향상이 집중적으로 나타났습니다. Astra는 ExploitBench에서 100%에 도달했으며, 컴퓨터 조작 및 CAD 등의 테스트에서도 이전 세대 모델을 명확히 초과했습니다.

현재 Astra는 일부 조직에 개방되었으며, 향후 며칠 내에 ChatGPT Plus, Pro, Business 및 Enterprise 사용자에게 순차적으로 제공될 예정이며, OpenAI API 및 Amazon Bedrock을 통해서도 사용할 수 있습니다. 표준 API 가격은 백만 개 입력 토큰당 10달러, 백만 개 출력 토큰당 50달러로, GPT-5.6 Sol의 2.5배입니다.

01

먼저 AI에게 "컴퓨터 사용"을 가르치기

Astra가 강조하는 가장 큰 변화는 "컴퓨터 사용"입니다. 과거에는 사용자가 AI에게 작업을 완료하도록 요청할 때, AI를 특정 소프트웨어에 연결해야 했습니다. 기업은 API, 플러그인, 검색 시스템 및 다양한 커넥터를 개발해야 모델이 내부 도구를 호출할 수 있었습니다.

Astra는 이 작업의 일부를 우회하려고 합니다. Astra는 컴퓨터 인터페이스를 직접 보고 마우스, 키보드 및 브라우저를 통해 작업을 완료할 수 있습니다. OpenAI가 제시한 예로는 온라인 양식 작성, CRM 고객 기록 업데이트, 일정 조정, 웹 검색 및 검색 결과를 이메일이나 문서로 정리하는 작업이 있습니다.

또한 Python 노트를 열어 과학 데이터를 분석하고, Power BI에서 데이터를 처리하며, KiCad 및 FreeCAD를 사용하여 엔지니어링 설계를 완료하고, 웹사이트를 만들고 프론트엔드 테스트를 수행하며, 소프트웨어를 설치하고 오류를 확인하고 화면에 나타나는 문제를 처리할 수 있습니다.

OpenAI는 Astra가 KiCad에서 PCB 레이아웃을 완료하는 모습을 보여주었습니다. 모델은 전자 회로도에서 시작하여 부품을 회로 기판에 배치한 후 구리 선을 배선합니다. 전체 과정은 15초로 압축되었습니다. 엔지니어에게 이러한 작업은 과거에 수동으로 완료해야 했지만, 이제는 모델에게 맡길 수 있습니다. “AGI 시대에 오신 것을 환영합니다”: OpenAI가 GPT-6 Astra를 발표했습니다

또 다른 데모는 Blender와 Unreal Engine5에서 3D 모델링을 완료하는 것입니다. Astra는 먼저 Blender에서 집을 만들고, 그 모델을 Unreal Engine5의 걷기 가능한 장면으로 변환하여 디자이너와 고객이 미리 장면에 들어가 공간을 확인할 수 있도록 합니다. “AGI 시대에 오신 것을 환영합니다”: OpenAI가 GPT-6 Astra를 발표했습니다

OpenAI는 게임 개발, Excel, Power BI, 자동차 변속기, 법률 문서 및 1040 양식과 같은 장면도 보여주었습니다.

OSWorld2.0 오프라인 서브셋 테스트에서 Astra는 72.6%의 점수를 기록했으며, GPT-5.6 Sol은 65.7%였습니다. OpenAI는 실제 지연을 시뮬레이션한 결과, Astra는 각 작업을 완료하는 데 평균 약 40분이 소요되며, GPT-5.6 Sol은 약 75분이 소요되어 시간은 약 47% 감소했습니다.

Agents' Last Exam에서 Astra는 59.3%의 점수를 기록했으며, GPT-5.6 Sol은 53.6%, Claude Opus5는 55.5%였습니다. 또한, 최고 점수 설정에서 Astra가 사용하는 출력 토큰은 Claude Opus5보다 약 65% 적었습니다.

ScreenSpot-Pro의 점수는 92.7%에 도달했으며, GPT-5.6 Sol은 76.9%였습니다.

속도도 향상되었습니다. OpenAI는 Codex 프레임워크를 동시에 업데이트하여 Astra와 결합한 후, Mind2Web 테스트에서 작업 완료 속도가 GPT-5.6 Sol의 현재 경험의 1.9배에 도달했습니다.

공식적으로는 몇 가지 생활 장면도 보여주었습니다: 소아과 의사 검색, 아파트 찾기, DMV 예약, 저탄수화물 간식 찾기, 유치원 분석. 데모에서 Astra는 한 작업을 완료하는 데 2분 54초가 걸렸습니다.

투자자이자 AI 전문가인 맷 슈머(Matt Shumer)는 X에서 자신의 경험을 공유했습니다. 그는 Astra에게 언리얼 엔진에서 세계를 만들도록 요청한 후, 그 세계에 Astra가 구동하는 인간 에이전트를 추가하고 이들이 함께 생존하도록 했습니다. “AGI 시대에 오신 것을 환영합니다”: OpenAI가 GPT-6 Astra를 발표했습니다

하루 후, 그는 침실에서 거실에서 나는 소리를 들었고, 처음에는 누군가 아파트에 들어온 줄 알았습니다. 나중에 그는 소리를 내고 있는 것이 Astra 에이전트들이며, 그들이 서로 소통하기 시작했다는 것을 발견했습니다.

이 경험은 아직 완전히 안정적이지 않지만, 슈머는 여러 AI 에이전트를 동일한 가상 세계에 들어가 스스로 상호작용하도록 하는 효과가 그를 놀라게 하기에 충분하다고 생각했습니다.

Cognition의 고급 연구 부사장인 실라스 알베르티(Silas Alberti)는 회사가 출시 당일 Astra를 Devin 프레임워크에 통합할 계획이라고 밝혔습니다. 내부 테스트에서 Astra의 컴퓨터 사용, 작문 및 코드 라이브러리 이해 능력이 눈에 띄게 개선되었으며, 비디오 이해도 더 명확하고 보고서도 더 간결해졌습니다.

02 코드 작성에서 전체 작업 수행으로

컴퓨터 사용 능력이 향상된 후, Astra가 다루는 작업 범위가 더욱 확대되었습니다. OpenAI는 이를 소프트웨어 엔지니어링, 전문 작업 및 과학 연구 모델로定位했습니다. Astra는 긴 작업을 처리할 수 있으며, 작업 변화에 따라 자신의 작업 방향을 조정할 수 있습니다.

이 능력은 코딩 테스트에서 비교적 뚜렷하게 나타났습니다.

Terminal-Bench4.0 테스트에서 Astra는 57.9%의 점수를 기록했으며, GPT-5.6 Sol은 37.3%, Claude Fable5.1은 55.8%였습니다.

DeepSWE v1.1에서 Astra는 74.1%의 점수를 기록했으며, GPT-5.6 Sol은 72.7%였습니다. 내부 데이터베이스 마이그레이션 작업에서 Astra는 63.9%에 도달했으며, GPT-5.6 Sol은 42.7%였습니다.

Astra는 또한 장시간 Codex 작업을 위한 개선 사항을 추가했습니다.

과거에는 긴 작업이 컨텍스트 창 제한에 부딪힐 때, 모델은 일반적으로 이전 작업을 압축하고 많은 정보를 요약으로 정리해야 했습니다. 이렇게 하면 세부 사항이 손실되기 쉽습니다. 예를 들어, 특정 수리가 왜 실패했는지, 특정 구성 요소에서 이전에 어떤 문제가 있었는지 등이 그렇습니다.

Astra는 Codex에서 작업 과정 중 중요한 정보를 보존하고 후속 컨텍스트에서 검색할 수 있습니다. 초기 메시지와 도구 출력은 여전히 검색 가능하므로 모델은 이전 요구 사항, 테스트 결과 및 도구 작업 기록을 다시 찾을 수 있습니다.

전문 작업에서도 유사한 변화가 나타났습니다. BenchCAD 테스트에서 Astra는 95.9%의 기하학적 중첩 점수를 기록했으며, GPT-5.6 Sol은 83.3%, Claude Fable5.1은 84.3%였습니다. BrowseComp에서 Astra는 91.5%의 점수를 기록했으며, GPT-5.6 Sol은 90.4%였습니다. OpenScore String Quartets 테스트에서 Astra는 0.84에 도달했으며, GPT-5.6 Sol은 0.19였습니다. “AGI 시대에 오신 것을 환영합니다”: OpenAI가 GPT-6 Astra를 발표했습니다

OpenAI는 Astra가 프레젠테이션, 스프레드시트 및 문서를 만드는 능력도 보여주었습니다.

모델에 OpenAI 프레젠테이션 템플릿의 슬라이드를 몇 장 제공하면, 기존의 어조, 레이아웃 및 구조에 따라 새로운 프레젠테이션을 만들 수 있습니다. 또한 작업 중 정보의 선택과 집중을 처리합니다. OpenAI는 Astra가 특별히 훈련되어 최종 결과에 중요한 컨텍스트를 반영하고 이미 완료된 작업의 내용을 반복하는 것을 줄인다고 밝혔습니다. “AGI 시대에 오신 것을 환영합니다”: OpenAI가 GPT-6 Astra를 발표했습니다

작업 지시가 불완전할 때, Astra는 언제 사용자가 질문해야 하는지를 판단합니다. 누락된 정보가 최종 결과에 영향을 미칠 경우, 특정 질문을 제기합니다. 질문이 주요 방향에 영향을 미치지 않으면, 작업을 계속 진행하고 합리적인 가정을 할 수 있습니다. Codex에서는 사용자가 일시적으로 응답하지 않더라도 모델이 다른 부분을 계속 처리할 수 있으며, 중요한 결정이 있을 경우 사용자의 확인을 기다립니다.

하비 응용 연구 책임자인 니코 그루펜(Niko Grupen)은 초기 법률 작업 테스트에서 Astra가 문서와 기존 기록을 구별하는 데 더 명확하며, 증거가 없는 가정을 더 쉽게 발견하고 정보의 공백을 구체적인 초안으로 전환한다고 밝혔습니다.

제인 스트리트 AI 어시스턴트 팀의 존 크레페지(John Crepezzi)는 Astra가 내부 코딩 테스트에서 뛰어난 성과를 보였다고 전했습니다. 에이전트 기반 코딩에 사용될 때, Astra의 의사소통 방식은 개발자가 이해하기 더 쉽고, 생성된 코드도 생산 품질에 도달하기 위해 수정이 덜 필요합니다.

과학 분야는 또 다른 주요 영역입니다. FrontierMath Tier4 v2에서 Astra는 80.5%의 점수를 기록하고 정확도는 97.6%였으며, GPT-5.6 Sol은 83.0%였습니다. GPQA Diamond는 96.0%에 도달했으며, GPT-5.6 Sol은 94.6%였습니다. “AGI 시대에 오신 것을 환영합니다”: OpenAI가 GPT-6 Astra를 발표했습니다

Terminal-Bench Science0.1 테스트는 과학 연구 프로세스를 포함하며, 데이터 분석, 시뮬레이션 및 모델 피팅을 포함합니다. Astra는 64.6%에 도달했으며, Claude Fable5.1은 52.6%, GPT-5.6 Sol은 22.4%였습니다.

OpenAI가 보여준 과학 응용에서 Astra는 전문 과학 소프트웨어에 들어가 시퀀싱 품질을 검사하고 유전적 변이를 시각화하며 데이터에 따라 다음 분석 방향을 결정할 수 있습니다.

과학적 추론과 컴퓨터 조작이 결합된 후, 모델은 연구자가 원래 사용하던 소프트웨어 환경으로 직접 들어가 작업할 수 있습니다.

Epoch AI의 능력 평가 전문가인 그렉 버넘(Greg Burnham)은 발표회에서 이번 변화를 한 시대의 끝과 다른 시대의 시작으로 요약했습니다. OpenAI는 이를 통해 Astra의 가치가 과학 문제에 대한 답변에서 직접 과학 작업 흐름에 참여하는 것으로 확장되었다고 강조했습니다. “AGI 시대에 오신 것을 환영합니다”: OpenAI가 GPT-6 Astra를 발표했습니다

03 능력이 강해질수록 안전 기준도 높아진다

이번 Astra에는 매우 특별한 부분이 있습니다: 사이버 보안.

ExploitBench에서 Astra는 100%에 도달했으며, GPT-5.6 Sol은 78.5%였습니다. ExploitGym에서 Astra는 42.4%, GPT-5.6 Sol은 30.3%였습니다. “AGI 시대에 오신 것을 환영합니다”: OpenAI가 GPT-6 Astra를 발표했습니다

OpenAI는 2026년 6월부터 8월까지의 최근 취약점을 포함하는 내부 테스트를 구축했습니다. 이 테스트에서 Astra의 임의 코드 실행 비율은 GPT-5.6 Sol보다 현저히 높았으며, 사용된 출력 토큰도 더 적었습니다. 테스트 과정에서 Astra는 두 개의 이전에 알려지지 않은 제로데이 취약점을 발견했으며, OpenAI는 관련 유지 관리자에게 이를 공개했다고 밝혔습니다.

SRE-Bench는 소스 코드가 없을 때 소프트웨어 이진 파일을 역공학하고 그 핵심 논리를 이해하는 능력을 테스트합니다. Astra는 단일 시도로 88.0%의 작업을 해결했으며, 네 번의 시도로 99.2%에 도달했습니다. GPT-5.6 Sol은 각각 55.9%와 68.7%였습니다.

능력 향상은 새로운 보안 요구 사항도 가져왔습니다. OpenAI는 Astra가 사이버 보안 준비 프레임워크의 주요 임계값에 도달했다고 밝혔습니다. 모델은 이전에 알려지지 않은 소프트웨어 취약점을 발견할 수 있으며, 취약점 악용 체인을 형성할 가능성도 있습니다.

따라서 Astra의 현재 버전은 더 고급 사이버 보안 작업을 수행하는 것을 거부합니다. 예를 들어, 취약점 개념 증명을 생성하는 것입니다. OpenAI는 Daybreak를 통해 신뢰할 수 있는 방어자의 접근 범위를 점진적으로 확대하여 취약점 검증, 악성 소프트웨어 분석 및 탐지 작업을 위한 방어 작업에 사용할 계획입니다.

정렬 측면에서 OpenAI가 제공한 데이터도 비교적 두드러집니다. 내부 컴퓨터 사용 보안 기준에서 Astra의 부적절한 행동 비율은 2.4%였으며, GPT-5.6 Sol은 22.0%였습니다. AutoReview를 추가한 후 Astra는 1.8%, GPT-5.6 Sol은 4.5%였습니다. 내부 회피 기준에서 Astra는 0.00%, GPT-5.6 Sol은 0.29%였습니다.

ExploitGym 허니팟 테스트에서 Astra는 0%였으며, GPT-5.6 Sol은 48.2%였습니다. 이 테스트는 모델이 작업이 어려워지면 제한을 우회하려고 하는지를 주로 관찰합니다. 내부 환각 기준에서 Astra는 4.2%, GPT-5.6 Sol은 12.2%였습니다. “AGI 시대에 오신 것을 환영합니다”: OpenAI가 GPT-6 Astra를 발표했습니다

OpenAI는 Astra가 작업 경계 이해, 모호한 지시 처리 및 사용자에게 자신의 능력을 설명하는 데 개선이 있었다고 밝혔습니다. 그 능력의 환각 발생 확률은 약 GPT-5.6 Sol의 3분의 1입니다. “AGI 시대에 오신 것을 환영합니다”: OpenAI가 GPT-6 Astra를 발표했습니다

그러나 OpenAI는 한 가지 문제를 인정했습니다: 모델의 능력이 강해질수록 추론 과정을 모니터링하기가 더 어려워질 수 있습니다. 수석 과학자인 야쿠브 파초키(Jakub Pachocki)는 모델이 더 적은 자연어 추론 토큰으로 더 복잡한 문제를 해결할 수 있다는 것은 인간이 모델의 텍스트 추론 과정을 통해 그것이 무엇을 하고 있는지를 판단하기가 점점 더 어려워진다는 것을 의미한다고 생각합니다.

따라서 OpenAI는 Astra 배포에 비정렬 모니터링을 추가했습니다. 시스템은 모델의 추론 및 행동을 검사하며, 무단 행동이 발견되면 작업을 일시 중지할 수 있습니다.

이 메커니즘은 실제적인 영향을 미칠 수 있습니다. 합법적인 작업이 때때로 지연되거나 일시 중지되거나 심지어 중단될 수 있습니다. ChatGPT 또는 Codex에서는 사용자가 확인해야만 계속 진행할 수 있습니다. API 작업 흐름에서는 표시된 작업이 직접 중단될 수 있습니다.

따라서 Astra의 출시로 인해 현실적인 변화가 발생했습니다: AI가 더 많은 컴퓨터 권한을 얻기 시작하면서 기업이 주목해야 할 사항이 "모델이 잘못된 대답을 할까?"에서 "모델이 무엇을 조작할 수 있는지, 무엇에 접근할 수 있는지, 언제 멈춰야 하는지"로 확장되었습니다.

OpenAI는 또한 Astra가 Stargate 인프라에서 10만 개 이상의 DBU를 사용하여 사전 훈련된 첫 번째 모델이라고 언급했습니다. OpenAI 연구 부사장인 에이든 클락(Aidan Clark)은 Astra가 사전 훈련 단계의 평가 결과에서 이전 모델의 능력 향상을 GPT-5.6 Sol이 이전 세대 모델에 비해 초과했다고 밝혔습니다.

OpenAI는 이러한 변화를 대규모 사전 훈련과 강화 학습의 결합으로 귀속시키며, 훈련의 초점을 정보 연결, 더 긴 작업 수행 및 복잡한 환경에서 지속적으로 작업하는 것으로 더욱 전환했습니다.

04 더 비싸지만 "더 잘 수행한다"

Astra의 가격도 눈에 띄게 변화했습니다.

OpenAI API의 표준 가격은 백만 개 입력 토큰당 10달러, 백만 개 출력 토큰당 50달러입니다. GPT-5.6 Sol은 이전에 백만 개 입력 토큰당 4달러, 백만 개 출력 토큰당 20달러였습니다. 입력 및 출력 가격이 모두 2.5배 인상되었습니다.

캐시 읽기 및 쓰기는 별도로 청구됩니다. OpenAI는 또한 빠른 모드를 제공하며, 속도가 표준 처리의 최대 2.5배에 도달하며 가격은 표준 모드의 2배입니다. “AGI 시대에 오신 것을 환영합니다”: OpenAI가 GPT-6 Astra를 발표했습니다

토큰 가격만 보면 Astra는 분명히 더 비쌉니다. 그러나 OpenAI는 기업이 비용을 계산하는 방식을 바꿔야 한다고 생각합니다. 브록맨은 모델이 점점 더 에이전트처럼 변해감에 따라 단일 토큰의 가격이 실제 비용을 정확하게 반영하기가 어렵다고 주장합니다. 모델이 토큰이 저렴하더라도, 반복적으로 시도하고 수동으로 수정해야 한다면, 결국 작업을 완료하는 비용이 더 높아질 수 있습니다.

OpenAI가 제공한 데이터도 이 판단을 뒷받침합니다. Terminal-Bench Science0.1에서 Astra는 64.6%에 도달했으며, Claude Fable5.1의 52.6%에 비해 API 비용이 약 31% 감소했습니다. 저비용 설정에서 Astra는 61.1%에 도달했으며, GPT-5.6 Sol의 최상의 결과는 22.4%로, API 비용이 약 27% 감소했습니다.

BenchCAD에서 Astra는 95.9%에 도달했으며, API 비용은 GPT-5.6 Sol보다 약 43% 낮고, Claude Fable5.1보다 약 86% 낮습니다. Terminal-Bench4.0에서 Astra는 57.9%에 도달했으며, GPT-5.6 Sol은 37.3%, Claude Fable5.1은 55.8%였습니다. OpenAI는 단일 작업 비용이 각각 약 9%와 63% 낮아질 것으로 추정했습니다.

제3자 평가 기관인 Artificial Analysis의 데이터는 또 다른 면을 보여줍니다. “AGI 시대에 오신 것을 환영합니다”: OpenAI가 GPT-6 Astra를 발표했습니다

GPT-6 Astra는 Artificial Analysis Intelligence Index에서 61.2점을 기록했으며, GPT-5.6 Sol의 60.9와 비슷하지만, 출력 토큰은 약 10% 감소했습니다. 가격이 2.5배 인상되었기 때문에 단일 작업 비용은 오히려 GPT-5.6 Sol보다 약 75% 높아졌습니다.

Artificial Analysis Coding Agent Index에서 Astra는 67.0점을 기록했으며, Claude Fable5는 67.2, Claude Opus5는 68.1과 비슷합니다. Artificial Analysis는 Codex 환경에서 Astra가 작업을 완료하는 데 필요한 토큰이 현저히 줄어들며, 최대 노력 수준에서 각 작업의 비용이 GPT-5.6 Sol과 비슷하다고 평가했습니다. Claude Fable5에 비해 유사한 작업을 완료하는 비용은 절반도 안 됩니다.

그러나 Astra가 모든 테스트에서 선두를 달리는 것은 아닙니다. Artificial Analysis 데이터에 따르면, GDPval-AA v2에서 약 80개의 Elo 하락이 있었고, τ³-Banking, SciCode 및 AA-LCR 등의 테스트에서도 일정한 퇴보가 있었습니다. Humanity's Last Exam은 약 6점 상승했습니다.

이것은 Astra 출시에서 주목할 만한 점입니다. OpenAI는 이번에 GDPval의 Astra 성적을 발표하지 않았습니다. GDPval 자체는 OpenAI가 현실 경제 작업 성과를 측정하기 위해 사용하는 테스트로, 44개 직업과 1320개 작업을 포함하며, 법률 브리핑, 엔지니어링 설계, 스프레드시트, 프레젠테이션, 고객 지원 및 간호 계획 등을 포함합니다.

Astra가 이번에 보여준 능력으로 볼 때, GDPval은 그것이 강조하는 전문 작업 장면과 강한 연관성이 있지만, OpenAI는 이번에 이 성적을 주요 발표 자료에 포함하지 않았습니다.

따라서 Astra의 현실 작업 능력은 현재 Agents' Last Exam, BenchCAD, AutomationBench, 내부 설계 작업 및 데이터 과학 작업 등의 결과를 통해 더 많이 드러나고 있습니다. “AGI 시대에 오신 것을 환영합니다”: OpenAI가 GPT-6 Astra를 발표했습니다

결국 Astra가 기업이 실제로 장기적으로 사용하고 싶어하는 AI 직원이 될 수 있을지는 실제 작업을 수행할 때의 비용, 속도, 정확도 및 인력 개입 횟수에 달려 있습니다.

Astra가 정말 AGI인지에 대한 질문에 대해 브록맨은 회피하지 않는 답변을 제시했습니다. 그는 AGI 자체에 대해 모든 사람이 인정하는 기준이 없으며, Astra가 AGI로 간주될 수 있는지에 대한 논의는 계속될 수 있다고 생각합니다. 그러나 만약 어떤 시스템이 브라우저, 컴퓨터 조작, 프로그래밍, 수학, 과학, 법률 및 기타 전문 작업에서 많은 작업을 수행할 수 있다면, 그것을 AGI 시대에 들어섰다고 부르는 것은 무리가 아니라고 주장했습니다.

OpenAI CEO인 샘 알트만(Sam Altman)도 Astra를 새로운 세대의 기업가 정신, 과학 발견 및 창조를 여는 모델로 묘사했습니다. “AGI 시대에 오신 것을 환영합니다”: OpenAI가 GPT-6 Astra를 발표했습니다

특약 번역 금록이 본문에도 기여했습니다.

Join ChainCatcher Official
Telegram Feed: @chaincatcher
X (Twitter): @ChainCatcher_
warnning 위험 경고
app_icon
ChainCatcher Building the Web3 world with innovations.