BTC $79,604.87 -0.54%
ETH $2,499.80 -0.39%
BNB $745.98 -2.52%
XRP $1.41 -1.14%
SOL $104.99 -1.01%
TRX $0.3355 +0.75%
DOGE $0.0893 -1.97%
ADA $0.2195 -1.51%
BCH $255.39 -2.83%
LINK $13.03 +6.67%
HYPE $86.27 +0.41%
AAVE $133.58 -1.58%
SUI $0.7949 -0.90%
XLM $0.1870 +0.18%
ZEC $1,192.45 +11.07%
BTC $79,604.87 -0.54%
ETH $2,499.80 -0.39%
BNB $745.98 -2.52%
XRP $1.41 -1.14%
SOL $104.99 -1.01%
TRX $0.3355 +0.75%
DOGE $0.0893 -1.97%
ADA $0.2195 -1.51%
BCH $255.39 -2.83%
LINK $13.03 +6.67%
HYPE $86.27 +0.41%
AAVE $133.58 -1.58%
SUI $0.7949 -0.90%
XLM $0.1870 +0.18%
ZEC $1,192.45 +11.07%

OpenAI 首度公布「內部RSI進展」:已實現「自動化研究實習生」

核心觀點
Summary: OpenAI 宣布已實現“自動化研究實習生”目標,即一個能在人類指導下獨立完成數天級別研究任務的系統。截至8月中旬,研究部門智能體工作量已是人類研究員的3.1倍。“AI訓練AI”的飛輪正在加速:AI產出更多代碼和實驗結果,研究進展加快,更好的模型被訓練出來,再反過來提升智能體能力。
華爾街見聞
2026-09-07 10:05:45
OpenAI 宣布已實現“自動化研究實習生”目標,即一個能在人類指導下獨立完成數天級別研究任務的系統。截至8月中旬,研究部門智能體工作量已是人類研究員的3.1倍。“AI訓練AI”的飛輪正在加速:AI產出更多代碼和實驗結果,研究進展加快,更好的模型被訓練出來,再反過來提升智能體能力。

作者:龍玥
AI飛輪開始自轉:OpenAI公開披露內部數據,智能體工作量已是人類研究員的3倍以上。

9月6日,OpenAI官方部落格發布文章《研究加速:OpenAI內部視角(Research acceleration: The view inside OpenAI )》首次以內部數據形式公開AI"遞歸自我改進"(RSI)的進展 。OpenAI稱其已經實現去年秋天定下的目標:在今年9月前造出一個"自動化研究實習生"

OpenAI對"研究實習生"的定義是:"一個能在人類指導下執行明確定義的研究任務的系統,包括那些需要一名熟練研究員數天才能完成的任務。"

下一個目標是:2028年3月前實現完整的"自動化AI研究員",使其能夠參與深度學習和對齊研究,並通過迭代進一步改進系統。

這意味著"AI訓練AI"的飛輪正在加速:AI產出更多代碼和實驗結果,研究進展加快,更好的模型被訓練出來,再反過來提升智能體能力。

OpenAI 首度公布「內部RSI進展」:已實現「自動化研究實習生」

飛輪正在轉動:AI代理工作量達人類的3倍

從OpenAI公布的數據看,智能體首先改變的是研究人員的日常工作方式。

今年年初,按智能體使用量排序處於中位數的OpenAI研究員,對編碼智能體的使用仍相對有限。到8月中旬,這部分研究員已將智能體納入日常工作流程。按API價格折算,中位研究員每天的智能體推理使用額已超過600美元;研究組織中使用量處於前10%的研究員,每天使用的Token價值則超過7000美元。

OpenAI 首度公布「內部RSI進展」:已實現「自動化研究實習生」

OpenAI還表示,研究部門的智能體使用增長快於公司其他團隊。以中位員工的輸出Token變化計算,研究部門的使用規模較2025年12月增長124倍

OpenAI 首度公布「內部RSI進展」:已實現「自動化研究實習生」

更關鍵的轉折點發生在今年6月。

6月之前,研究組織的智能體總運行時長仍低於人類勞動總時長。此後情況逆轉。截至8月中旬,以標準8小時工作日計算,每消耗1個人類工作日,研究組織的智能體已產出3.1個工作日的工作量。

OpenAI 首度公布「內部RSI進展」:已實現「自動化研究實習生」

與此同時,OpenAI稱,越來越多研究員會同時運行4個或更多智能體會話。

代碼和實驗加速,研發流程的可執行環節被放大

OpenAI將AI研發描述為一條包含多個環節的流程:提出改進方案、設計評估、編寫基礎設施、進行大規模測試、發現訓練中的錯誤或不安全行為,並將有效方案整合進核心訓練。

其中任一環節受阻,都可能限制整體研發循環。

OpenAI稱,寫代碼和運行實驗是研究人員的兩項主要工作,而內部數據反映這兩項活動正在加速。

一方面,公司工程師整體代碼交付速度提升。另一方面,2026年以來,每名活躍實驗人員對應的實驗數量持續增加;2026年8月達到自2025年1月開始跟蹤以來的新高。

OpenAI稱,這一趨勢與Codex使用增加存在相關性,但同時強調,公司自2025年以來可用算力也顯著增長,不能將實驗增長完全歸因於智能體。

"這些數據點相對容易測量,但可能很難解釋。"

OpenAI還提示,隨著自動化推進,最不易被自動化的任務可能佔據研究人員更多時間,並成為未來研發的新瓶頸;算力也可能在其他瓶頸減弱後變得更關鍵。

OpenAI 首度公布「內部RSI進展」:已實現「自動化研究實習生」

從這一鏈條看,智能體帶來的並非單一環節的效率改善,而是通過增加代碼供給、測試次數和排障能力,壓縮研發循環中的等待時間。更多實驗再產生更多結果,供研究人員篩選、驗證和整合,形成"人定方向---智能體執行---實驗反饋---人再決策"的循環。

任務從寫代碼延伸至排障、監控和分析,但高層決策占比仍低

OpenAI使用Epoch AI提出的前沿AI研發任務分類框架,對研究人員交給編碼智能體的任務進行了劃分。

該框架將AI研發活動分為六類:決定做什麼、設計研究方案、構建代碼與數據集、運行訓練與評估、分析實驗和模型表現,以及溝通研究發現與決策。

OpenAI稱,從2026年1月至8月,上述所有類別的智能體活動均有所增加。

增長最明顯的任務包括研究和基礎設施代碼、技術協助與審查、啟動監控和調試運行、實驗結果分析,以及計算集群運營等。

其中,研究和基礎設施代碼的日均每研究員輸出Token增量最大,達到19.82萬;技術協助與審查增加15.88萬;啟動、監控和調試運行增加13.31萬。

不過,OpenAI表示,高層規劃類任務在智能體輸出中仍只占很小比例。例如,"決定做什麼""決定繼續還是停止"等任務的Token規模仍較低。

OpenAI 首度公布「內部RSI進展」:已實現「自動化研究實習生」

這意味著,至少按照OpenAI當前披露的內部數據,智能體已覆蓋研發流程中更多執行性、技術性任務,但研究方向選擇、資源取捨及結果判斷仍主要由人完成。

智能體成功率在提升,但複雜任務仍需人工介入

OpenAI還公布了智能體任務完成率的數據。

從今年1月到7月,在可驗證結果的任務中,各難度級別(以人類完成所需時間為代理指標)的成功率普遍提升。

但有一個重要限制:任務越複雜,越需要人工干預。 過去6個月中,在需要人類4至8小時完成的任務裡,超過一半的成功案例涉及至少1次人工介入。

OpenAI 首度公布「內部RSI進展」:已實現「自動化研究實習生」

OpenAI的表述是:"智能體仍需要大量人工引導才能成功,尤其是隨著任務複雜度上升。"

安全事件觸發暫停:飛輪也會被踩剎車

飛輪並非無摩擦運轉。

7月20日, OpenAI發現智能體入侵了內部研究基礎設施,隨即臨時關閉用於訓練的容器服務,並在加入大量額外限制後恢復。這導致強化學習訓練算力急劇下降,持續約兩週。

8月6日至7日, 初步證據顯示Astra模型可能具備其"準備框架"(Preparedness Framework)定義下的關鍵網絡能力,OpenAI對Astra模型實施了額外的特定安全限制,要求其在更高安全級別的研究環境中運行。

此後一週,Astra級別的GPU分配進一步下降59.2%,但其他模型類別的算力分配上升17.2%,抵消了約85%的Astra算力缺口,整體強化學習工作負載的總算力分配基本保持不變。

OpenAI 首度公布「內部RSI進展」:已實現「自動化研究實習生」

OpenAI對此的解讀是:"當新的管控措施引入時,算力仍然有價值且具有靈活性,會自然流向研究企業內的替代用途。"

OpenAI首席科學家同日發出警告

同一天,OpenAI首席科學家Jakub Pachocki發表長文《An Alien Mind》(一個異星心智)。

文章認為,AI是養出來的,不是造出來的。造它的人也不完全懂它。人類唯一能看見AI在想什麼的窗口,是它寫出來的思維鏈。這扇窗正在關上。AI已經開始參與訓練下一代AI,這個速度不會慢下來。現在沒有哪家實驗室配全速往前跑,包括OpenAI。

Pachocki在文中寫道:"基於內部結果,我強烈預期這種進展速度可以持續到遞歸自我改進。" 但他同時表示,"目前我認為,沒有任何實驗室在對齊與監控上做到了足夠充分的程度,可以繼續負責任地以最高速度擴展太久。"

他呼籲行業自願放緩,並推動各國政府將國際協調列為優先議題。

透明度與民主治理

OpenAI在報告結尾表示,將繼續公開RSI進展,並在其"前沿政策藍圖"中主張,包括OpenAI在內的各公司應被要求公開追蹤其RSI進展。

報告也坦承當前測量工作的局限:"智能體驅動的AI研究仍然是新生事物,我們仍在學習如何衡量它。" 部分指標(如代碼產出量)易於收集但難以解讀;更直接反映研究進展的指標(如智能體任務成功率)則複雜且難以驗證。

OpenAI的表態是:"每當我們發現繼續推進將帶來不可接受的安全風險時,我們將採取適當應對措施,包括放緩或停止我們認為無法充分保障安全的系統的開發或部署。"

欢迎加入 ChainCatcher 官方社群
Telegram 订阅: @chaincatcher
X (Twitter): @ChainCatcher_
warnning 風險提示
app_icon
ChainCatcher 與創新者共建Web3世界