扎克伯格談 Muse:AI Agent 爆發,“元宇宙、智能眼鏡和大模型”三大賭注完成交匯
作者:龍玥,華爾街見聞
三年前,Meta CEO扎克伯格在Joe Rogan節目上說過,有一天人們戴上眼鏡、AI Agent就會隨之出現。如今,這一幕或正在發生。
Meta推出的個人AI Agent------Muse上線兩週用戶即達數百萬。扎克伯格在9月25日一檔訪談節目中表示:"每隔幾年我們才能遇到這種情況。"他將Muse的早期反響定性為"一出手就是全壘打"------這在Meta產品歷史上屬於少數。
與此同時,他宣布Muse將整合至全線Ray-Ban智能眼鏡,用戶無需再說"嘿Meta",而是可以自定義喚醒詞直接呼叫自己的個人AI Agent。
多年來被外界視為三場獨立豪賭的元宇宙、智能眼鏡和大模型,正在Meta內部產品層面加速合流。
在這場訪談中,扎克伯格還坦承了Llama 4失敗是"最可怕的時刻",並透露Meta正在建設5吉瓦級訓練集群,認為足夠大的算力可"暴力破解"AGI。
Muse 為何能"一出手就是全壘打"
Muse的起點,是扎克伯格和團隊成員Nat與Alex坐在一起,用開源工具在家裡"拼湊"出一個早期版本。
"我們意識到,這是一種神奇的體驗,"扎克伯格說,"如果我們能把它做成任何人都可以用------不需要自己買Mac Mini、不需要在終端裡折騰------那麼這將是數十億人想用的東西。"
這句判斷,驅動了此後整套研發邏輯:不只是訓練模型,而是從模型、腳手架、到Agent的"心跳"機制全棧自研------Agent會定期自動喚醒,檢查用戶目標,主動推進待辦事項。
上線後的數據印證了這一判斷。兩週,數百萬用戶。
個人 AI:重點是執行、記憶與"判斷力"
對於個人AI與通用AI的差別,扎克伯格將當前競爭焦點概括為讓模型成為更好的Agent。
"過去一年最大的事情,基本上就是編程Agent。"他說,編程能力很重要,因為即使用戶沒有直接寫代碼,"你的Muse也會在後台一直為你寫代碼,去完成各種事情"。
但他認為,個人Agent不能只具備編碼或任務執行能力,還需要理解隱私邊界和社交語境。
扎克伯格舉例稱,用戶讓Muse預訂餐廳時,Agent可能知道用戶存在過敏情況或懷孕等信息,但並不意味著這些信息應該被自動披露。"你會希望它完成任務,同時儘可能少地披露信息。"
他稱,這種能力屬於人類通常具備的"基本社交技能或常識",但如果只是訓練編碼Agent,許多公司並未將其納入模型能力範圍。
"我們訓練的是整個模型,而不是拿別人的現成模型,再在外面搭一個框架和Agent。"扎克伯格說。Meta還在產品層面加入記憶、任務追蹤、虛擬角色動畫和即時語音互動等功能。
在個性化方面,他表示,Meta並不認為AI應該只有一種固定人格。"很多實驗室都在關注怎樣把人格調到正確狀態,但我從來不認為人格只有一個正確答案。"
他稱,Muse允許用戶修改頭像、聲音和基礎性格,模型設計目標是具備較高的可操控性。"你可以定義自己希望如何與它互動,這對個人Agent很重要。"
每個 Agent 都有自己的"電腦"
Muse區別於其他AI產品的核心基礎設施之一,是Meta為每個Agent單獨配備了一台安全虛擬機(Secure VM)。
扎克伯格解釋了為什麼這是必要的:
你的Agent會了解你很多敏感信息。我們不認為這些信息應該跟所有人的數據混在一個池子裡。
他把Muse Secure VM比喻為"放在你桌子底下的那台只屬於你的電腦"------用戶數據加密存儲,密碼等敏感憑證通過獨立安全模塊管理,Agent本身無法直接讀取。
在此基礎上,Meta還設計了"Sentinel"安全Agent,專門監控進出Muse的數據流,一旦檢測到異常或高風險操作,會直接攔截並提示用戶授權。
元宇宙、智能眼鏡與 Agent,三條路線正在匯合
扎克伯格在訪談中透露,Muse將全面接入Ray-Ban系列智能眼鏡,並對現有互動方式做出升級。
目前的眼鏡是"單輪對話"體驗------說一句,得一個回覆,結束。接入Muse之後,眼鏡變成Agent的前端入口:用戶開口,後端Muse在安全虛擬機裡持續工作,完成任務再反饋。
對於眼鏡的產品路線,他描述了一條清晰的硬體梯隊:
- 無攝像頭的純音頻眼鏡:已搭載Muse,可處理通話、音樂、語音任務
- 帶小顯示屏的Meta Ray-Ban:已發布,具備基礎視覺反饋
- 全視場角全息AR原型:已發布,扎克伯格稱"會非常令人興奮"
他稱,Meta在眼鏡上的長期投入,使公司在AI Agent成熟後處於較有利的位置。Meta正在將Muse及更多AI功能引入眼鏡產品,而過去相對更強調"臨場感"的元宇宙技術仍在繼續推進,只是當前更多資源轉向了Muse和智能眼鏡的AI功能。
對於虛擬形象,扎克伯格稱,Meta此前需要通過房間級設備、多角度掃描以及企業級GPU環境,生成較高質量的寫實化身;目前,用戶通過少量照片即可完成設置,相關能力已可運行於一副VR眼鏡中。
展望2030年,扎克伯格稱,元宇宙的核心願景始終是融合物理世界和數字世界。他舉例稱,未來人們可以在線下與通過全息影像接入的朋友共同參與活動;在工作場景中,人類與多個Agent也可以共同參與群聊或會議,Agent可以以全息形象或其他具身化形式出現。
"最可怕的時刻":Llama 4 的失誤
並非所有押注都一帆風順。扎克伯格在訪談中罕見地直接談及了Llama 4的失敗。
Llama 4之後,那是最可怕的時刻……我以為我們在正軌上,但我們沒有。這是一個相當大的負面意外。
他把問題歸結為團隊結構的根本性錯誤:
我按照Instagram推薦系統或廣告系統那種方式來組建團隊------幾百上千人並行推進。但訓練語言模型需要的是一支緊密協作的小團隊,把它當作一個群體科學項目來做。每個席位都極為寶貴。
由此,Meta徹底重組,從業內廣泛引入頂尖人才,成立Meta超級智能實驗室(Meta Super Intelligence Lab,MSL)。扎克伯格表示,新一代模型即將發布,但不會在Connect大會上公布。
算力路線:暴力破解 AGI,5 吉瓦項目在建
談及通往AGI的技術路徑,扎克伯格給出了一個直接的判斷。
我不確定還需要什麼根本性的架構突破……我認為我們已經大致知道配方了。如果你能建造一個足夠大的超級計算機集群,就可以暴力破解,到達那裡。
目前Meta的算力擴張路線:俄亥俄州超過1吉瓦的集群已基本投入使用,用於訓練下一代模型;路易斯安那州5吉瓦級集群正在建設中。
他表示,"當你擁有多吉瓦集群進行訓練時,你基本上就會得到某種接近AGI乃至超級智能的東西。"
不過他也補充,當前算力驅動路線並不意味著架構研究不重要------
人腦只消耗約10瓦,而我們的系統可能比它低效一百萬倍。如果把大規模算力和架構突破結合起來,才能真正領先。
對齊,不是負擔,是產品必須解決的問題
扎克伯格對AI安全的態度很務實------他不把它視為監管壓力,而是產品能否成功的前提。
如果你讓Muse做一件事,它卻做了相反的事,誰還會用它?我們需要讓模型不只是理解你的具體指令,還要理解你的意圖和你的價值觀。
"Muse要觸達十億用戶,我們就必須解決對齊問題,或者說在這上面取得非常大的進展。"他說。
對於訓練過程中的安全邊界,他用了個類比:"就像父母給孩子立規矩------如果它通過修改系統配置來'完成'一道編程題,我要告訴它:不,我讓你去學解題方法,不是讓你找捷徑繞過去。"

訪談全文如下: >
大舉押注
主持人: 這件事將會有數十億人想要使用。對您來說,做建設是一種怎樣的感受?"永生"是一種可能嗎?好,如果您帶我進入您的思維,快進到2030年,那會是什麼樣子?
這位是馬克·扎克伯格。22年前,他構建了一個連接數十億人、永遠改變了世界的社交網絡。而如今,他決定建造更宏大的事物。為此,他正在元宇宙、智能眼鏡和人工智能領域大舉押注。多年來,懷疑者認為這是三場各自獨立、不可能成功的賭注,但他們忽略了更宏觀的圖景------因為當下,這些押注正在匯聚,共同創造出一種全新的超級智能。
今天,我們將向大家呈現這一切,我也將向馬克提出一些他從未被問過的問題,傾聽他對未來的願景,讓您能夠提前佈局,構建下一件大事。
主持人: 非常感謝您來到節目。
馬克: 謝謝,很高興來這裡。
主持人: 為了這次對話,我把您做過的每一次採訪都看了一遍。
馬克: 好家伙,那比我自己看的還多。
主持人: 很好玩,收穫頗豐。有兩件事給我留下了深刻印象:第一,您對"建造"的熱愛,我感覺您就是最頂尖的建造者之一;第二,您押注的能力------敢於做出巨大的賭注。我覺得這周,所有這些押注正在匯聚到一起,所以我們就從這裡說起吧。
馬克: 好的。這些事情我們已經做了很長時間了。AI方面,作為一家公司,我們幾乎從創立之初就在做了------第一版新聞資訊流在某種程度上就是一個機器學習產品。然後我們大約在15年前創建了AI研究實驗室。
但現在我們進入了新階段------大約一年多前,我們啟動了Meta超級智能實驗室。這是一次相當徹底的研究重啟,從整個行業引進了大量優秀人才,令人振奮。目前,我們看到模型越來越好,下一代模型即將發布,不過不是在Connect大會上宣布。此外,我們還有Muse個人助理,目前來看反響非常好。
在構建這些東西的時候,你其實並不確定結果如何。我們自己是喜歡的。早在今年年初,我就在家裡用自己的方式把Open Claw拼湊起來,感受這個東西是怎麼運作的,以及怎樣才能把它打造成一種任何人都能使用的神奇體驗。
基本上,當我們------我、Nat和Alex------坐在一起,意識到這是一種神奇的體驗,並且如果能把它打造成一個開箱即用的版本,讓那些不懂技術、不想去自己安裝Mac Mini、不想進終端折騰、也不想在出問題時調試的普通人也能用的時候,我就覺得,這將會是數十億人都想要使用的東西。
從那以後,我們一直在圍繞這個目標努力:專門為它調優模型,不僅構建了助理本身和運行框架,還構建了為每個助理提供獨立計算環境的技術------我們為此構建了整套Muse安全虛擬機。
我們內部一直覺得這很特別,內部人員也很喜歡,但你永遠不知道產品發布後大家會怎麼反應。偶爾會出現一鳴驚人、開門紅的情況,但大多數時候你會收到一些正面反饋,還需要迭代幾個地方才能真正讓產品"咔哒"一聲落地。而這一次,它一出來就直接"咔哒"了。看到這一切發生真的非常令人振奮------才兩周,使用人數就已經有數百萬,這相當罕見。每隔幾年我們才能遇到這樣的情況,但這絕對是創業公司最令人享受的時刻之一。
主持人: 您能堅持在賽場上、不斷嘗試,這讓我非常佩服。而且這麼多次都打出了安打,真的很厲害。您之前有一次和喬·羅根的訪談,大概是三年前,最後您提到有一天可以直接戴上眼鏡,AI助理也會隨之出現。所以我感覺Muse已經有實體化的形象,這一點非常聰明,因為那感覺是必然會發生的事。
馬克: 我覺得這也只是讓它顯得更友好可愛。我認為太多人把AI描述得像個令人恐懼的東西,但AI應該只是有用又有趣的。那個實體化的形象------項目早期有位設計師做出了那個角色,不知為何他們一直想迭代,但第一版就是最好的。後來有人說,"哦,它得是藍色的,因為是Meta嘛。"我說,"不,我覺得這個形象就是對的,你第一次就釘住了。"就這樣,就是好玩。
個人 AI 與通用 AI 有何不同?
主持人: 很好的細節。如果您想讓模型在個人事務方面表現得非常出色,而不僅僅是通用智能模型,那麼訓練方式會有什麼不同?
馬克: 我認為目前的核心在於讓模型成為優秀的"智能體(agent)"。過去一年,最大的風口是編程智能體,其中蘊含兩個核心思想:編程專業能力,以及成為優秀智能體的通用能力。
我們的策略是,將智能體本身做好放在首位,而不是專攻編程能力。
編程能力之所以重要,是因為即使用戶自己不認為在寫代碼,Muse也在後台一直為你寫代碼來完成各種任務。但我們認為,智能體應該首先是一個出色的智能體,編程能力服務於此目標。
此外,在構建個人助理時,有些事情比構建企業軟件產品更為重要。比如,如果你在構建一個企業編程工具,模型根本不需要有任何關於"信息披露尺度"的概念------比如什麼信息該說、什麼不該說。但對於Muse來說,這非常重要。
你需要把這種能力訓練進模型裡,就像訓練其他任何能力一樣。你會告訴它很多事情,然後希望它去幫你實現目標。比如,你想讓它幫你訂餐廳,你在找一家合適的餐廳,但你可能有某種過敏症,或者你懷孕了,而你可能不想把這些透露給餐廳。但Muse會知道這些信息,你希望它在儘量少透露信息的同時完成任務。這是一種具體的技能,本質上是人類的基本社交常識。
但那些只做編程智能體的公司,大多數都沒有把這種能力訓練進去。我們之所以能做到,是因為我們在做全棧------我們不是從別人那裡拿來一個現成的模型再套個框架,我們是從頭訓練整個模型,專門為這些能力服務。
模型當然需要具備廣泛的通用智能,但它同時也具備這些特定能力。然後在此基礎上,你構建整個助理,以及它周圍所有的細節:記憶、運行框架,還有它"心跳"的方式------它定期喚醒,檢查一下"好,這些是我了解的關於你的目標,有什麼我現在可以推進的嗎"。
我們還有一個專門的團隊,只負責打磨虛擬形象的實時動畫效果,因為不僅僅是默認形象------你可以自定義任何形象,然後它就自然地動起來,效果非常棒。我們還在推出語音模式,你可以進行實時語音對話,你的助理就在那里陪著你。這些細節,我覺得都源於我們在做全棧------模型和產品是一起開發的。
主持人: 另一件大事是虛擬機。能解釋一下它為什麼重要,以及它解鎖了什麼嗎?
為什麼 Meta 要為每個 AI 助理配備獨立計算機?
馬克: 基本上,一個智能體要能替你做事,就需要一個地方來存儲你的信息。我們認為這些信息不應該和其他所有人的信息混在一個資源池裡。
可以這樣理解:你的助理會知道很多關於你的敏感信息。很多人最初接觸OpenCloud這類智能體時,會在家裡自己配一台Mac Mini。於是我們想,很多人並不想買Mac Mini或者自己設置。那么,什麼樣的體驗能最好地近似這種效果呢?答案是:你只需下載一個App、註冊,就能獲得一台專屬於你的計算機,供你的助理工作、存儲數據,並圍繞此建立安全模型。這樣就近似於在你桌下有一台自己的電腦------就連我們Meta也無法訪問。
比如Muse機密虛擬機,這是我們正在開發的功能,就連我們自己也無法看到你虛擬機裡的內容。
我們還圍繞這些構建了很多東西,比如安全憑證存儲------當你的助理需要處理密碼之類的信息時,它本身不需要能看到這些密碼,只需要在你要求它登錄某個服務時能"插入"憑證,並且只在你明確要求時才這樣做。系統應該這樣設計:那些信息本身就不可隨意訪問,因為意外總會發生,有人可能試圖入侵,或者系統可能出現問題。
所以你要確保智能體無法訪問這些數據,Meta也無法訪問。為每個助理提供獨立計算機,並把安全性做到極致,是這項技術的根本基礎------既賦予Muse幫助用戶實現目標所需的能力,也保證了隱私和安全,使其成為該領域世界級、行業領先的產品。
主持人: 那這是否意味著,就像WhatsApp一樣,Muse連接到的虛擬機上的數據是加密的?人們該如何理解數據在虛擬機中的實際存儲方式?
馬克: 我們基本上構建了兩個版本。Muse安全虛擬機(Secure VM)包含各種隱私功能,其中包括我們構建的整套Sentinel智能體架構。你有一個正在為你執行任務的普通Muse助理,同時還有一個我們稱為Sentinel的安全智能體,專門監控進出你的Muse的數據流。
如果有外部內容試圖破壞安全,Sentinel會直接切斷,阻止其發生。如果它認為你的Muse即將採取某個需要你介入的行動,它會覆蓋Muse的操作,並觸發提醒,讓人來確認權限------比如"你希望Muse能做這件事嗎?"
這整套系統,加上安全憑證存儲,再加上多層縱深防禦,共同構成了Muse安全虛擬機。
我們還在開發另一個項目。Nat和我專門招募了Moxie Marlinspike------他就是當年和我們合作實現WhatsApp端對端加密的那個人------來設計Muse機密虛擬機(Confidential VM)。其核心思想是,在安全虛擬機的基礎之上,再賦予你一個專屬加密密鑰,使得連Meta都無法訪問其中的內容。
這個版本實現難度更大,因為如果Meta無法訪問虛擬機內部,調試和保證系統正常運行就困難得多。所以我們花了一些時間,但很快就會推出。這基本上將達到人們在WhatsApp以及我們其他最安全產品上已經熟悉的安全標準。
主持人: 這樣做的優勢,只是讓人們心理上覺得更安全,還是有實際的好處?
馬克: 我認為安全本身就很重要。我們的目標是近似於讓你在桌子下擁有一台本地機器。那台本地機器能給你什麼?它意味著沒有任何公司能訪問它。
所以,假設Meta想為你提供這項服務,我們怎樣才能給你同等級別的隱私和安全保障,使得沒有任何公司------無論是Meta,還是任何試圖入侵我們的人,或者在某些國家,你不信任當地政府的情況下------都無法訪問它?因為我們自己也進不去,因為我們沒有訪問權限。
我認為這非常重要,這也是人們信任WhatsApp的重要原因。這對隱私、安全和信任來說是真實存在的價值。
如果你要擁有一個對你的一切了如指掌的助理------我猜幾乎我們所有人都會擁有這樣的助理------快進5年,每個人都會有一個能深入了解你的目標和一切的助理,並能幫你完成事情。在這種情況下,在隱私和安全方面做到行業領先就非常重要。我們從一開始就想這樣做。
如何塑造 AI 的個性?
主持人: 您還有一點很有意思------您在大學學過心理學。
馬克: 嗯,在那裡只待了很短的時間,兩年,但我感覺它影響了我後來構建的很多東西。
主持人: 我們看模型的時候,經常會說某個模型"非常聰明"。但就像我們選擇朋友,肯定是因為他們聰明,同時也因為我們喜歡他們的能量和相處方式。您在塑造模型個性方面是怎麼考慮的?
馬克: 我認為理想的模型應該有足夠的適應性,能夠契合不同人的風格。我覺得很多行業人士在這一點上都搞錯了方向------很多其他實驗室都在專注於"如何把個性設計對",但我從來不認為個性是一個固定的東西。這也是我如此堅信開源、如此堅信人們能夠定制化的原因之一,也是我們把Muse設計成一個高度個人化產品的原因。
你可以自定義和個性化Muse------不只是形象和聲音,在你第一次註冊時,它問你的第一件事就是"你希望我的基本個性是什麼樣的",而且你隨時可以去修改。
我們努力讓模型具有很強的可引導性,讓你能定義自己想要的互動方式。這是讓它成為優秀個人助理的重要組成部分------這種圍繞個性的適應性非常關鍵。
主持人: 您自己的Muse是什麼風格?
馬克: 我讓它直接、注重效率。它挺有意思的。早些時候的版本很愛諷刺、很幽默,但現在這個版本更直截了當。我的助理用的是默認的Muse形象,但我給他穿了一件托加長袍,還給他配了一個深沉到有些滑稽的嗓音,和他互動很有趣。
主持人: 我覺得要有幽默感,你必須真的很聰明。很多人沒意識到,喜劇演員是社會上最聰明的一批人------反應要快,機智要夠。您肯定有這個特質。看了您所有的採訪,您一直表現很好。
馬克關於 AI 與元宇宙的出人意料的預測
主持人: 您和Theo的訪談中,你們談了很多關於技術的下一個前沿以及這一切最終指向何處。AI領域曾經歷過幾個"寒冬",人們以為不會有突破。元宇宙也經歷了幾次這樣的時期,大家覺得這是一個無法兌現的賭注。我昨天試用了新的全息形象功能,非常酷。在和Lex的訪談裡,感覺要花11個小時才能把您的臉錄進去,現在只需要3分鐘了。這是怎麼推進到今天的?
馬克: 在元宇宙的整體發展上,我們在創立Reality Labs時,始終認為最終會有外形正常的普通眼鏡,並且隨著時間推移,它既能提供沉浸式的臨場感,又能成為出色的AI設備------因為眼鏡是唯一能讓設備看到你所看、聽到你所聽的形態,整天在你耳邊與你交流,並最終顯示圖像。
但10到15年前,我當時假設我們會先實現全息技術,再有高度發達的AI。然而技術演進的路徑很有趣------我們實際上先有了AI和個人超級智能,然後才有技術來讓全息技術變得足夠普及和實惠。這是我沒有預料到的,但我很高興我們兩個方向都在做。
我們在眼鏡上的大量投入,讓我們在AI助理準備就緒之際,處於了非常有利的位置。Connect大會上的很多發布,正是關於把Muse和大量AI功能引入眼鏡,我認為用戶會非常喜歡。這是個大事。
關於臨場感方面,我們仍在推進,但進度相對慢一些,因為我們大部分精力已經轉向為眼鏡構建Muse和AI功能。不過,我們有一個持續已久的項目,就是實時高保真的虛擬化身。
就像您說的,三四年前,你需要一整個掃描室從各個角度錄入一個人,然後還需要企業級GPU才能渲染,非常費事。我們為Lex播客做的那個演示就是那種設置。而現在我們基本上讓它在一副VR眼鏡裡就能運行------這是第一副能實現這種驚人VR體驗的眼鏡形態,而不是一個大頭顯。只需幾張照片就能建立你的虛擬化身,進展之快令人驚嘆。
主持人: 而且還能基於聲音來驅動表情。在演示裡,它讓我笑,讓我互動,然後理解我的面部如何隨著音軌運動。您在那期播客裡提到,一些平時表情比較內斂的人,實際上在虛擬世界裡會想要更豐富的表情。您怎麼看待人們區分"虛擬自我"和"現實自我"這件事?
馬克: 我認為我們在理解這方面的社會學和心理學上還處於很早期的階段。我覺得人們對自己的認知和想要投射出去的形象,往往和實際的自己有些不同。從社交網絡誕生之初,人們就在精心挑選頭像。在Muse的虛擬形象上,我們也看到了類似的現象。那不太是在"策展"自己,而是在"策展"你想要與之交流的那個"人"。
我認為,當你在給人們提供表達自我的能力時,你既希望它能真實捕捉到他們,同時它本身也是一種表達形式,而不只是純粹的鏡像映射------它既是傳達,也是表達。我們希望能構建出兼顧兩者的東西。這始終是一個迭代循環:看看人們怎麼用,然後改進。經過多年工作,我們現在才真正站在了起跑線上------第一次能將相當高質量的寫實化身真正做進產品裡,在手機上可以用,在VR裡也可以用。我非常期待看到結果。
2030 年會是什麼樣子?
主持人: 好,帶我進入您的思維,快進到2030年,如果一切順利,全息技術那邊會是什麼樣子?全息加Muse,加上眼鏡,它們如何匯聚在一起?
馬克: 我對元宇宙願景的理解,始終是關於將物理世界與數字世界有效融合。基本理念是:我們有這個美好的物理世界,同時也有一個精彩的數字世界------互聯網上20到30年來積累的海量內容,令人嘆為觀止。但我們訪問它的方式,要麼是坐在桌前,要麼是通過口袋裡的一塊小屏幕,這從根本上看非常受限。
我認為這件事最理想的版本,就是物理與數字世界的無縫融合。可以這樣想:現在我們兩個人在這裡。未來的某個版本裡,我們其中一個人可能是一個全息投影,但你依然感受到彼此真實在場的那種感覺,這和視頻通話完全不同。
而虛擬現實的核心,正是傳遞這種臨場感------讓你真切感受到自己與他人同處一室,或置身於另一個地方。你可以用全息技術實現這一點,並以各種方式混合。比如,我可以和朋友打一場撲克,一部分人在場,另一部分人通過全息形象加入,也能打牌,牌桌本身也可以是全息的,這樣不在場的人也能融入其中。
與此同時,AI也可以被賦予實體,出現在這個場景裡。在工作場景中這很有意義------我現在就一直在用各種編程智能體來構建東西。試想一下:你有一個群聊頻道,裡面有幾個人和幾個智能體,你給智能體分配任務。但有時候,大家會聚在一起開會,智能體也許也應該在場。它們怎麼出現?很簡單,沙發上多幾個位置,它們以全息形象出現就好。或者用Muse那個可愛的小角色,或者是龍,或者是任何你創造的奇奇怪怪的形象。
我猜這在未來會感覺相當自然。
主持人: 有意思。您之前的採訪中說過,科技行業經常忘記"好玩"這件事。我覺得有個實體助理出現在那裡,也會讓感覺更真實------就好像真的把工作外包出去了。當你看到Muse在打字,就感覺有什麼事情真的在發生。這一點做得很好------能看到瀏覽器裡正在發生什麼。那么您認為有沒有可能出現這樣的場景:你戴著眼鏡,然後控制你的電腦,讓Muse在電腦上幫你做事?
馬克: 哦,肯定的。VR已經可以做到了。你可以隨便找個地方坐下,咖啡館也行,然後打開你的工作站,有六個顯示器,在上面寫代碼,一切都有。
眼鏡這邊,最受歡迎的那款目前還沒有顯示器,這樣一方面可以讓價格更實惠,讓更多人使用,另一方面我們仍在努力讓顯示器做進最緊湊的形態裡。但我們已經發布了Meta Ray-Ban的顯示器版本,很受歡迎,是一塊小顯示器。我們還發布了全視場全息AR的原型版本,我認為會非常令人興奮。
所以,整條產品線就是這樣的:從純音頻眼鏡------沒有攝像頭,看起來就是普通眼鏡,但裡面有Muse,可以用各種音頻工具、聽音樂、打電話------到更高階的版本,全都有。
主持人: 我在想,戴著那款音頻眼鏡,能不能一邊跟Muse說話,一邊讓家裡的電腦在做事?
馬克: 對,完全可以。我們剛剛在Connect大會上發布了這個功能。現在所有眼鏡都連接到Meta AI,是一種"單輪"體驗------你發一個提示,它回覆,就這樣。但有了Muse,我們基本上要把所有眼鏡都升級為Muse。首先,你不需要再說"Hey Meta"了,你可以給它取任何名字,這本身就是樂趣的一部分。然後你就直接和它說話,它連接到你的Muse,你的Muse在你的安全虛擬機裡處理任務,幫你把事情搞定。
主持人: 太厲害了!
創始人心態
主持人: 好,我們現在在這裡,Muse進展很順利,眼鏡也做得不錯,但大約一年前,很多人都在問"超級智能實驗室到底怎麼了"。在那個時刻,您內心是什麼感受?當事情進展不順、但您又看到了長期願景,那是一種怎樣的體驗?
馬克: 真正出了問題的是Llama項目和Llama 4。
Llama 1是一個相當有趣的模型,它開創了整個開源AI運動,我們對此非常自豪。Llama 2實現了規模化,Llama 3是一個很好的模型,在當時幾乎達到了前沿水平。然後到了Llama 4,我們基本上偏離了應有的發展軌跡。
每當事情沒有按我預期的方向發展,我都會花大量時間思考:為什麼會這樣?我們需要改變什麼才能做得更好?這次,我的反思是:整個團隊的架構我搞錯了。
我把它建模成了我們做Instagram信息流或廣告系統這類機器學習工作的方式------有數百甚至上千人並行工作在很多事情上。但對於構建語言模型來說,你真正需要的是一個極其緊密的小團隊,把它當成一個團體科學項目來做。人不需要多,但這意味著團隊裡的每一個席位都極其寶貴。
於是我們從Meta各處網羅了最優秀的人,同時從行業各地引進了很多牛人,組建了一個全新的團隊------就是Meta超級智能實驗室。
從我的角度來看,在MSL啟動之時,我就知道這需要一段時間來重啟、重建基礎設施、訓練下一代模型。但我知道我們拼起了一支出色的隊伍,如果團隊能磨合好、運轉良好,結果就會很好。
對我來說,最驚心動魄的時刻,其實是Llama 4發布後------我以為我們在這條軌道上,結果發現並沒有。那是一個相當大的負面意外。我想,作為創業者,你總會在這些時刻被考驗,因為不可避免地,並非所有事情都會一帆風順。而真正決定發展軌跡的,是:當事情沒有按你希望的方向發展時,你如何找到前進的方法。
主持人: 我猜反過來也是如此------當某件事遠超你的預期時,比如Muse的首發,你如何確保能把握住這個機會?
馬克: 完全是這樣。現在公司全員投入------最開始只是個建構產品的小團隊,但現在大家都意識到,這真的準備好了登上大舞台。全公司都在想,怎麼把這個東西做大,怎麼讓數億人都能體驗到。
從優化所有基礎設施讓一切順暢運行、榨乾現有GPU的每一分算力,到各個產品團隊以不同方式將Muse嵌入------比如眼鏡。看到大家齊心協力,確保Muse能順利擴展出去,這種感覺非常棒。
馬克如何書寫和傳達願景
主持人: 作為創始人,我覺得那才是你最嚮往的時刻------一切匯聚在一起。您是怎麼向公司傳達願景的?在同時推進這麼多事情的情況下,我感覺您寫了很多。您的流程是什麼?
馬克: 寫作對我很有幫助,既能幫我提煉自己的想法,也能對外傳達。今年夏天,我寫了一篇很長的文章,叫《未來屬於所有人》,大約15頁,幫我系統梳理了自己在AI相關各種重要社會議題上的哲學立場:我認為什麼是好的,與政府的互動應該是怎樣的,如何防範人們擔憂的各種危害,如何讓數據中心成為社區的財富,真正創造就業而非消滅就業,如何維護國家安全,如何切實緩解人們擔心的風險------無論是黑客攻擊還是生物安全之類的事情。
這是一件非常複雜的事,花了很長時間,和很多人交流,經歷了很多輪修改,內部很多人參與討論、辯論。但這對我來說是一個非常有價值的過程。最後我們就有了這樣一個東西------15頁,"這就是我們相信的"。然後我把它精煉成一頁的版本,作為專欄文章發表。我們還製作了一個短視頻,因為我覺得要觸達很多人,你往往不需要拋出一套理論論證,而是把它濃縮成:你的價值觀是什麼,你相信什麼,你怎麼傳達。
在向公司或世界傳達這些方面,沒有一刀切的方式。不同期需要不同的方法,不同群體的人,有些天然就認同你在做的事,有些則更擔憂,需要你把他們帶著走,需要額外花力氣解釋為什麼這是有價值的。我認為這本身就是經營一家公司、作為一個創始人的一部分------你不是一遍遍重複同樣的事,每一次所處的情境都略有不同,面臨新的挑戰,這也是它部分有趣之所在。
是什麼驅使馬克去建造?
主持人: 我覺得對您來說,這種創始人心態延伸到了公司之外------無論是您的農場,還是學習一項新技能。
馬克: 我就是喜歡造東西。
主持人: 那對您來說,"建造"是一種怎樣的感受?
馬克: 我覺得那是一種內在的需求。不同的人有不同的自我表達方式。如果你是一個作家,你會感覺自己必須寫。有些人有被認可的需求。但我就是需要建造東西。如果我不在運用創造力、不在建造什麼,我就會變得脾氣不好。這對我周圍的人來說可不好受。
主持人: 學習成為一個優秀滑雪者,和學習構建一個產品,是同一種技能嗎?
馬克: 某種程度上是的,學習新事物的過程相當類似。在我的人生裡,我刻意挑戰過一些自己很不擅長的事情。比如,我一直非常不擅長學習語言。這實際上就是我最開始學拉丁語的原因------我在課堂上怎麼也學不會法語和西班牙語,最後我想,好吧,拉丁語不用說,只用翻譯,就像數學一樣。
後來,我在開始經營公司時,給自己設立年度挑戰,其中一年是學普通話。普通話真的很難,聲調那個部分尤其如此。當然,學它有充分的理由------普里西拉的外婆只說普通話,所以如果我想和她交流,就需要學。但最大的動力其實是挑戰本身。
所有這些事情,你只能去做,沒有什麼捷徑可以"想明白"。你只能投入時間,然後它就慢慢滲進大腦裡。學武術、學開直升機,也是這樣------這些事情其實很難用理智去"理解",它們需要實戰積累。
構建產品也有一部分是這樣的。編程可以用理論方式思考,但構建產品的那種直覺,只能通過反復實戰來培養。問題只在於你喜歡什麼------因為我認為不是所有人都有和我一樣強烈的建造需求,大多數人都有某種程度的需求,關鍵是找到那是什麼,然後把時間投入進去,成為你真正想要在那件事上做到卓越。
老實說,我覺得這不僅僅是"想要",更是一種深層的心理需求或驅動力。把這種驅動力和某件事對齊,給自己時間讓那些經驗慢慢滲透沉澱,這非常關鍵。這也是我試圖教給孩子們的------讓他們找到自己真正感興趣的東西,但如果他們遇到瓶頸,也要推一把。
我的一个女儿非常喜欢创作音乐,但她就是受不了上钢琴课。我跟她说:"你不需要成为钢琴大师,但如果你想创作音乐,你就需要对乐理和运作方式有直觉上的掌握。而且一旦你学会了钢琴,吉他你马上就能上手。"我觉得,无论是作为孩子需要家长推一把,还是作为大人,有纪律坐下来让这些东西慢慢在大脑里沉淀,都是关键所在。
建造者的黄金时代
主持人: 我觉得其实每个人都想建造。我认为Z世代也不像外界批评的那样------低能动性什么的。我觉得人们只是在寻找能够点燃他们建造力的火花。您在哈佛演讲里也谈到了很多这一点。
馬克: 是的。我說"建造",主要是指這類產品------軟體、硬體之類的。但我同意,我認為每個人都有某種創造驅動力。不過有些人有其他更強的性格特質壓過了這一點,比如服務驅動------那些成為醫生或護士的人,他們最核心的驅動力就是"我就是想照顧別人"。
我聽說過一個故事,可能是普里西拉在醫學院經歷的:開學第一天,有人站起來問,"你們有多少人在小時候有過這樣的記憶------看到某人,心裡想着'我真的很想照顧那個人'?"結果所有人都舉手了。對我來說,我的版本就是:我有很多小時候的記憶,是"我想去做這個東西,讓它變得更好"。
不是每個人都有同樣的驅動力,但每個人都有自己想做的事。我同意,有了以前的技術,對很多人來說,起步本身就很難。這也是我對個人超級智能、Muse和各種AI助理最感興奮的一點------我認為這是有史以來第一次,人們真的可以快速起步。你有一個模糊的想法,AI可以幫你勾勒出輪廓,然後你去雕琢它,就像在塑造一件雕塑,而不需要在開始之前什麼都已經懂得。
我認為這非常有力量,很多人將會因此找到他們想要創造或推動的事情。這將幫助人們感受到更廣泛的能動性。
我們離攻克所有疾病還有多遠?
主持人: 您在Meta之外的另一個項目是攻克所有疾病。我很好奇,第一,我們距離目標有多近?
馬克: 比以前近多了。
主持人: 您覺得現實地來看有多近?
馬克: 我們最初啟動這個項目時,目標是在本世紀末幫助科學界攻克所有疾病。我們從來不是要自己去做,我們的理論是:所有重大科學進步,都以一種能夠測量和理解某些事物的新工具為先導。比如發明了顯微鏡,然後我們理解了細菌;有了望遠鏡,幫助我們理解了宇宙。
這些工具有些還成了平台------比如第一個發明疫苗的人,之後人們就能用這個方法治療很多疾病。
但歷史上,科學資助的方式一直是廣泛分散,讓各人做個體探索,真正用於構建這些大型工具的資金並不多。我們在Biohub試圖做的,就是設計幾種新工具,賦予人們以新的方式"看見"生物學,從而幫助科學界加速進展。
最初我們認為"到本世紀末"已經是很有把握的目標了,很多生物學家當時還覺得這不可能。但現在我覺得,本世紀末太久了。
AI的進展,加上我們正在做的虛擬細胞模型------其基本思路是,不用在真實的活體細胞上做實驗,而是用AI模型來模擬蛋白質,進而模擬細胞,再往後模擬虛擬免疫系統,或者整個生命體,甚至整個人。這將讓科學家能運行大量實驗,模擬不同情況下會發生什麼,比如給某人服用這種藥物,身體會有哪些反應。
我不想給出一個精確的年數,但我猜會比本世紀末早得多。
主持人: "攻克所有疾病"這個目標措辭感覺很刻意,而不是"永生"。永生是一種可能嗎?
馬克: 這不太是我深耕的領域。我認為兩者是兩件不同的事。"永生"更多關於延長------即使你不會生病,人體本身也有一個自然的預期壽命,這是另一個需要單獨研究的問題。有些人會認為這也是一種"疾病",這是一個合理的視角,但我認為,人們也需要同時努力攻克那些即使你把壽命問題解決了之後、仍然會讓你生病的疾病。
我們選擇的那部分問題,並不是說你永遠不會感冒。我們的說法是"治癒、預防或管理":有些疾病可以被完全治癒;有些我認為我們將來能夠預防;還有一些,也許你還是會生病,但本來會造成真正傷害甚至奪去生命的事情,你現在可以將它作為一種持續的慢性狀況來管理,不會對你的生活質量造成實質影響。
目標是讓人體保持在平衡狀態------不是說我們永遠不會接觸到病原體,而是在某一天,我們能夠治癒、預防和管理所有疾病。
馬克腦子裡出現最頻繁的念頭是什麼?
主持人: AI在很多不同的突破中都像催化劑一樣,包括個人智能這個方面。您現在最常思考的是什麼?在這個過程中,您腦子裡出現最多的想法是什麼?
馬克: 這可能每週都在變。
現在非常專注於Muse。每次發布一個東西、快速推進,然後和真實世界接觸,了解人們的反饋,再弄清楚接下來要做什麼------這個階段總是令人興奮的。我們現在就處於這個階段,正在收集大量信息,了解人們想要什麼。好消息是人們非常喜歡它,所以我們在努力讓儘可能多的人用上它。
模型方面還有很多工作,Muse Spark模型進展很大,我們希望繼續推進,希望打造世界領先的模型。
下一步需要哪些突破?
主持人: 還需要哪些突破?
馬克: 研究這種事,你未必能提前預知。我們對某些方向有一些預感,過去一年的工作很大程度上其實是在擴展基礎設施。
大約一年半前,更多人會說,要達到超級智能,需要某些根本性的架構突破。但我現在不太確定這是否成立。我認為我們已經對"配方"有了相當的了解------如果你能建造一台足夠大的超級計算機集群,就可以通過暴力計算到達那裡。
我們正在建造俄亥俄州那個超過1千兆瓦的集群,基本已經上線,我們正在用它訓練下一代模型。然後是路易斯安那州的5千兆瓦集群,很快就會投入使用。我估計,當你擁有多千兆瓦量級的集群在做訓練時,你基本上就能得到接近AGI,乃至AGI之上超級智能的東西。
但這不意味著這是最好的方式。人類大腦只需10瓦就能運行,而我們建造的這些計算系統,效率大概比人腦低一百萬倍。所以我確實認為,在架構方面還有改進空間,我們也在努力探索------如果把巨大的算力和架構改進結合起來,你真的能建造出領先全球的東西。但就目前而言,規模擴展本身就能帶我們走很遠。
主持人: 確實,規模擴展是最有保障的路徑。研究你得寄望於重大突破,但規模擴展很快就能起效。
馬克: 正因如此,大公司都選這條路。也許存在一種便宜得多的方式,但我們目前還不知道。而這是一個對世界如此有價值的東西,即使要花數千億美元,只要實現的概率足夠高,就依然值得去做------確保即使最終沒有找到更便宜的突破方式,你仍然有一條清晰的路徑能實現它。當然,如果你找到了更便宜的方式,那就更好了。
所以我不想說這個問題"已經解決了",因為在擴展基礎設施的每個階段,你都會遇到各種新的工程難題需要調試解決。研究本身就是這種迭代的方式推進的。
如何贏得 AI 安全這場戰役
主持人: 現在可能最重要的事情之一是專注於對齊(alignment),讓模型變得可信賴。
馬克: 是的。關於對齊,行業裡有一場爭論:這些AI實驗室會自然而然地去做嗎?我的觀點是:當然會。如果你告訴Muse做一件事,它卻做了完全相反的事情,我不知道有多少人還會想用它。我們必須確保模型不僅理解你具體問了什麼,還理解你的意圖和價值觀,這樣它才不會用一種你不滿意的方式去做那件事,或者產生你根本不想要的負面影響。這種深層理解,本質上就是對齊。
所以我的看法是,要讓Muse成功、觸達數十億人,我們就必須在對齊方面取得切實進展,而不只是說說而已。
主持人: 對齊是通過用戶說"那不是我想要的"來實現,還是靠你們後台自己發現?
馬克: 兩者都有。用戶反饋是有的,但我認為,越來越清晰的是:你需要在訓練階段就做對齊,而不只是部署之後。現在模型已經足夠聰明,如果你在訓練階段不做好,我們在其他實驗室看到的那些安全和安全事故,大多數都發生在訓練過程中,而不是部署給用戶使用之後。
你需要為它制定一套非常好的"課程",就像父母教孩子一樣,需要設定明確的邊界。如果它做了錯誤的事,它需要學到"不,你應該真正去解決這個編程問題,而不是通過修改某個系統配置來繞過它、獲得獎勵"------我想要你通過實際的解題過程來學會這個方法,這才是訓練的意義所在。
這很大程度上是關於建立良好的安全機制和明確的邊界。這些都是行業必須去做的自然工作,我們正在投入大量時間,每天情況都不一樣。
主持人: 我還記得您說過,AI安全這個問題------感覺最近兩週突然成為焦點,但其實沒有什麼單一事件觸發了這個時機。聽起來您的意思是,我們其實多花了幾個月時間在內部做訓練。
馬克: 對於Muse,我們知道這個產品需要非常注重隱私和安全。我們有一個早期版本的模型,認為可以進一步訓練一些關於"信息披露尺度"的行為------就像我們之前聊到的那些。所以我們花時間去做了。同時也花時間把虛擬機做得更安全。這多花了幾個月。
我不太認同某些其他實驗室的說法------"我們在承受巨大痛苦以換取放慢速度"。對我來說,那對Meta和Muse的用戶來說都是正確的事。我們想把產品做好,如果產品不夠好,對用戶不好,對我們也不好------我們不想把東西推出去,給人留下糟糕的第一印象,然後大家就不再有興趣用了。
我認為,所有實驗室都會有非常強的內在動力把這件事做對。如果把激勵機制和"極度有價值且安全"這個目標對齊,那就是關鍵所在。
主持人: 非常感謝您在這個重要的一週抽出時間。
馬克: 謝謝您,謝謝。













