- 我科學家為人工智能打造“通用大腦”
- 2026年02月10日來源:光明日報
提要:日前,一項由北京智源人工智能研究院主導的重要科研突破在國際學術期刊《自然》發表,為實現真正“看得清、想得通、做得穩”的通用人工智能指明了新方向。這也是我國科研機構主導的大模型原創成果首次在《自然》正刊發表。
你也許用過智能助手聊天,也見過人工智能(AI)生成精美圖像,看過機器人跳舞……但你是否想過,驅動“聊天”“畫畫”“運動”的,究竟是三套獨立的系統,還是同一個“智能大腦”的三種功能?日前,一項由北京智源人工智能研究院主導的重要科研突破在國際學術期刊《自然》發表,為實現真正“看得清、想得通、做得穩”的通用人工智能指明了新方向。這也是我國科研機構主導的大模型原創成果首次在《自然》正刊發表。
論文主要作者、北京智源人工智能研究院理事長、北京大學教授黃鐵軍指出,這項研究的核心思想非常簡潔:以統一架構,讓AI學會“接龍”。“無論是閱讀文字、欣賞圖片,還是觀看視頻、生成動作,在我們新開發的智源Emu模型的‘眼’里,都被轉換成一套‘數字積木’。模型的任務,就是像我們玩歌詞接龍游戲那樣,始終預測‘下一塊積木’應該如何出現。”
“這一思路有跡可循。早在2018年,美國OpenAI公司便基于‘預測下一詞’的路線訓練GPT模型,并于2022年推出ChatGPT,實現了語言大模型重大突破。”黃鐵軍團隊推測,“預測下一詞”的架構或許不僅適用于語言,也能拓展至多種模態,將圖像、文本和視頻數據在同一架構下統一訓練,從而開發出“一腦多能”的多模態大模型。
團隊成員介紹,此前全球范圍內出現的此類模型,大多采用“專用工具組合”方式:理解語言與圖片、生成圖片與視頻,均由各自獨立的模型或工具各司其職。這類分工模式雖目的明確,但協同成本也隨之增加。能否訓練一個“通才”,采用統一架構處理各類數據、掌握多種技能?研究團隊的Emu3模型給出了肯定答案。
Emu3就是這樣一個“通才”型AI:當你給它一段文字描述時,它可以生成細節豐富、結構合理的圖像;當你給它一張照片及相關問題時,它又能結合視覺信息與常識,進行精準的圖像問答與理解;更進一步,它還能生成連續的視頻片段——只需給出一個開頭,模型便能一幀一幀地輸出后續畫面,甚至還能像連環畫那樣,為每段畫面配上文字描述。
在升級版Emu3.5中,研究團隊通過引入大規模長時序視頻訓練,使模型從“預測下一個詞元”拓展到“預測下一個狀態”,開始學習世界隨時間演化的統計規律,為邁向更完整的“世界模型”探索了可行路徑。
黃鐵軍表示,這意味著,多模態模型分離的“理解”和“生成”兩類能力,首次在同一種簡單而統一的建模范式下被系統性打通。
這把“統一建模”的鑰匙,其潛力并不止于多模態內容生成。它可以延伸到物理世界,為機器人操作提供可行的動作序列設想,還可以解讀腦信號等各種復雜數據。黃鐵軍介紹,“預測下一個”這一看似樸素的思想,本身蘊含著構建通用智能的基因。《自然》編輯評價,智源Emu3這一成果對構建可擴展、統一的多模態智能系統具有重要意義。
黃鐵軍表示,這項成果證實了生成式人工智能技術路線的普適性:人類已經掌握了讓不同智能在同一體系內涌現的方式,正穩步走上通用人工智能持續演進的道路。
版權及免責聲明:
1. 任何單位或個人認為南方企業新聞網的內容可能涉嫌侵犯其合法權益,應及時向南方企業新聞網書面反饋,并提供相關證明材料和理由,本網站在收到上述文件并審核后,會采取相應處理措施。
2. 南方企業新聞網對于任何包含、經由鏈接、下載或其它途徑所獲得的有關本網站的任何內容、信息或廣告,不聲明或保證其正確性或可靠性。用戶自行承擔使用本網站的風險。
3. 如因版權和其它問題需要同本網聯系的,請在文章刊發后30日內進行。聯系電話:01083834755 郵箱:news@senn.com.cn




