世界模型,正在悄悄接管 AI 的下一個十年

從 Google、Meta,到聯合國,為什麼大家都開始研究 World Model?

如果你最近持續關注 AI,你可能會發現一個耐人尋味的現象。

Google DeepMind 在談 World Model。

Meta 發表 V-JEPA、V-JEPA 2,希望 AI 能夠理解物理世界,而不只是辨識影像。

李飛飛(Fei-Fei Li)成立了 World Labs,目標是打造能夠理解三維世界的 AI,而不是另一個聊天機器人。

Waymo 則持續利用世界模型(World Models)建立大規模模擬環境,讓自動駕駛系統能在虛擬世界中學習數十億公里的駕駛經驗,再將知識遷移到真實道路。

今年七月,一篇來自國際研究團隊的論文 《A Definition and Roadmap for World Models》 更直接指出:

World Models 已經成為人工智慧領域最熱門的研究方向之一,但目前仍缺乏一致性的定義,因此有必要建立共同的研究框架。

更值得注意的是,今年聯合國成立的 Independent International Scientific Panel on AI,在第一份全球 AI 科學評估報告中,也開始大量討論 AI 如何理解環境(Environment)、規劃(Planning)、模擬(Simulation)、自主代理(Agentic AI)以及治理(Governance),而不是只聚焦於大型語言模型(LLM)的能力。

當這些訊號同時出現時,我開始意識到:

AI 的下一場競賽,可能已經不是誰的模型比較大,而是誰更能理解世界。


AI 正在進入下一個時代

如果回頭看過去幾年的 AI 發展,你會發現每一年都有一個關鍵字。

2023 年,是大型語言模型(LLM)。

2024 年,是 RAG(Retrieval-Augmented Generation)。

2025 年,是 AI Agent。

而 2026 年開始,一個新的名詞開始頻繁出現在頂尖研究機構、大型科技公司與國際組織的報告裡:

World Model。

這並不是新的技術名詞。

事實上,「世界模型」最早可以追溯到人工智慧研究的早期,之後由 David Ha 與 Jürgen Schmidhuber 在 2018 年重新帶回 AI 社群的焦點。

真正讓它重新受到全球關注的人,是 Meta 首席 AI 科學家 Yann LeCun


Yann LeCun:大型語言模型不是終點

2022 年,Yann LeCun 發表了一篇具有指標性的研究:

《A Path Towards Autonomous Machine Intelligence》

他提出一個相當具有爭議,但現在越來越多人開始接受的觀點:

大型語言模型並不足以通往真正的人工智慧。

原因很簡單。

大型語言模型非常擅長預測下一個字。

卻不知道:

球掉到地上會往哪裡滾。

門打開之後,人可能會怎麼走。

一個決策,會如何影響未來。

換句話說,它知道文字之間的關係,卻不一定理解世界真正運作的方式。

因此,LeCun 認為 AI 必須建立一個能夠模擬環境、預測未來、理解因果關係的 World Model,才能真正具備自主決策能力。

三年後,這個觀點已經不再只是學術理論。


Google、Meta 正在往同一個方向走

有趣的是,過去幾年彼此競爭最激烈的科技公司,如今卻開始朝著相同方向發展。

Google DeepMind 發布 GenieGenie 2,希望 AI 能夠從影片中學會建立互動世界,而不是單純生成圖片或文字。

Meta 推出 V-JEPAV-JEPA 2,讓 AI 能夠預測物體如何移動、事件如何發生,而不是只辨識畫面中的內容。

李飛飛創辦的 World Labs,更直接將使命定義為:

建立能夠理解、生成並推理三維世界的 AI。

這些產品看起來完全不同。

但其實都在回答同一個問題:

AI 能不能先理解世界,再採取行動?

這也是 World Model 的核心思想。


Waymo 告訴我們:理解世界,比理解語言更重要

如果說聊天機器人是理解語言,

那自動駕駛就是理解世界。

Waymo 不可能讓 AI 每犯一次錯,就真的撞一次車。

因此,它建立了龐大的模擬世界。

在虛擬世界裡:

可能有小孩突然衝出來。

可能有腳踏車逆向。

可能有暴雨。

可能有施工。

AI 必須先在世界模型中推演各種可能,再決定真正該怎麼做。

這其實就是世界模型最典型的應用。

AI 不只是回答問題。

而是:

預測未來。


聯合國開始關心的,不再只是 AI 有多聰明

真正讓我印象深刻的,其實不是 Google,也不是 Meta。

而是聯合國。

2026 年,聯合國成立 Independent International Scientific Panel on AI,發布第一份全球 AI 科學評估報告。

整份報告幾乎沒有討論哪一個模型比較強。

反而大量談論:

  • Agentic AI
  • Simulation
  • Planning
  • Environment
  • Governance
  • Evidence-based Evaluation

原因很簡單。

當 AI 開始具備自主能力之後,

真正重要的問題已經變成:

AI 是否理解它所處的世界?

以及:

人類如何治理這些 AI?

這是一個非常重要的轉折。

因為 AI 的焦點,已經開始從「能力(Capability)」逐漸轉向「理解(Understanding)」與「治理(Governance)」。


世界模型,不只是物理世界

很多人聽到 World Model,第一個想到的是:

自駕車。

機器人。

3D 世界。

但我認為,真正值得期待的是下一步。

如果 AI 可以理解:

球為什麼會滾動?

車子什麼時候會煞車?

那它是否也能理解:

主管的一句話,如何影響整個團隊?

一次績效面談,如何改變員工的工作態度?

一場衝突,如何逐漸演變成職場霸凌?

這些,其實都是另一種世界模型。

不是 Physical World。

而是 Social World

不是理解物體。

而是理解人。


HR AI,也將迎來新的轉折點

這也是我一直認為 HR AI 即將發生巨大變化的原因。

過去,我們努力讓 AI 評估一個人的能力。

例如:

  • 面試表現。
  • 職能分數。
  • 性格測驗。
  • 績效結果。

但未來真正重要的,可能不是一個分數。

而是:

AI 是否理解:

這個人為什麼會做出這個決策?

他如何與主管互動?

如何與團隊合作?

在不同情境下,又會如何改變自己的行為?

如果 AI 能理解這些互動過程,而不是只評估最後的結果,那麼它就不再只是評分工具,而是真正能夠協助人才發展與決策的智慧系統。


下一個十年,AI 將從理解語言,走向理解世界

回頭看這幾年的 AI 發展,我們會發現一條非常清楚的脈絡。

過去十年,AI 最大的突破,是讓機器學會理解語言。

下一個十年,更大的挑戰,將是讓 AI 理解世界。

當 Google、Meta、Waymo、World Labs、Yann LeCun,以及聯合國,都開始朝著這個方向前進時,我相信,這已經不是另一個流行名詞,而是一場 AI 發展典範的轉移。

而對我而言,World Model 的真正價值,不只是讓 AI 更會開車、更會控制機器人,或更會操作電腦。

更重要的是,它讓我們開始思考:

AI 是否有可能真正理解「人」?

如果答案是肯定的,那麼未來 HR AI 的核心競爭力,將不再只是更準確地評分,而是建立一套能理解人、理解組織、理解互動的 Human World Model

或許,這才是真正屬於 AI 下一個十年的開始。