從 Google、Meta,到聯合國,為什麼大家都開始研究 World Model?
如果你最近持續關注 AI,你可能會發現一個耐人尋味的現象。
Google DeepMind 在談 World Model。
Meta 發表 V-JEPA、V-JEPA 2,希望 AI 能夠理解物理世界,而不只是辨識影像。
李飛飛(Fei-Fei Li)成立了 World Labs,目標是打造能夠理解三維世界的 AI,而不是另一個聊天機器人。
Waymo 則持續利用世界模型(World Models)建立大規模模擬環境,讓自動駕駛系統能在虛擬世界中學習數十億公里的駕駛經驗,再將知識遷移到真實道路。
今年七月,一篇來自國際研究團隊的論文 《A Definition and Roadmap for World Models》 更直接指出:
World Models 已經成為人工智慧領域最熱門的研究方向之一,但目前仍缺乏一致性的定義,因此有必要建立共同的研究框架。
更值得注意的是,今年聯合國成立的 Independent International Scientific Panel on AI,在第一份全球 AI 科學評估報告中,也開始大量討論 AI 如何理解環境(Environment)、規劃(Planning)、模擬(Simulation)、自主代理(Agentic AI)以及治理(Governance),而不是只聚焦於大型語言模型(LLM)的能力。
當這些訊號同時出現時,我開始意識到:
AI 的下一場競賽,可能已經不是誰的模型比較大,而是誰更能理解世界。
AI 正在進入下一個時代
如果回頭看過去幾年的 AI 發展,你會發現每一年都有一個關鍵字。
2023 年,是大型語言模型(LLM)。
2024 年,是 RAG(Retrieval-Augmented Generation)。
2025 年,是 AI Agent。
而 2026 年開始,一個新的名詞開始頻繁出現在頂尖研究機構、大型科技公司與國際組織的報告裡:
World Model。
這並不是新的技術名詞。
事實上,「世界模型」最早可以追溯到人工智慧研究的早期,之後由 David Ha 與 Jürgen Schmidhuber 在 2018 年重新帶回 AI 社群的焦點。
真正讓它重新受到全球關注的人,是 Meta 首席 AI 科學家 Yann LeCun。
Yann LeCun:大型語言模型不是終點
2022 年,Yann LeCun 發表了一篇具有指標性的研究:
《A Path Towards Autonomous Machine Intelligence》
他提出一個相當具有爭議,但現在越來越多人開始接受的觀點:
大型語言模型並不足以通往真正的人工智慧。
原因很簡單。
大型語言模型非常擅長預測下一個字。
卻不知道:
球掉到地上會往哪裡滾。
門打開之後,人可能會怎麼走。
一個決策,會如何影響未來。
換句話說,它知道文字之間的關係,卻不一定理解世界真正運作的方式。
因此,LeCun 認為 AI 必須建立一個能夠模擬環境、預測未來、理解因果關係的 World Model,才能真正具備自主決策能力。
三年後,這個觀點已經不再只是學術理論。
Google、Meta 正在往同一個方向走
有趣的是,過去幾年彼此競爭最激烈的科技公司,如今卻開始朝著相同方向發展。
Google DeepMind 發布 Genie、Genie 2,希望 AI 能夠從影片中學會建立互動世界,而不是單純生成圖片或文字。
Meta 推出 V-JEPA 與 V-JEPA 2,讓 AI 能夠預測物體如何移動、事件如何發生,而不是只辨識畫面中的內容。
李飛飛創辦的 World Labs,更直接將使命定義為:
建立能夠理解、生成並推理三維世界的 AI。
這些產品看起來完全不同。
但其實都在回答同一個問題:
AI 能不能先理解世界,再採取行動?
這也是 World Model 的核心思想。
Waymo 告訴我們:理解世界,比理解語言更重要
如果說聊天機器人是理解語言,
那自動駕駛就是理解世界。
Waymo 不可能讓 AI 每犯一次錯,就真的撞一次車。
因此,它建立了龐大的模擬世界。
在虛擬世界裡:
可能有小孩突然衝出來。
可能有腳踏車逆向。
可能有暴雨。
可能有施工。
AI 必須先在世界模型中推演各種可能,再決定真正該怎麼做。
這其實就是世界模型最典型的應用。
AI 不只是回答問題。
而是:
預測未來。
聯合國開始關心的,不再只是 AI 有多聰明
真正讓我印象深刻的,其實不是 Google,也不是 Meta。
而是聯合國。
2026 年,聯合國成立 Independent International Scientific Panel on AI,發布第一份全球 AI 科學評估報告。
整份報告幾乎沒有討論哪一個模型比較強。
反而大量談論:
- Agentic AI
- Simulation
- Planning
- Environment
- Governance
- Evidence-based Evaluation
原因很簡單。
當 AI 開始具備自主能力之後,
真正重要的問題已經變成:
AI 是否理解它所處的世界?
以及:
人類如何治理這些 AI?
這是一個非常重要的轉折。
因為 AI 的焦點,已經開始從「能力(Capability)」逐漸轉向「理解(Understanding)」與「治理(Governance)」。
世界模型,不只是物理世界
很多人聽到 World Model,第一個想到的是:
自駕車。
機器人。
3D 世界。
但我認為,真正值得期待的是下一步。
如果 AI 可以理解:
球為什麼會滾動?
車子什麼時候會煞車?
那它是否也能理解:
主管的一句話,如何影響整個團隊?
一次績效面談,如何改變員工的工作態度?
一場衝突,如何逐漸演變成職場霸凌?
這些,其實都是另一種世界模型。
不是 Physical World。
而是 Social World。
不是理解物體。
而是理解人。
HR AI,也將迎來新的轉折點
這也是我一直認為 HR AI 即將發生巨大變化的原因。
過去,我們努力讓 AI 評估一個人的能力。
例如:
- 面試表現。
- 職能分數。
- 性格測驗。
- 績效結果。
但未來真正重要的,可能不是一個分數。
而是:
AI 是否理解:
這個人為什麼會做出這個決策?
他如何與主管互動?
如何與團隊合作?
在不同情境下,又會如何改變自己的行為?
如果 AI 能理解這些互動過程,而不是只評估最後的結果,那麼它就不再只是評分工具,而是真正能夠協助人才發展與決策的智慧系統。
下一個十年,AI 將從理解語言,走向理解世界
回頭看這幾年的 AI 發展,我們會發現一條非常清楚的脈絡。
過去十年,AI 最大的突破,是讓機器學會理解語言。
下一個十年,更大的挑戰,將是讓 AI 理解世界。
當 Google、Meta、Waymo、World Labs、Yann LeCun,以及聯合國,都開始朝著這個方向前進時,我相信,這已經不是另一個流行名詞,而是一場 AI 發展典範的轉移。
而對我而言,World Model 的真正價值,不只是讓 AI 更會開車、更會控制機器人,或更會操作電腦。
更重要的是,它讓我們開始思考:
AI 是否有可能真正理解「人」?
如果答案是肯定的,那麼未來 HR AI 的核心競爭力,將不再只是更準確地評分,而是建立一套能理解人、理解組織、理解互動的 Human World Model。
或許,這才是真正屬於 AI 下一個十年的開始。
