Apakah Model Dunia dalam AI? Panduan Perniagaan untuk AI yang Mensimulasikan Realiti

Apakah model dunia dalam AI, digambarkan sebagai diorama simulasi yang meramalkan keadaan seterusnya sesuatu objek

Turn this article into takeaways for your work.

Each assistant summarizes the article only for you and suggests best practices for your work.

Dikemas kini Julai 2026

Model dunia ialah sistem AI yang dilatih untuk membina simulasi ramalan dalaman bagi sesuatu persekitaran: rupa sesuatu adegan, cara objek dan manusia bergerak melaluinya, dan apa yang berlaku seterusnya selepas sesuatu tindakan. Berbanding meramalkan perkataan seterusnya seperti yang dilakukan oleh model bahasa, model dunia meramalkan keadaan seterusnya sesebuah dunia.

Perbezaan ini kedengaran kecil. Sebenarnya tidak. Inilah perbezaan antara AI yang bercakap tentang dunia fizikal dengan AI yang memahaminya cukup baik untuk bertindak di dalamnya, atau untuk membina satu versi dunia itu yang boleh anda jelajahi, gunakan untuk menguji robot, atau menjana keseluruhan tahap permainan daripadanya.

Bagaimana Model Dunia Mempelajari Simulasi Dalaman

Model dunia tidak menghafal fakta tentang dunia seperti yang dilakukan oleh ensiklopedia. Ia mempelajari fizik serta sebab-akibat dengan memerhati jumlah video yang sangat besar, data interaksi, dan (semakin kerap) log sensor robot, kemudian memampatkan apa yang dilihatnya menjadi satu representasi dalaman yang padat bagi "keadaan": di mana objek berada, bagaimana ia bergerak, dan apa yang mungkin berlaku sebentar lagi.

Cara model dunia belajar, digambarkan sebagai gulungan pemerhatian yang memberi input kepada simulasi dalaman yang interaktif

Latihan secara amnya mengikut tiga peringkat:

  1. Serap jujukan mentah. Model memerhati berjuta-juta jam video, rakaman permainan, atau demonstrasi robot, setiap bingkai dipadankan dengan tindakan (pergerakan kamera, pergerakan lengan robot, tekanan kekunci) yang menyebabkan bingkai seterusnya berlaku.
  2. Belajar meramalkan keadaan seterusnya. Berdasarkan keadaan semasa dan sesuatu tindakan, model belajar meramalkan apa yang berlaku seterusnya, berulang kali, sehingga simulasi dalamannya berhenti menyimpang daripada cara dunia sebenar sebenarnya berfungsi.
  3. Jalankan simulasi ke hadapan. Setelah dilatih, model boleh menjana keadaan baharu tanpa had, pada dasarnya "membayangkan" apa yang akan berlaku jika seseorang, robot, atau kamera mengambil sesuatu tindakan, tanpa tindakan itu pernah berlaku dalam realiti.

Genie 3 daripada Google DeepMind ialah contoh konkrit yang berguna. Ia merupakan transformer autoregresif dengan 11 bilion parameter yang mengambil gesaan teks dan menjana dunia yang boleh dijelajahi secara masa nyata pada resolusi 720p dan 24 bingkai sesaat, dengan ingatan visual yang meliputi kira-kira seminit ke belakang supaya persekitaran kekal konsisten semasa anda bergerak melaluinya (Google DeepMind, 2026). Itulah gelung terasnya: huraikan sesebuah dunia, dapatkan kembali satu tempat yang boleh anda jelajahi, di mana model itu sentiasa meramalkan apa yang sepatutnya muncul seterusnya berdasarkan ke mana anda baru sahaja bergerak.

Inilah juga yang membezakan model dunia daripada penjana video biasa. Penjana video menghasilkan klip yang tetap. Model dunia mengekalkan keadaan dalaman yang berterusan dan bertindak balas terhadap input, lebih menyerupai simulasi berbanding filem.

Mengapa Model Dunia Penting

Robotik. Latihan robot di dunia sebenar adalah perlahan dan mahal: setiap cubaan mencapit atau perlanggaran yang gagal memakan masa, perkakasan, dan kadangkala keselamatan. Model dunia membolehkan jurutera menjana jumlah besar senario latihan yang realistik dan secara fizikal munasabah dalam simulasi terlebih dahulu, kemudian memindahkan apa yang dipelajari robot itu ke dalam mesin sebenar. Nvidia menamakan ini "AI fizikal," dan inilah premis keseluruhan di sebalik Cosmos: latih dasar (policy) dalam dunia simulasi sebelum ia menyentuh dunia sebenar buat kali pertama.

Penjanaan video dan kandungan. Alat video AI tradisional menjana satu klip dan berhenti di situ. Model dunia boleh dikawal, dilawati semula, dan dilanjutkan, itulah sebabnya syarikat penjanaan video seperti Runway secara terang-terangan mengubah kedudukan mereka ke arah model dunia berbanding klip sekali jana. Penjanaan yang lebih panjang, boleh dikawal, dan konsisten secara fizikal ialah langkah seterusnya selepas "taip satu gesaan, dapatkan 5 saat video."

Perancangan dan AI agentik. Ejen AI yang boleh mensimulasikan kemungkinan hasil sesuatu tindakan sebelum mengambilnya boleh merancang beberapa langkah ke hadapan berbanding bertindak balas selangkah demi selangkah. Ini merupakan peningkatan yang bermakna berbanding ejen yang hanya menaakul dalam bentuk teks: model dunia memberikan ejen sesuatu yang lebih hampir dengan imaginasi, satu cara untuk menguji rancangan secara mental sebelum melaburkan sumber ke atasnya.

Satu laluan yang mungkin ke arah AI yang lebih umum. Model bahasa besar amat mahir memanipulasi teks, tetapi teks hanyalah huraian tentang dunia, bukan dunia itu sendiri. Penyelidik termasuk Fei-Fei Li berhujah bahawa kecerdasan spatial, iaitu kefahaman tentang cara objek, ruang, dan masa sebenarnya berfungsi, merupakan keupayaan berasingan yang tidak diajar oleh bahasa semata-mata kepada sesuatu model. Model dunia merupakan salah satu pertaruhan paling konkrit dalam industri untuk merapatkan jurang tersebut.

Pemain dan Projek Utama pada 2026

Google DeepMind, Genie 3. Model dunia DeepMind menjana persekitaran masa nyata, boleh dimainkan, dan digesa melalui teks. Ia dilancarkan kepada pelanggan Google AI Ultra pada 29 Januari 2026, selepas mula diperkenalkan pada 2025, dan mewakili demonstrasi awam yang paling jelas setakat ini bagi penjanaan dunia interaktif secara masa nyata (Google DeepMind, 2026; 9to5Google, 2026).

World Labs, diasaskan oleh Fei-Fei Li. World Labs membina Marble, satu model dunia yang menukar gesaan teks, foto, klip video, atau bentuk susun atur 3D kasar menjadi persekitaran 3D yang berterusan, boleh disunting, dan boleh dijelajahi, disasarkan khusus untuk industri spatial seperti seni bina, permainan, dan reka bentuk (World Labs, melalui TechCrunch, 2026).

Nvidia Cosmos. Cosmos ialah platform model asas dunia Nvidia untuk apa yang dipanggilnya "AI fizikal," menjana data latihan sintetik dan trajektori tindakan untuk mempercepatkan pembangunan robotik dan kenderaan autonomi. Cosmos 3, dilancarkan pada 2026, dilatih menggunakan kira-kira 20 trilion token data multimodal, termasuk hampir satu bilion imej dan 400 juta video sebenar dan sintetik (Nvidia Newsroom, 2026).

Runway. Paling dikenali dengan penjanaan video AI, Runway telah mengubah hala tujunya ke arah model dunia, mengumpulkan $315 juta dalam pusingan Siri E pada Februari 2026 secara khusus untuk "pra-latih generasi model dunia yang seterusnya," di samping model dunia pertamanya yang dilancarkan pada Disember 2025 (TechCrunch, 2026).

Keempat-empat organisasi ini tidak bersaing dalam produk yang sama. DeepMind dan Runway lebih cenderung ke arah model dunia generatif bergaya video yang anda jelajahi secara masa nyata. World Labs lebih cenderung ke arah adegan 3D yang berterusan dan boleh disunting. Nvidia lebih cenderung ke arah ketepatan fizikal untuk robot dan kenderaan. Secara bersama, mereka membentuk rupa semasa kategori ini.

Model Dunia berbanding LLM

Model Dunia Model Bahasa Besar
Belajar daripada Video, simulasi, data interaksi robot, dipadankan dengan tindakan Teks, kod, dan bahasa bertulis lain
Meramalkan Keadaan seterusnya sesuatu persekitaran (visual, spatial, fizikal) Token seterusnya dalam satu jujukan teks
Output Persekitaran boleh dijelajahi, video, atau trajektori tindakan Teks, kod, data berstruktur
Kekuatan teras Penaakulan spatial dan fizikal, simulasi "apa yang berlaku jika" Penaakulan bahasa, sintesis pengetahuan, perbualan
Interaktiviti Bertindak balas terhadap tindakan secara masa nyata (dalam model terkemuka) Bertindak balas terhadap gesaan, bukan tindakan fizikal
Kegunaan biasa hari ini Latihan robotik, penjanaan permainan/dunia, reka bentuk spatial Chatbot, pembantu pengekodan, analisis dokumen, carian
Kematangan pada 2026 Awal: konsistensi dalam minit, penggunaan terhad Matang: digunakan secara meluas dalam produk pengeluaran

Batasan Model Dunia

Model dunia sedang berkembang pesat, tetapi ia masih jauh daripada teknologi yang lengkap.

Batasan model dunia digambarkan sebagai dunia simulasi yang rapuh menyimpang daripada fizik dunia sebenar

  • Tempoh konsistensi yang singkat. Genie 3 mengekalkan dunia yang konsisten selama beberapa minit, bukan berjam-jam. Simulasi berjalan lama masih menyimpang atau kehilangan konsistensi.
  • Kos pengkomputeran yang tinggi. Melatih menggunakan puluhan trilion token data video dan simulasi, serta menjalankan penjanaan masa nyata pada kadar bingkai yang boleh digunakan, memerlukan pengkomputeran yang jauh lebih banyak berbanding melatih model teks dengan tahap ambisi yang setanding.
  • Fizik yang tidak sempurna. Model ini mempelajari fizik secara statistik, daripada contoh, bukan daripada prinsip asas. Ia masih boleh menjana adegan di mana objek bertindak dengan cara yang tidak sepadan dengan mekanik dunia sebenar.
  • Data interaksi dunia sebenar yang terhad. Teks terdapat secara banyak dalam talian. Video berkualiti tinggi yang dipadankan dengan data tindakan yang tepat (terutamanya daripada robot sebenar) agak terhad dan mahal untuk dikumpulkan.
  • Belum ada penanda aras yang dikongsi. Berbeza dengan model bahasa yang mempunyai berpuluh-puluh penilaian standard, model dunia masih belum mempunyai cara yang dipersetujui untuk mengukur "sebaik mana" sesuatu simulasi, yang menyukarkan perbandingan vendor bagi pembeli.
  • Jurang simulasi-ke-realiti. Dasar (policy) robot yang berfungsi dengan sempurna dalam dunia simulasi masih boleh gagal di lantai kilang jika simulasi itu terlepas pandang sesuatu pemboleh ubah dunia sebenar, jadi latihan simulasi masih memerlukan pengesahan dunia sebenar.

Fakta Utama: Model Dunia dalam Angka

  • Genie 3 daripada Google DeepMind menjana dunia masa nyata yang boleh dijelajahi pada resolusi 720p dan 24 bingkai sesaat, dengan ingatan visual kira-kira seminit untuk mengekalkan konsistensi dunia semasa anda bergerak melaluinya. Sumber: Google DeepMind
  • Model asas dunia Cosmos 3 daripada Nvidia dilatih menggunakan kira-kira 20 trilion token data multimodal, termasuk hampir satu bilion imej dan 400 juta video sebenar dan sintetik. Sumber: Nvidia Newsroom
  • World Labs, diasaskan oleh Fei-Fei Li, mengumpulkan kira-kira $1 bilion pada Februari 2026, termasuk $200 juta daripada Autodesk, menjadikan jumlah pembiayaannya kira-kira $1.23 bilion. Sumber: TechCrunch
  • Penilaian World Labs dilaporkan meningkat daripada $1 bilion semasa pelancarannya pada 2024 kepada kira-kira $5 bilion menjelang Januari 2026, dalam tempoh kira-kira enam belas bulan. Sumber: Bloomberg
  • Runway mengumpulkan $315 juta dalam pusingan Siri E pada Februari 2026 pada penilaian $5.3 bilion, sebahagiannya diperuntukkan untuk pra-latih generasi model dunia yang seterusnya. Sumber: TechCrunch
  • AI Generatif, kategori lebih luas yang meliputi model dunia, berkembang lebih 200% dalam pelaburan swasta pada 2025 dan meraih hampir separuh daripada keseluruhan pembiayaan AI swasta di peringkat global. Sumber: Stanford HAI, Laporan Indeks AI 2026

Implikasi Perniagaan dan Industri

Bagi kebanyakan syarikat, model dunia bukan item jangka pendek, tetapi ia berbaloi untuk dipantau atas beberapa sebab.

Kegunaan perniagaan model dunia digambarkan melalui lensa perancangan yang mempratonton hasil robotik, reka bentuk spatial, dan ejen

Robotik dan pembuatan merupakan penerima manfaat awal yang paling jelas. Jika perniagaan anda bergantung pada automasi fizikal, robotik gudang, atau kenderaan autonomi, model dunia semakin menjadi cara standard bagi vendor menjana data latihan sintetik yang diperlukan oleh sistem tersebut, yang sepatutnya kelihatan sebagai kitaran penggunaan yang lebih pantas dan lebih sedikit kegagalan latihan dunia sebenar yang mahal dalam beberapa tahun akan datang.

Industri spatial dan kreatif (seni bina, hartanah, permainan, reka bentuk industri, filem) mendapat satu alat yang lebih segera: menukar foto, lakaran, atau gesaan teks menjadi ruang 3D yang boleh dijelajahi, yang tepat sekali merupakan tawaran di sebalik Marble daripada World Labs. Ini memendekkan gelung antara "idea" dengan "lawatan yang benar-benar boleh anda nilai."

Sesiapa sahaja yang membina atau membeli AI agentik perlu memerhati ruang ini walaupun mereka tidak pernah menyentuh robot. Jika ejen akhirnya mendapat akses kepada "imaginasi" dalaman, iaitu keupayaan untuk mensimulasikan hasil sesuatu rancangan sebelum melaksanakannya, ini mengubah apa yang boleh diwakilkan secara munasabah oleh perniagaan kepada ejen berbanding apa yang masih memerlukan semakan manusia terlebih dahulu.

Dari segi belanjawan, layan model dunia sebagaimana anda melayan mana-mana teknologi pra-pengeluaran: menjanjikan, mendapat pembiayaan yang baik, dan belum lagi sesuatu yang perlu dijadikan asas kepada aliran kerja kritikal. Keperluan pengkomputeran dan data adalah tinggi, tempoh konsistensi masih diukur dalam minit, dan belum ada cara standard untuk menilai model dunia satu vendor berbanding vendor lain. Perhatikan ruang ini, jalankan projek rintis secara terhad jika ia relevan secara langsung dengan industri anda, dan jangan pertaruhkan proses teras pada teknologi ini pada 2026.

Soalan Lazim tentang World Models in AI

Apakah model dunia dalam AI?

Model dunia ialah sistem AI yang dilatih untuk membina simulasi dalaman bagi sesuatu persekitaran, mempelajari cara objek, ejen, dan ruang berkelakuan supaya ia boleh meramalkan apa yang berlaku seterusnya selepas sesuatu tindakan. Inilah teknologi di sebalik alat seperti Genie 3 daripada Google DeepMind dan Marble daripada World Labs.

Apakah perbezaan antara model dunia dengan model bahasa besar?

Model bahasa besar meramalkan perkataan seterusnya dalam teks. Model dunia meramalkan keadaan seterusnya sesuatu persekitaran, sama ada visual, spatial, atau fizikal, berdasarkan keadaan semasa dan sesuatu tindakan. LLM menaakul tentang bahasa; model dunia menaakul tentang ruang dan masa.

Adakah Sora satu model dunia?

Sora dan alat teks-ke-video yang serupa berkongsi sebahagian teknik asas dengan model dunia, kerana kedua-duanya belajar meramalkan bingkai masa depan yang koheren. Perbezaan yang dibuat oleh kebanyakan penyelidik ialah interaktiviti: model dunia bertindak balas terhadap tindakan pengguna yang berterusan dalam sesuatu yang hampir dengan masa nyata, manakala penjana video standard menghasilkan satu klip tetap daripada satu gesaan sahaja.

Mengapakah Google, Nvidia, dan Runway kesemuanya melabur dalam model dunia sekarang?

Setiap satu menyasarkan aplikasi yang berbeza. Google DeepMind membina dunia interaktif serba guna dengan Genie 3. Platform Cosmos daripada Nvidia menyasarkan data latihan sintetik untuk robot dan kenderaan autonomi. Runway melanjutkan perniagaan penjanaan videonya kepada persekitaran simulasi yang berterusan dan boleh dikawal. Ketiga-tiganya melihat model dunia sebagai lapisan keupayaan utama seterusnya selepas penjanaan bahasa dan imej.

Untuk apakah model dunia digunakan dalam robotik?

Model dunia menjana jumlah besar senario latihan yang realistik dan secara fizikal munasabah dalam simulasi, membolehkan jurutera melatih dan menguji kelakuan robot tanpa kos, masa, dan risiko beribu-ribu percubaan cuba-jaya dunia sebenar. Platform Cosmos daripada Nvidia dibina khusus di sekeliling kes penggunaan ini.

Berapa lamakah model dunia boleh mengekalkan persekitaran yang konsisten?

Sehingga 2026, model terkemuka seperti Genie 3 mengekalkan dunia yang koheren dan boleh dijelajahi selama beberapa minit pada satu masa, bukan berjam-jam. Memanjangkan tempoh konsistensi ini merupakan salah satu cabaran teknikal utama yang masih belum diselesaikan dalam bidang ini.

Adakah model dunia berkaitan dengan AGI?

Sesetengah penyelidik, termasuk Fei-Fei Li, berhujah bahawa kefahaman spatial dan fizikal yang berasaskan realiti merupakan kepingan yang hilang dalam laluan ke arah AI yang lebih umum, kerana bahasa semata-mata tidak mengajar sesuatu model bagaimana dunia fizikal sebenarnya berfungsi. Model dunia merupakan salah satu pertaruhan industri yang lebih konkrit untuk merapatkan jurang tersebut, walaupun ia masih merupakan langkah peringkat awal yang belum terbukti ke arah matlamat itu berbanding jawapan yang muktamad.

Apakah Marble daripada World Labs?

Marble ialah model dunia World Labs, syarikat yang diasaskan oleh Fei-Fei Li, yang menukar gesaan teks, foto, klip video, atau bentuk susun atur 3D kasar menjadi persekitaran 3D yang berterusan, boleh disunting, dan boleh dijelajahi, disasarkan untuk industri seperti seni bina, permainan, dan reka bentuk.

Patutkah perniagaan saya melabur dalam teknologi model dunia sekarang?

Bagi kebanyakan perniagaan, model dunia berbaloi untuk dipantau berbanding diguna pakai hari ini. Ia relevan sekarang terutamanya untuk robotik, kenderaan autonomi, dan kerja reka bentuk spatial. Bagi kebanyakan fungsi lain, teknologi ini masih di peringkat awal: tempoh konsistensi yang singkat, kos pengkomputeran yang tinggi, dan ketiadaan penanda aras standard menjadikannya kategori "perhatikan dengan teliti" berbanding "bina berasaskannya sekarang."


Sumber Berkaitan

Terokai konsep berkaitan berikut untuk memperdalam kefahaman anda tentang model dunia:

  • Model Bahasa Besar (LLM) - Bagaimana AI berasaskan teks berbeza daripada model dunia
  • Ejen AI - Bagaimana sistem agentik boleh menggunakan model dunia untuk merancang ke hadapan
  • AI Multimodal - AI yang memproses pelbagai jenis data, satu asas yang menjadi tapak pembinaan banyak model dunia
  • Model Difusi - Teknik penjanaan imej dan video yang menjadi asas kepada banyak seni bina model dunia
  • Pembelajaran Pengukuhan - Bagaimana ejen belajar daripada persekitaran simulasi, berkait rapat dengan latihan model dunia
  • AI Generatif - Kategori AI yang lebih luas yang mencipta kandungan baharu, termasuk dunia simulasi
  • Seni Bina Transformer - Tulang belakang teknikal di sebalik model seperti Genie 3
  • Model Asas - Model besar serba guna yang menjadi asas kepada kedua-dua model dunia dan LLM
  • Penglihatan Komputer - Bagaimana AI mentafsir data visual yang menjadi bahan latihan model dunia

Sumber Luaran


Sebahagian daripada Koleksi Istilah AI. Terakhir dikemas kini: 2026-07-16

About the author

Victor Hoang

Victor Hoang

Co-Founder, Rework.com

Victor Hoang is Co-Founder and CMO of Rework. He spent 12+ years scaling B2B SaaS growth, building a lead engine that generated over 1 million leads and $10M+ in annual recurring revenue. Today he builds AI agents and MCP servers into Rework's products to empower customers across growth and operations. He writes about what actually works.