Apakah On-Device AI?

Turn this article into takeaways for your work.
Each assistant summarizes the article only for you and suggests best practices for your work.
Dikemas kini Julai 2026
On-device AI ialah kecerdasan buatan yang berjalan terus pada perkakasan tempatan, iaitu telefon pintar, komputer riba, atau cip terbenam, berbanding menghantar permintaan ke pelayan jauh. Pengiraan model berlaku pada peranti itu sendiri, menggunakan cip terbina dalam seperti NPU, jadi sistem boleh bertindak balas tanpa sambungan internet, dan data tidak sesekali perlu meninggalkan perkakasan tempat ia bermula.
Pilihan reka bentuk tunggal itu, iaitu mengekalkan pengiraan secara tempatan berbanding menyalurkannya ke pusat data, mengubah ekonomi, profil privasi, dan mod kegagalan sesuatu ciri AI. Ia juga sebab telefon anda kini boleh mentranskripsi memo suara, meringkaskan rantaian teks, atau menulis semula e-mel walaupun dalam mod pesawat.
Bagaimana On-Device AI Sebenarnya Berjalan Secara Tempatan
Menjalankan model besar pada telefon dahulunya mustahil. Model bahasa besar berskala terkehadapan boleh mempunyai ratusan bilion parameter dan memerlukan GPU pusat data hanya untuk menjawab satu pertanyaan. Perkakasan pengguna hanya mempunyai sebahagian kecil daripada memori dan bajet kuasa itu. Tiga perkembangan telah merapatkan jurang tersebut.

Neural Processing Unit (NPU). Cip telefon dan komputer riba moden kini dilengkapi pemecut AI khusus di samping CPU dan GPU. NPU dibina khusus untuk pengiraan matriks yang sentiasa dijalankan oleh Neural Networks, dan ia melakukan pengiraan itu dengan jauh lebih cekap, dari segi kelajuan mahupun penggunaan bateri, berbanding pemproses tujuan am. Snapdragon 8 Elite Gen 5 daripada Qualcomm, dibina untuk telefon generasi 2026, dilengkapi NPU Hexagon yang menurut Qualcomm berjalan 37 peratus lebih pantas berbanding generasi sebelumnya, khusus untuk membolehkan model lebih besar berjalan secara tempatan tanpa menghabiskan bateri.
Quantization. Walaupun dengan cip khusus, model berketepatan penuh biasanya terlalu besar untuk muat dalam memori telefon. Quantization mengecilkan model dengan mengurangkan ketepatan berangka pemberatnya, selalunya daripada 32-bit kepada 8-bit atau 4-bit, mengurangkan penggunaan memori sebanyak 4x hingga 8x dengan hanya sedikit kompromi ketepatan. Inilah langkah yang mengubah model yang dibina untuk rak pelayan menjadi model yang muat pada telefon.
Small Language Models (SLM). Selain pemampatan, pembina model kini melatih model supaya kecil sejak awal. Small Language Models, biasanya dalam julat 1 hingga 10 bilion parameter, direka supaya cukup berkeupayaan bagi satu set tugasan tertentu (meringkaskan, menulis semula, mengklasifikasikan, menjawab soalan tentang kandungan pada skrin) sambil kekal cukup ringan untuk berjalan pada NPU telefon. Knowledge Distillation, iaitu model "pelajar" kecil belajar meniru model "guru" yang lebih besar, ialah salah satu teknik utama yang digunakan untuk membinanya.
Digabungkan bersama, ketiga-tiga komponen ini membolehkan telefon atau komputer riba menjalankan inferens, iaitu langkah di mana model terlatih sebenarnya menghasilkan jawapan, sepenuhnya pada silikon tempatan, tanpa sebarang data dihantar keluar melalui rangkaian.
Sebab Perniagaan dan Pengguna Mahukannya: Privasi, Kependaman, Luar Talian, Kos
Privasi. Apabila inferens berjalan pada peranti, input tidak perlu meninggalkannya. Memo suara, foto, draf e-mel, atau nota pesakit boleh diproses tanpa menghantar kandungan itu ke pelayan pihak ketiga. Bagi industri terkawal atau mana-mana aliran kerja yang menyentuh data sensitif, itu sering menjadi faktor penentu berbanding kualiti model itu sendiri.

Kependaman. Permintaan cloud perlu bergerak ke pusat data dan kembali, malah sebelum model mula mengira. Inferens on-device melangkau perjalanan pergi-balik itu sepenuhnya, sebab itulah ciri tempatan (autolengkap, transkripsi langsung, ringkasan pada skrin) terasa segera manakala ciri yang disalurkan melalui cloud mempunyai kelewatan yang jelas.
Operasi luar talian. Model yang berjalan secara tempatan berfungsi tanpa isyarat, di dalam pesawat, di bilik bawah tanah, di lantai kilang, atau di kawasan luar bandar dengan sambungan yang tidak boleh diharap. Apa-apa sahaja yang bergantung pada panggilan API secara langsung akan berhenti berfungsi sebaik sahaja sambungan terputus.
Kos. Inferens cloud dibilkan mengikut token atau panggilan dan berskala terus dengan penggunaan; ciri yang menjadi popular akan menjadi mahal. Inferens on-device berjalan pada perkakasan yang pengguna atau perniagaan sudah miliki, jadi tiada kos marginal setiap pertanyaan sebaik sahaja model berada pada peranti.
Batasan Sebenar: Saiz Model dan Bateri
On-device AI bukan naik taraf percuma berbanding cloud AI, dan berpura-pura sebaliknya menetapkan jangkaan yang salah secara dalaman. Dua kekangan menentukan apa yang sebenarnya mungkin hari ini.

Saiz model mengehadkan keupayaan. Memori telefon dan komputer riba diukur dalam gigabait satu digit atau dua digit rendah, bukan ratusan gigabait yang boleh diakses oleh kluster GPU pusat data. Siling itu bermakna model on-device, secara semula jadi, lebih kecil dan kurang berkeupayaan secara meluas berbanding model cloud terkehadapan. Ia kuat pada tugasan sempit yang jelas takrifannya dan lebih lemah pada penaakulan terbuka, dokumen panjang, atau apa-apa yang memerlukan pengetahuan yang sangat terkini.
Had bateri dan terma. Walaupun dengan NPU yang cekap, inferens AI yang berterusan menggunakan kuasa dan menjana haba, kedua-duanya sumber terhad pada peranti berkuasa bateri. Itu kekangan sebenar terhadap sebanyak mana pemprosesan on-device yang boleh dilakukan peranti secara berterusan tanpa jelas menghabiskan bateri atau memperlahankan prestasi, dan itulah sebahagian sebab pembuat telefon menyalurkan permintaan yang lebih berat ke cloud berbanding memaksa segalanya melalui cip tempatan.
Ramalan Deloitte sendiri bagi 2026 menangkap ketegangan ini secara langsung: walaupun pertumbuhan pemecut AI terbina dalam pada telefon dan PC, Deloitte meramalkan hampir semua pengkomputeran AI pada 2026 masih akan berlaku di pusat data besar atau pelayan perusahaan bertaraf tinggi berbanding on-device, kerana NPU semasa hanya cukup berkuasa untuk tugasan inferens ringan sekali jalan seperti meringkaskan e-mel pendek, bukan penaakulan kompleks yang berterusan.
Itulah bentuk praktikal on-device AI hari ini: nyata dan berkembang pantas, tetapi sebagai pelengkap kepada cloud AI berbanding penggantian penuh untuknya.
Fakta Utama
- Telefon pintar berkeupayaan GenAI, iaitu telefon yang menjalankan model AI secara on-device, diramalkan mencapai 45 peratus daripada penghantaran telefon pintar global pada 2026, meningkat daripada 36 peratus pada 2025, menurut Counterpoint Research.
- Penghantaran global terkumpul bagi telefon pintar berkeupayaan GenAI melepasi 500 juta unit menjelang suku ketiga 2025, menurut Counterpoint Research.
- Bahagian telefon pintar yang dihantar dengan keupayaan generative AI boleh melebihi 30 peratus menjelang penghujung 2025, dan hampir separuh daripada semua PC yang dijual pada 2025 akan mempunyai keupayaan pemprosesan generative AI tempatan, menurut Ramalan TMT 2025 Deloitte.
- PC AI diunjurkan mewakili 31 peratus daripada pasaran PC di seluruh dunia menjelang penghujung 2025, menurut Gartner.
- Walaupun dengan peningkatan pemecut AI on-device, Ramalan TMT 2026 Deloitte meramalkan hampir semua pengkomputeran AI pada 2026 masih akan berjalan di pusat data atau pelayan perusahaan bertaraf tinggi berbanding pada PC dan telefon, memandangkan NPU hari ini dibina untuk inferens ringan sekali jalan berbanding beban kerja berat yang berterusan.
- Kos menjalankan inferens pada tahap prestasi GPT-3.5 jatuh daripada $20.00 kepada $0.07 bagi setiap juta token antara November 2022 dan Oktober 2024, penurunan lebih 280 kali ganda yang sebahagian besarnya didorong oleh model kecil yang cekap, menurut laporan Stanford AI Index 2025.
- Snapdragon 8 Elite Gen 5 daripada Qualcomm, dibina untuk telefon generasi 2026, dilengkapi NPU Hexagon yang menurut Qualcomm berjalan 37 peratus lebih pantas berbanding pendahulunya, khusus untuk menjalankan model lebih besar secara tempatan.
On-Device AI pada 2026: Contoh Sebenar
On-device AI telah bergerak daripada demo penyelidikan kepada ciri standard merentasi platform pengguna utama.
Apple Intelligence. Apple membina sistem AI-nya di sekeliling pemprosesan on-device secara lalai. Kebanyakan model di sebalik Apple Intelligence berjalan sepenuhnya pada iPhone, iPad, atau Mac; apabila permintaan memerlukan model yang lebih besar daripada yang boleh muat pada peranti, ia disalurkan kepada Private Cloud Compute milik Apple, yang menurut Apple berjalan pada pelayan silikon Apple khusus dengan model keselamatan yang sama seperti peranti itu sendiri, berbanding cloud tujuan am.
Gemini Nano. Gemini Nano daripada Google ialah versi padat keluarga model Gemini-nya, dibina khusus untuk berjalan secara on-device pada telefon Pixel melalui sistem AICore Android, menggerakkan ciri seperti ringkasan on-device dan balasan pintar tanpa panggilan rangkaian.
Copilot+ PC. Kategori Copilot+ PC daripada Microsoft, dilancarkan pada 2024 dan kini peringkat komputer riba Windows arus perdana, memerlukan NPU berkeupayaan sekurang-kurangnya 40 trilion operasi sesaat (TOPS) supaya mesin boleh menjalankan ciri AI on-device, seperti sari kata langsung dan penjanaan imej, secara tempatan berbanding melalui cloud.
Llama on-device. Meta membina model Llama 3.2 1B dan 3B-nya khusus untuk penggunaan edge dan on-device, cukup kecil untuk berjalan pada telefon dan komputer riba melalui rakan kongsi seperti Qualcomm dan MediaTek, disasarkan kepada pembangun yang mahukan ringkasan, penulisan semula, atau tool-calling tempatan tanpa perjalanan pergi-balik ke pelayan.
On-Device AI Berbanding Cloud AI
| Faktor | On-Device AI | Cloud AI |
|---|---|---|
| Di mana ia berjalan | Secara tempatan, pada telefon, komputer riba, atau cip peranti | Pelayan jauh yang diakses melalui internet |
| Privasi data | Data kekal pada peranti secara lalai | Data dihantar ke pelayan pihak ketiga |
| Kependaman | Hampir segera, tiada perjalanan pergi-balik rangkaian | Menambah masa rangkaian + baris gilir pada setiap panggilan |
| Keupayaan luar talian | Berfungsi tanpa sambungan internet | Memerlukan sambungan aktif |
| Saiz/keupayaan model | Model lebih kecil, tertumpu pada tugasan | Boleh menjalankan model berskala terkehadapan, tujuan am |
| Struktur kos | Kos tetap perkakasan, tiada yuran setiap pertanyaan | Berdasarkan penggunaan, berskala dengan jumlah |
| Kesan bateri/terma | Menggunakan kuasa tempatan, mengehadkan penggunaan berat berterusan | Tiada kos pengiraan tempatan, tetapi bergantung pada rangkaian |
| Paling sesuai untuk | Tugasan sensitif privasi, sensitif kependaman, luar talian | Penaakulan kompleks, konteks besar, pengetahuan terkini |
Tiada satu lajur pun menang sepenuhnya. Kebanyakan sistem AI pengeluaran, dan kebanyakan peranti pengguna yang disenaraikan di atas, menggunakan pendekatan hibrid: mengendalikan permintaan rutin yang jelas takrifannya secara on-device, dan menyalurkan apa-apa yang memerlukan lebih keupayaan, lebih konteks, atau maklumat lebih terkini ke cloud.
Implikasi Perniagaan
Bagi perniagaan yang menilai di mana hendak menjalankan ciri AI, keputusan on-device berbanding cloud bukan sebenarnya tentang mana yang "lebih baik". Ia tentang memadankan model penggunaan dengan kekangan yang paling penting bagi kes penggunaan tertentu itu.
Jika aliran kerja menyentuh data terkawal atau sensitif, iaitu nota penjagaan kesihatan, rekod kewangan, maklumat HR, pemprosesan on-device menghapuskan seluruh kategori risiko penghantaran data sebelum sebarang kawalan privasi lain digunakan. Jika aliran kerja perlu berfungsi di lapangan dengan sambungan yang tidak boleh diharap, iaitu aplikasi pemeriksaan, pemandu penghantaran, tapak jauh, on-device selalunya satu-satunya pilihan yang benar-benar berfungsi. Dan jika sesuatu ciri akan digunakan pada jumlah yang sangat tinggi oleh pangkalan pengguna yang besar, pemprosesan on-device mengelakkan bil cloud setiap pertanyaan yang berskala dengan kejayaan.
Kompromi itu berjalan sebaliknya apabila sesuatu tugasan memerlukan penaakulan meluas, tetingkap konteks yang panjang, atau pengetahuan yang berubah cukup kerap sehingga model on-device statik tidak dapat mengejarnya. Context Window yang cukup besar untuk menganalisis kontrak penuh atau rantaian sokongan yang panjang secara amnya masih memerlukan Foundation Models berskala cloud, bukan model termampat yang berjalan pada cip telefon.
Kesimpulan praktikal bagi pemimpin yang menskop ciri AI: takrifkan keperluan Kependaman, privasi, dan sambungan terlebih dahulu, kemudian putuskan di mana inferens patut berjalan. On-device bukan pengganti yang lebih murah untuk cloud AI secara menyeluruh; ia jawapan yang tepat bagi satu set kes penggunaan tertentu yang semakin berkembang, dan jawapan yang salah bagi yang lain.
Konsep AI Berkaitan
- Edge AI - Kategori lebih luas bagi menjalankan AI pada perkakasan tempatan, daripada telefon hingga sensor industri
- Inferens - Langkah di mana model terlatih sebenarnya menghasilkan output, sama ada di cloud atau on-device
- Small Language Models - Model padat yang dibina khusus untuk berjalan pada perkakasan pengguna
- Quantization - Teknik pemampatan yang mengecilkan model supaya muat on-device
- Knowledge Distillation - Cara model kecil sedia on-device dilatih daripada model yang lebih besar
- Pemampatan Model - Set teknik lebih luas untuk mengecilkan model selain quantization sahaja
- Large Language Models - Model berskala terkehadapan yang masih biasanya memerlukan infrastruktur cloud
- Neural Networks - Seni bina asas yang menjadi sasaran pecutan NPU
Sumber Luaran
- Deloitte 2026 TMT Predictions: More Compute for AI, Not Less - Sebab kebanyakan inferens AI masih berjalan di pusat data walaupun pertumbuhan on-device
- Stanford HAI AI Index Report 2025 - Data tentang penurunan kos inferens yang didorong oleh model kecil yang cekap
- Counterpoint Research: GenAI Smartphone Forecast - Data penghantaran dan ramalan bagi telefon pintar berkeupayaan AI on-device
Soalan Lazim tentang On-Device AI
Apakah On-Device AI?
On-device AI ialah kecerdasan buatan yang berjalan terus pada perkakasan tempatan, seperti telefon pintar, komputer riba, atau kereta, berbanding menghantar permintaan ke pelayan jauh. Pemprosesan berlaku menggunakan cip terbina dalam seperti NPU, jadi sistem boleh bertindak balas tanpa sambungan internet dan data tidak sesekali meninggalkan peranti.
Apakah perbezaan antara on-device AI dan Edge AI?
On-device AI ialah satu jenis khusus Edge AI. Edge AI ialah kategori lebih luas bagi menjalankan AI di mana-mana sahaja di luar pusat data cloud berpusat, yang merangkumi pemprosesan on-device pada telefon serta pelayan gateway, peralatan kilang, dan infrastruktur telekomunikasi. On-device AI secara khusus bermaksud model berjalan pada perkakasan peribadi atau pengguna di hadapan pengguna itu.
Perkakasan apa yang membolehkan on-device AI?
Komponen utama ialah Neural Processing Unit (NPU), sejenis cip yang dibina khusus untuk pengiraan matriks yang diperlukan oleh neural networks. Pemproses telefon dan komputer riba moden memasangkan NPU bersama CPU dan GPU, membolehkan model AI termampat berjalan dengan cekap tanpa menghabiskan bateri seperti mana pemproses tujuan am akan lakukan.
Adakah on-device AI berfungsi tanpa sambungan internet?
Ya, itu salah satu kelebihan takrifannya. Kerana model dan pengiraan kedua-duanya berada pada peranti, ciri on-device AI terus berfungsi dalam mod pesawat, di kawasan tanpa isyarat, atau di mana-mana sahaja sambungan tidak boleh diharap.
Adakah on-device AI lebih peribadi berbanding cloud AI?
Secara amnya ya. Kerana inferens berlaku secara tempatan, input, seperti foto, memo suara, atau mesej, tidak perlu dihantar ke pelayan pihak ketiga untuk mendapatkan jawapan. Ini paling penting bagi data terkawal atau sensitif, di mana mengekalkan maklumat pada peranti menghapuskan seluruh kategori risiko penghantaran.
Apakah batasan utama on-device AI?
Dua kekangan paling penting: saiz model dan hayat bateri. Telefon dan komputer riba mempunyai jauh lebih sedikit memori berbanding kluster GPU pusat data, jadi model on-device lebih kecil dan kurang berkeupayaan secara meluas berbanding model cloud terkehadapan. Pemprosesan AI berterusan juga menggunakan kuasa dan menjana haba, yang mengehadkan sebanyak mana inferens tempatan yang boleh dikendalikan peranti berkuasa bateri secara berterusan.
Apakah contoh on-device AI pada 2026?
Apple Intelligence menjalankan kebanyakan modelnya terus pada iPhone, iPad, dan Mac. Gemini Nano daripada Google berjalan secara on-device pada telefon Pixel. Copilot+ PC daripada Microsoft memerlukan NPU bertaraf 40+ TOPS khusus untuk menjalankan ciri AI secara tempatan. Model Llama 3.2 1B dan 3B daripada Meta dibina khusus untuk penggunaan on-device pada telefon dan komputer riba.
Patutkah perniagaan membina on-device AI atau menggunakan cloud AI?
Ia bergantung pada kes penggunaan, bukan keutamaan menyeluruh. On-device AI sesuai bagi aliran kerja sensitif privasi, penggunaan luar talian atau lapangan, dan ciri jumlah tinggi di mana kos cloud setiap pertanyaan akan bertambah. Cloud AI sesuai bagi tugasan yang memerlukan penaakulan meluas, tetingkap konteks besar, atau pengetahuan yang berubah kerap. Kebanyakan sistem pengeluaran menggunakan kedua-duanya, menyalurkan permintaan ringkas secara tempatan dan yang kompleks ke cloud.
Adakah on-device AI akan menggantikan cloud AI?
Kurang berkemungkinan, sekurang-kurangnya dalam jangka masa terdekat. Ramalan Deloitte bagi 2026 mengunjurkan kebanyakan pengkomputeran AI masih akan berjalan di pusat data walaupun pemecut on-device bertambah baik, kerana NPU semasa sesuai untuk tugasan ringan sekali jalan berbanding penaakulan kompleks yang berterusan. On-device dan cloud AI sedang bertumpu ke arah model hibrid, bukan penggantian satu sama lain.

Co-Founder, Rework.com
On this page
- Bagaimana On-Device AI Sebenarnya Berjalan Secara Tempatan
- Sebab Perniagaan dan Pengguna Mahukannya: Privasi, Kependaman, Luar Talian, Kos
- Batasan Sebenar: Saiz Model dan Bateri
- Fakta Utama
- On-Device AI pada 2026: Contoh Sebenar
- On-Device AI Berbanding Cloud AI
- Implikasi Perniagaan
- Konsep AI Berkaitan
- Sumber Luaran