Cara AI Agent Menaakul: ReAct, Perancangan, dan Refleksi

Turn this article into takeaways for your work.
Each assistant summarizes the article only for you and suggests best practices for your work.
AI agent menaakul dengan berselang-seli antara berfikir dan bertindak: ia menulis fikiran ringkas tentang apa yang perlu dilakukan seterusnya, mengambil tindakan, biasanya panggilan alat, membaca apa yang berlaku, dan berfikir semula sebelum langkah berikutnya. Corak berselang-seli itu dipanggil ReAct, dan ia asas yang dibina oleh kebanyakan agent. Dua teknik melanjutkannya: perancangan, di mana agent memetakan beberapa langkah sebelum bertindak atas mana-mana satu daripadanya, dan refleksi, di mana ia mengkritik percubaannya sendiri dan mencuba semula apabila percubaan pertama tidak mencukupi.
Penaakulan Ialah Langkah "Menaakul" dalam Gelung, Dijadikan Kelihatan
Cara AI agent berfungsi menghuraikan gelung agent sebagai mengamati, menaakul, bertindak, memerhati, ulang. Artikel ini tentang apa yang berlaku di dalam langkah menaakul itu, dan ia kurang misteri daripada yang kedengaran. "Penaakulan" di sini bermaksud model menjana teks perantaraan tentang langkah seterusnya sebelum melaksanakan tindakan, dalam perbualan yang sama, di mana anda boleh membacanya. Ia bukan proses tersembunyi yang berlaku di tempat lain. Agent sokongan yang menentukan cara mengendalikan tiket mungkin menjana sesuatu seperti "mesej ini menyebut pembayaran gagal dan nada yang marah, jadi saya perlu menyemak sejarah transaksi sebelum menyediakan draf balasan" sebelum ia memanggil sebarang alat.
Tabiat menulis langkah penaakulan perantaraan ini dipanggil chain-of-thought, dan ia blok binaan di bawah semua yang dibincangkan dalam artikel ini. Apa itu chain-of-thought membincangkan teknik itu secara tersendiri. Apa yang berikut di sini khusus tentang bagaimana penaakulan itu disambungkan ke dalam gelung yang turut mengambil tindakan sebenar, iaitu masalah yang berbeza daripada menaakul sesuatu soalan statik.
ReAct: Penaakulan dan Tindakan dalam Gelung yang Sama
ReAct, singkatan bagi "reasoning and acting" (menaakul dan bertindak), berasal daripada kertas kerja 2022 oleh Yao dan rakan-rakan yang menunjukkan model bahasa berprestasi lebih baik apabila ia menyelang-selikan langkah penaakulan ringkas dengan tindakan, bukan menaakul sehingga jawapan akhir dahulu kemudian baru bertindak, atau bertindak tanpa sebarang penaakulan. Coraknya mudah: Fikiran, kemudian Tindakan, kemudian Pemerhatian, diulang sehingga tugas selesai. Fikiran menerangkan apa yang cuba difikirkan agent seterusnya, tindakan biasanya panggilan alat, dan pemerhatian ialah apa yang dipulangkan.

Keputusan penyelidikan asal itu amat ketara. Pada dua penanda aras yang menguji pembuatan keputusan interaktif, ALFWorld dan WebShop, ReAct mengatasi garis dasar pembelajaran peniruan dan pengukuhan sebanyak 34 mata peratusan (71% berbanding 37%) dan lebih kurang 11 mata peratusan (40% berbanding 29.1%), hanya menggunakan satu atau dua contoh untuk menunjukkan corak itu. Sebab penyelang-selian berfungsi lebih baik daripada merancang segala-galanya di awal kemudian melaksanakan secara membuta tuli adalah mudah: agent dapat membetulkan hala tuju berdasarkan apa yang benar-benar berlaku, bukan apa yang dianggapnya akan berlaku. Jika carian tidak memulangkan apa-apa yang berguna, fikiran seterusnya boleh menyatakannya dan mencuba pertanyaan lain, bukannya meluru ke hadapan dengan rancangan yang dibina daripada tekaan.
Ini mekanisme yang sama di sebalik gelung yang diterangkan dalam corak Autonomous Agent: menyerap keadaan semasa, menganalisis apa yang diketahui dan apa yang kurang, meramalkan tindakan terbaik seterusnya, menjananya, melaksanakannya, dan mengulang. ReAct ialah separuh penaakulan bagi kitaran itu yang dijadikan konkrit.
Perancangan: Berfikir Beberapa Langkah ke Hadapan
ReAct tulen berimprovisasi satu langkah pada satu masa, yang berkesan untuk tugas di mana langkah seterusnya yang tepat hanya jelas selepas melihat hasil terakhir. Sesetengah tugas mendapat manfaat daripada struktur yang lebih daripada itu. Perancangan membuat agent menguraikan matlamat kepada set sub-langkah yang tersusun sebelum melaksanakan mana-mana satu, lebih dekat dengan menulis kerangka sebelum menyediakan draf berbanding mereka-reka ayat demi ayat.

Tugas ramalan hasil ialah contoh yang baik. Daripada berimprovisasi satu pertanyaan pada satu masa, agent yang dibina berdasarkan pelan AI Forecasting Agent mendapat manfaat daripada merancang pendekatannya dahulu: tarik kadar penutupan sejarah mengikut segmen, semak liputan pipeline semasa, beri pemberat pada deal terbuka mengikut peringkat, kemudian gabungkan semuanya menjadi julat. Setiap sub-langkah itu mungkin masih menjalankan gelung ReAct sendiri di dalamnya, tetapi bentuk keseluruhannya diputuskan di awal dan bukan ditemui langkah demi langkah.
Perancangan bukan komitmen sekali sahaja. Apabila satu langkah gagal atau maklumat baharu mengubah gambaran, agent yang dibina dengan baik merancang semula dan bukan memaksa rancangan asal berjalan juga. Satu lanjutan yang wajar diketahui ialah penaakulan tree-of-thought, di mana agent meneroka lebih daripada satu rancangan calon dan membandingkannya sebelum membuat komitmen, berguna apabila memang terdapat lebih daripada satu pendekatan yang munasabah. Apa itu model penaakulan membincangkan bidang itu dengan lebih mendalam, bersama peralihan yang lebih luas ke arah model yang menggunakan lebih banyak pengiraan untuk menimbang sebelum menjawab.
Refleksi: Menangkap Kesilapan Sendiri
Refleksi menambah keupayaan yang berbeza: selepas menghasilkan satu percubaan, agent menilai outputnya sendiri berbanding matlamat dan menyemaknya semula apabila ia tidak mencukupi, bukan menganggap draf pertama sebagai muktamad.

Penyelidikan di sebalik ini, kertas kerja 2023 tentang Reflexion oleh Shinn dan rakan-rakan, wajar diketahui angka sebenarnya. Pendekatan mereka mencapai ketepatan pass@1 sebanyak 91% pada penanda aras pengekodan HumanEval, berbanding 80% bagi garis dasar GPT-4 piawai pada masa itu, hanya menggunakan gelung kritikan kendiri secara lisan yang disimpan dalam memori antara percubaan. Tiada latihan semula, tiada pemberat model baharu, hanya agent yang membaca percubaannya yang gagal, menulis apa yang tidak kena dalam bahasa biasa, dan mencuba semula dengan nota itu dalam konteks. Kritikan kendiri yang disimpan itu ialah satu bentuk memori kerja yang dibincangkan dalam cara AI agent berfungsi; jika anda mahu gambaran lebih lengkap tentang cara agent menyimpan maklumat seperti ini merentasi langkah dan larian, memori AI ialah rujukan yang lebih mendalam.
Dari sudut perniagaan, pelan Content Drafting Agent menggunakan idea berkaitan: sediakan draf, semak draf berbanding garis panduan jenama dan elemen yang diperlukan, dan semak semula sebelum menyerahkannya kepada manusia untuk semakan akhir. Semakan kendiri tidak menggantikan semakan manusia. Ia mengurangkan bilangan draf yang tiba dengan masalah ketara yang sebenarnya boleh dielakkan.
Menggabungkan Semuanya: Panduan Jejak Penaakulan
Beginilah rupa ketiga-tiga teknik apabila digabungkan, pada satu tugas sebenar. Pelan AI Research Agent diminta menghasilkan taklimat tentang syarikat sasaran sebelum panggilan jualan.
- Rancang. Agent memecahkan matlamat kepada sub-tugas: aktiviti pembiayaan terkini, perubahan kepimpinan, dan sebarang berita dari suku tahun lepas.
- Gelung ReAct, sub-tugas pertama. Fikiran: "Saya perlukan berita pembiayaan terkini." Tindakan: cari. Pemerhatian: tiga hasil, satu daripada sumber yang boleh dipercayai. Fikiran: "Ini kelihatan terkini dan relevan, saya akan membacanya." Tindakan: ambil halaman. Pemerhatian: pusingan pembiayaan disahkan dengan tarikh dan jumlah.
- Gelung ReAct, sub-tugas kedua dan ketiga. Kitaran fikiran-tindakan-pemerhatian yang sama berulang untuk perubahan kepimpinan dan berita terkini, setiap gelung berhenti sebaik agent menilai ia mempunyai isyarat yang mencukupi.
- Refleksi. Sebelum memuktamadkan, agent menyemak draf sendiri berbanding matlamat asal: adakah ia meliputi ketiga-tiga sub-tugas, adakah sesuatu sudah lapuk atau belum disahkan, adakah sumber tiada bagi mana-mana dakwaan. Jika jurang ditemui, itu menjadi satu lagi carian yang disasarkan dan bukan menghantar taklimat dengan lompang di dalamnya.
Tiga teknik, satu output yang koheren, dan jejak pada setiap langkah yang boleh dibaca semula dan difahami oleh manusia, yang sama pentingnya dengan jawapan akhir.
Mengapa Kedalaman Penaakulan Ialah Pertukaran Kos dan Kepercayaan
Semua ini tidak percuma. Setiap fikiran yang ditulis agent ialah token, dan setiap kitaran ReAct atau pusingan refleksi tambahan menambah kependaman. Carian mudah tidak memerlukan perancangan berbilang langkah dan pusingan kritikan kendiri; ia memerlukan jawapan yang pantas dan terus. Apa itu model penaakulan membincangkan soalan yang lebih luas tentang bila penaakulan yang dilanjutkan dan sengaja berbaloi dengan kos tambahan dan bila respons piawai yang pantas ialah pilihan yang lebih baik, perbezaan yang terpakai sama banyak pada kedalaman penaakulan dalaman agent seperti pada pemilihan model.
Sisi lain pertukaran ini ialah kepercayaan, bukan sekadar kos. Model boleh menaakul sehingga tindakan yang salah dengan selancar dan seyakin ia menaakul sehingga tindakan yang betul. Panduan Building Effective Agents daripada Anthropic, yang diambil daripada penggunaan pengeluaran, menyokong pendapat untuk mengekalkan gelung agentic semudah yang dibenarkan tugas dan bukan mencapai autonomi maksimum secara lalai, tepat kerana lebih banyak langkah penaakulan bermakna lebih banyak tempat untuk kesilapan masuk tanpa disedari. Itulah sebabnya setiap jejak penaakulan perlu dilog dan boleh disemak, bukan hanya tindakan akhir; kebolehperhatian AI agent membincangkan apa yang perlu ada dalam lapisan pengelogan dan pemantauan itu.
Fakta Utama
- Penaakulan dalam agent bermaksud model menjana teks perantaraan yang kelihatan tentang langkah seterusnya sebelum bertindak, selalunya melalui proses gaya chain-of-thought.
- ReAct menyelang-selikan penaakulan dan tindakan dalam gelung yang sama. Dalam penyelidikan asal, ini mengatasi garis dasar pembelajaran peniruan dan pengukuhan sebanyak 34 mata pada ALFWorld dan lebih kurang 11 mata pada WebShop.
- Perancangan menguraikan matlamat kepada sub-langkah tersusun sebelum melaksanakan, dan agent yang dibina dengan baik merancang semula apabila satu langkah gagal atau maklumat baharu mengubah gambaran.
- Refleksi membuat agent mengkritik percubaannya sendiri dan menyemak semula. Penyelidikan Reflexion mencapai 91% pass@1 pada HumanEval berbanding garis dasar 80% menggunakan gelung kritikan kendiri secara lisan, tanpa sebarang latihan semula.
- Penaakulan yang lebih mendalam menggunakan lebih banyak token, masa, dan wang, dan tidak mengurangkan risiko tindakan yang salah tetapi diyakini, sebab itulah jejak penaakulan perlu dilog dan boleh disemak, bukan sekadar dipercayai.
Soalan Lazim tentang Cara AI Agent Menaakul
Apakah ReAct dalam AI agent?
ReAct bermaksud menaakul dan bertindak. Ia corak di mana AI agent menyelang-selikan langkah penaakulan ringkas (fikiran) dengan tindakan sebenar (biasanya panggilan alat) dan membaca hasilnya (pemerhatian) sebelum fikiran seterusnya, bukan menaakul sehingga jawapan akhir sebelum bertindak atau bertindak tanpa sebarang penaakulan.
Apakah perbezaan antara perancangan dengan refleksi dalam AI agent?
Perancangan berlaku sebelum pelaksanaan: agent memecahkan matlamat kepada set sub-langkah yang tersusun di awal. Refleksi berlaku selepas percubaan: agent menilai outputnya sendiri berbanding matlamat dan menyemaknya semula jika tidak mencukupi. Banyak agent pengeluaran menggunakan kedua-duanya, bersama penaakulan langkah demi langkah gaya ReAct dalam setiap sub-tugas yang dirancang.
Adakah menambah lebih banyak langkah penaakulan menjadikan AI agent lebih tepat?
Selalunya, tetapi tidak secara automatik, dan tidak percuma. Penyelidikan tentang pendekatan ReAct dan berasaskan refleksi menunjukkan peningkatan ketepatan yang nyata pada tugas berbilang langkah. Tetapi setiap langkah penaakulan tambahan menelan token dan masa, dan jejak penaakulan yang lebih panjang masih boleh sampai kepada kesimpulan yang salah tetapi diyakini, sebab itulah jejak perlu dilog dan disemak, bukan dipercayai semata-mata kerana ia lebih panjang.
Bolehkah AI agent membetulkan kesilapannya sendiri?
Ya, dalam had tertentu. Refleksi membolehkan agent menangkap dan membetulkan kelas kesilapan tertentu, seperti ujian yang gagal atau draf yang tidak lengkap, dengan mengkritik outputnya sendiri dan mencuba semula. Ia tidak dapat menangkap kesilapan yang tidak boleh dikesan daripada maklumat yang ada padanya, sebab itulah semakan manusia masih penting untuk keputusan yang berimpak besar.
Bagaimanakah penaakulan agent berkait dengan model penaakulan seperti o1 daripada OpenAI?
Ia berkaitan tetapi berbeza. Model penaakulan dilatih untuk menggunakan pengiraan tambahan untuk menimbang sebelum menjawab sebarang soalan tunggal. Teknik penaakulan agent seperti ReAct, perancangan, dan refleksi ialah corak untuk menstrukturkan pertimbangan itu merentasi tugas berbilang langkah yang turut melibatkan tindakan sebenar. Agent boleh dibina di atas model piawai atau model penaakulan, dan pilihannya bergantung pada betapa kompleksnya tuntutan penaakulan tugas itu.
Adakah chain-of-thought sama dengan penaakulan agent?
Chain-of-thought ialah teknik asas: membuat model menulis langkah penaakulan perantaraan dan bukan terus melompat ke jawapan. Penaakulan agent dibina di atas tabiat yang sama tetapi menyambungkannya ke dalam gelung yang turut mengambil tindakan dan membaca semula hasil sebenar, iaitu masalah yang berbeza dan lebih rumit daripada menaakul satu soalan statik.
Ke Mana Seterusnya
Penaakulan menentukan apa yang agent lakukan seterusnya; cara AI agent menggunakan alat membincangkan apa yang berlaku sebaik keputusan itu menjadi tindakan. Untuk melihat bagaimana gelung penaakulan satu agent berubah apabila kerja dibahagikan kepada beberapa agent, lihat sistem multi-agent. Dan jika anda bersedia memasukkan ini ke dalam agent anda sendiri, cara membina AI agent membimbing proses pembinaan dari awal hingga akhir, manakala ringkasan alat produktiviti dan panduan cara memilih pembantu pengekodan AI ialah persinggahan seterusnya yang berguna jika agent pengekodan yang berat penaakulan ialah jenis alat yang anda nilai.

On this page
- Penaakulan Ialah Langkah "Menaakul" dalam Gelung, Dijadikan Kelihatan
- ReAct: Penaakulan dan Tindakan dalam Gelung yang Sama
- Perancangan: Berfikir Beberapa Langkah ke Hadapan
- Refleksi: Menangkap Kesilapan Sendiri
- Menggabungkan Semuanya: Panduan Jejak Penaakulan
- Mengapa Kedalaman Penaakulan Ialah Pertukaran Kos dan Kepercayaan
- Fakta Utama
- Ke Mana Seterusnya