Mengapa Voice AI Belum Mencapai Momen ChatGPT

11/10/2026 21:05

CIANJUR.CO - Suara dipandang berpeluang menjadi antarmuka teknologi berikutnya. Minat terhadap gagasan itu ikut mendorong investor mengucurkan miliaran dolar ke berbagai startup voice AI. Perusahaan-perusahaan tersebut mengembangkan beragam produk, mulai dari pembuat model dan penyedia layanan pelanggan untuk perusahaan hingga pencatat rapat dan perangkat dikte berbasis kecerdasan buatan.

Namun, ramainya investasi dan peluncuran produk belum serta-merta membuat percakapan dengan AI terasa alami dan dapat diandalkan. Setiap pekan muncul model atau alat baru yang mengklaim mampu berbicara dan terdengar seperti manusia. Meski demikian, pengalaman penggunaan di lapangan masih menghadapi persoalan pemahaman, kecepatan menjawab, dan ketepatan menangkap informasi.

Seperti diberitakan TechCrunch AI, Shawn Wen, CTO PolyAI, platform voice AI untuk perusahaan, menilai teknologi ini belum mencapai “momen ChatGPT”. Penilaian tersebut disampaikan meski model full-duplex sudah dikembangkan. Model itu dapat berbicara sambil mendengarkan pengguna, tetapi Wen menyebut kemampuan tersebut baru menandai satu tahapan dalam pengembangan voice AI.

“Tantangan berikutnya adalah membuat penalaran sangat cepat,” ujar Wen saat tampil di panggung konferensi HumanX bulan lalu. Menurut dia, model perlu dapat mengambil jawaban dengan segera agar percakapan terasa natural. Artinya, kemampuan berbicara dan mendengar secara bersamaan belum cukup apabila sistem masih lambat memproses informasi atau merespons pertanyaan.

Baca juga: Apple Rekrut Tim Huxe dan Lisensikan Teknologinya

Wen juga membahas penggunaan agen AI dalam layanan pelanggan. Agen semacam itu, katanya, sebaiknya tidak terdengar seperti robot dan perlu memberi penelepon keyakinan bahwa masalah mereka dapat diselesaikan. Suara yang cukup baik dapat membuka interaksi, tetapi pengguna juga perlu melihat bahwa agen mampu menanggapi kebutuhan mereka.

Ia menggambarkan bagaimana kepercayaan pelanggan dapat terbentuk secara bertahap. Setelah kualitas suara memadai dan pelanggan bersedia menjalani dua atau tiga giliran percakapan pertama, mereka mungkin mulai merasa yakin. Seiring waktu, kata Wen, pelanggan dapat berpikir bahwa mereka tidak perlu berbicara dengan manusia jika agen AI mampu menyelesaikan masalahnya. Pernyataan itu menjelaskan tahapan penerimaan yang ia harapkan, bukan berarti semua pelanggan telah beralih ke agen suara.

Transkripsi menjadi dasar tindakan berikutnya

Alex Gay, CMO Otter, perusahaan pencatat rapat, menyoroti sejumlah kemampuan yang diperlukan untuk mendukung otomatisasi. Di antaranya adalah mengenali siapa yang berbicara, menangkap maksud pembicaraan, lalu menyusun informasi tersebut dengan pengetahuan organisasi. Rangkaian itu berhubungan dengan kemampuan sistem memahami isi rapat, bukan sekadar mengubah suara menjadi teks.

Otter juga sedang mengembangkan digital twin yang dapat mewakili orang dalam rapat. Gay mengatakan suara keluaran teknologi tersebut perlu memiliki ekspresi emosional seperti percakapan manusia. Baginya, kualitas pengalaman dalam rapat tidak hanya ditentukan oleh jawaban yang diberikan, tetapi juga oleh kemampuan membangun interaksi yang terasa memiliki hubungan antarpeserta.

Baca juga: Deretan Agen AI yang Bisa Diakses Lewat Pesan Teks

Ia mencontohkan bahwa percakapan rapat yang baik dapat memuat perdebatan dan diskusi strategis, dengan relasi yang mendasari pembicaraan. Jika pengalaman seperti itu tidak dapat dihadirkan melalui avatar, menurut Gay, hasilnya hanya akan menjadi chatbot tanya jawab. Dengan demikian, digital twin perlu lebih dari sekadar menghasilkan respons verbal untuk bisa mendukung jenis interaksi yang ia gambarkan.

Masalah pemahaman masih tampak pada asisten AI yang keliru menangkap maksud pengguna. Pencatat rapat pun dapat menghasilkan transkrip atau ringkasan yang tidak tepat. Wen mengatakan model ASR, singkatan dari Automatic Speech Recognition atau pengenalan suara otomatis, sering melewatkan kata kunci penting. Ketika kata-kata tersebut luput, sistem tidak memperoleh konteks percakapan secara utuh.

Gay sependapat bahwa transkripsi masih perlu ditingkatkan. Ia juga menyebut bahasa sebagai salah satu bidang yang perlu diperbaiki dalam model suara. Bagi Otter, transkripsi bukan hasil akhir, melainkan lapisan awal yang dapat digunakan untuk mendorong peningkatan produktivitas. Karena itu, mutu pekerjaan yang bergantung pada transkrip akan terpengaruh oleh akurasi hasil pengenalan suara tersebut.

Gay menjelaskan, apabila transkripsi awal tidak cukup akurat, tindakan lanjutan yang dibuat dari hasil itu dapat menjadi keliru. Dampaknya tidak berhenti pada kesalahan teks: ketika sistem mulai melakukan tindakan berdasarkan informasi yang salah, pengguna dapat kehilangan kepercayaan terhadap platform. Ia menegaskan pentingnya Otter terus memperbaiki model ASR karena pengaruhnya menjangkau berbagai proses setelah transkripsi.

Baca juga: TechCrunch Disrupt 2026 Digelar 13–15 Oktober, Tampilkan 300 Startup

Pengguna perlu mengetahui saat AI terlibat

Selain keandalan hasil, penggunaan perangkat voice AI memunculkan persoalan keterbukaan. Pengguna perlu diberi tahu apabila percakapan direkam atau mereka sedang berbicara dengan AI. Otter mengatakan ingin menumbuhkan kepercayaan di antara orang-orang yang mengikuti rapat. Salah satu cara yang ingin dicoba perusahaan itu adalah memberi pemberitahuan kepada semua orang di ruang obrolan bahwa rapat sedang direkam.

Rencana pemberitahuan tersebut, menurut Otter, dapat diterapkan bahkan pada rapat yang tidak dihadiri bot. Sementara itu, Wen menilai penting untuk menjelaskan kepada orang-orang dalam panggilan perusahaan bahwa mereka sedang berbicara dengan AI. Keterbukaan ini menjadi bagian dari persoalan penggunaan voice AI, berdampingan dengan mutu suara, kecepatan penalaran, ketepatan transkripsi, dan kemampuan memahami konteks.

Berbagai kebutuhan tersebut menunjukkan bahwa pengembangan voice AI tidak hanya berpusat pada suara yang terdengar seperti manusia. Penilaian Wen dan Gay mencakup pula proses di balik percakapan: sistem harus menangkap kata dan maksud dengan tepat, mengolah informasi secara cepat, serta menjaga agar tindakan lanjutan tidak didasarkan pada pemahaman yang keliru.