Cara mengevaluasi agen AI yang native bahasa Arab
Hampir setiap vendor yang menjual ke kawasan GCC kini mengklaim mendukung bahasa Arab. Sangat sedikit yang memaksudkan hal yang sama. Panduan ini memberi Anda delapan uji yang akan kami jalankan seandainya kami duduk di sisi meja Anda — masing-masing dirancang untuk menjatuhkan chatbot terjemahan dalam dua menit.
Diterbitkan
Mengapa “mendukung bahasa Arab” bukan sebuah spesifikasi
Model yang dilatih sebagian besar dengan bahasa Inggris lalu diarahkan ke prompt berbahasa Arab memang akan menghasilkan bahasa Arab standar yang gramatikal. Ia juga akan terdengar seperti surat edaran pemerintah. Pelanggan Anda tidak menulis kepada Anda dalam bahasa Arab standar — mereka menulis dalam dialek Saudi, Emirati, atau Khaleeji, separuhnya dengan huruf Latin, dengan nama produk berbahasa Inggris diselipkan di tengah kalimat.
Jurang di antara keduanya itulah tempat evaluasi tersesat. Demonya bernaskah dalam bahasa Arab standar yang rapi, semuanya mulus, lalu pilotnya bertemu kotak masuk WhatsApp yang sesungguhnya. Jadi dorong demo itu keluar dari naskahnya sejak awal dan berulang kali.
Uji 1 — Dialek, bukan sekadar bahasa Arab
Kirim tiga pesan yang ditulis persis seperti cara pelanggan Anda menulis: satu dalam dialek Saudi, satu Mesir, satu Levantin. Agen yang menguasai dialek menjawab ketiganya tanpa memaksa pelanggan pindah ke bahasa Arab standar dan tanpa meminta mereka mengulang kalimatnya.
Perhatikan register jawabannya, bukan hanya ketepatannya. Agen yang menjawab pertanyaan dialek santai dengan fus-ha formal telah memahami kata-katanya tetapi meleset memahami orangnya.
Uji 2 — Alih kode di dalam satu sesi
Mulai dalam bahasa Arab, ajukan pertanyaan lanjutan dalam bahasa Inggris, lalu kembali ke bahasa Arab. Agen harus membawa konteks penuh melewati ketiga giliran itu tanpa mereset, bertanya ulang, atau menjawab pertanyaan kedua dalam bahasa pertanyaan pertama.
Ini kegagalan paling umum di produksi, karena kebanyakan sistem memperlakukan bahasa sebagai pengaturan per sesi, bukan sebagai properti per pesan.
Uji 3 — Angka, tanggal, dan uang dalam bahasa Arab
Tanyakan pesanan yang dibuat “Kamis lalu” dan lihat apakah agen memetakan tanggal itu ke kalender Hijriah atau Masehi — dan apakah ia menyebutkan yang mana. Tanyakan sebuah harga dan periksa apakah SAR ditampilkan benar dalam kalimat RTL, dengan arah digit sesuai ekspektasi pelanggan Anda.
Teks dwiarah adalah tempat dukungan bahasa Arab yang tipis terlihat jelas jebol: harga terbalik, nomor pesanan terpotong, dan pelanggan kehilangan kepercayaan sebelum selesai membaca.
Uji 4 — Nama dan transliterasi
Berikan agen satu nama dalam dua bentuk — عبدالرحمن dan Abdulrahman — dalam percakapan yang sama, lalu periksa apakah ia memperlakukannya sebagai satu orang. Kemudian minta ia menuliskan nama itu kembali ke sebuah kolom CRM dan lihat bentuk mana yang dipilihnya.
Penyatuan identitas lintas aksara memang tidak menarik, tapi menentukan apakah CRM Anda berakhir dengan satu catatan atau dua.
Uji 5 — Grounding dan penolakan
Tanyakan tingkatan produk, diskon, atau kebijakan yang tidak Anda tawarkan. Jawaban yang benar adalah “kami tidak menawarkan itu” secara jelas, boleh disertai alternatif terdekat yang nyata. Agen yang mengarang jawaban Arab yang terdengar masuk akal di sini akan mengarang juga di depan pelanggan.
Ajukan pertanyaan karangan yang sama dua kali, dalam bahasa Arab dan Inggris. Sebagian sistem ter-grounding baik dalam bahasa Inggris namun berhalusinasi dalam bahasa Arab, karena indeks pencariannya hanya pernah dibangun dari dokumen berbahasa Inggris.
Uji 6 — Eskalasi dengan konteks
Paksa sebuah eskalasi lalu lihat apa yang diterima manusianya. Transkrip dwibahasa yang lengkap, maksud yang sudah teridentifikasi, dan pertanyaan asli pelanggan adalah serah terima yang berfungsi. Tiket bertuliskan “pelanggan butuh bantuan” hanyalah antrean dengan langkah tambahan.
Tanyakan secara spesifik apakah ringkasan yang diserahkan ditulis dalam bahasa kerja staf manusianya, bukan bahasa pelanggannya.
Uji 7 — Suara, kalau suara termasuk cakupan
Kualitas teks tidak memberi tahu apa pun soal kualitas panggilan. Minta agen menelepon sebuah ponsel dan dengarkan tiga hal: jeda sebelum kata pertama, cara ia menangani interupsi di tengah kalimat, dan apakah prosodi bahasa Arabnya terdengar seperti orang atau seperti sistem navigasi.
Lalu tanyakan apa yang terjadi kalau salurannya berisik, karena panggilan tindak lanjut yang sebenarnya terjadi di dalam mobil.
Uji 8 — Apa yang dilakukannya setelah percakapan
Percakapan hanyalah separuh yang terlihat. Minta vendor menunjukkan write-back-nya: catatan CRM, kolom ERP, refund yang benar-benar diterbitkan. Minta lihat jejak auditnya untuk tindakan itu, di sistem yang memang sudah Anda jalankan.
Agen yang pandai bicara tetapi tidak menulis apa pun kembali hanya memindahkan masalah Anda dari kotak masuk ke antrean, dan meninggalkan pekerjaan manualnya persis di tempatnya semula.