Google Ubah Bahasa Isyarat Menjadi Teks, Video Kamera Disebut Tetap Privat

Google memperkenalkan teknologi kecerdasan buatan yang memungkinkan bahasa isyarat diterjemahkan langsung menjadi teks melalui kamera ponsel. Fitur bernama Sign-Language-to-Text atau SL2T itu dirancang agar pengguna dapat menyampaikan pesan tanpa mengandalkan input suara maupun pengetikan manual.

Salah satu poin utama yang ditekankan Google adalah mekanisme privasi dalam pemrosesan gestur. Video mentah dari kamera disebut tidak dikirim ke server karena perangkat terlebih dahulu mengubah rekaman menjadi data titik koordinat.

Gestur Dipetakan Menjadi Data Koordinat

SL2T menggunakan teknologi computer vision MediaPipe Holistic untuk membaca bagian tubuh yang terlibat saat pengguna berbahasa isyarat. Sistem tidak hanya mengenali posisi tangan, tetapi juga gerakan lengan, tubuh, kepala, serta ekspresi wajah.

Rekaman tersebut dipetakan menjadi titik-titik koordinat yang mewakili bentuk dan pergerakan tubuh pengguna. Data koordinat inilah yang kemudian dikirim untuk diproses oleh model AI hingga menghasilkan teks pada layar.

Pendekatan ini membuat kamera ponsel berfungsi sebagai pengganti mikrofon dalam proses memasukkan teks. Secara konsep, cara kerjanya menyerupai fitur dikte suara ke teks, tetapi sumber inputnya berasal dari bahasa isyarat.

AspekKeterangan
Pemrosesan awalVideo diubah menjadi data titik koordinat
Teknologi pendukungMediaPipe Holistic
Bagian tubuh yang dibacaTangan, lengan, tubuh, kepala, dan ekspresi wajah
Dukungan awalASL ke bahasa Inggris

Dipakai Melalui Gboard dan Live Transcribe

Pada Gboard, pengguna dapat menekan ikon Sign Language to Text yang ditempatkan di bagian atas papan ketik. Setelah kamera muncul, gestur pengguna akan dikenali dan hasil terjemahannya ditampilkan sebagai teks.

SL2T juga tersedia melalui Live Transcribe untuk mendukung respons bahasa isyarat dalam percakapan dengan Gemini. Kehadiran pada dua layanan tersebut membuka skenario penggunaan yang berbeda, mulai dari memasukkan teks hingga berinteraksi dalam percakapan.

Google DeepMind memperkenalkan SL2T sebagai model penerjemah multibahasa dan menjadikannya salah satu kemampuan awal di seri Google Pixel 11. Namun, dukungan awalnya masih berfokus pada penerjemahan American Sign Language atau ASL ke bahasa Inggris.

Pelatihan Menggunakan Lebih dari 100.000 Jam Data

Google menyatakan pengembangan model ini dilakukan bersama berbagai komunitas tuli di dunia. Keterlibatan tersebut ditujukan untuk membantu sistem memahami unsur bahasa isyarat yang lebih luas daripada sekadar gerakan tangan.

Untuk melatih SL2T, Google menggunakan lebih dari 100.000 jam data dari lebih dari 50 bahasa isyarat. Sekitar 25 persen dari keseluruhan data pelatihan tersebut mencakup ASL yang menjadi bahasa isyarat pertama untuk dukungan fitur ini.

Dalam pengujian FLEURS-ASL, Google menyebut modelnya memperoleh skor 70 BLEURT secara zero-shot. Perusahaan menyatakan capaian itu merupakan skor tertinggi yang pernah dilaporkan untuk penerjemahan ASL ke bahasa Inggris pada benchmark tersebut.

Pengujian dan DukunganHasil atau Keterangan
Data pelatihanLebih dari 100.000 jam
Jumlah bahasa isyaratLebih dari 50 bahasa isyarat
Benchmark FLEURS-ASL70 BLEURT secara zero-shot
Kompatibilitas gesturBahasa isyarat satu tangan dan pengguna tangan kiri

Masih Ada Batasan Penerjemahan

SL2T belum dapat menerjemahkan seluruh bentuk komunikasi bahasa isyarat secara sempurna dalam setiap situasi. Model masih berpotensi keliru saat menghadapi tanda yang jarang digunakan, fingerspelling yang cepat, konstruksi kalimat tertentu, serta konteks waktu.

Tekno.kompas.com melaporkan fitur ini saat ini hanya tersedia untuk seri Google Pixel 11. Google menyatakan SL2T akan diperluas ke lebih banyak perangkat sambil menambah dukungan bahasa isyarat dan bahasa terjemahan pada masa mendatang.

Baca Juga