— Google kembali memperluas kemampuan kecerdasan buatannya dengan memperkenalkan Gemini 3.5 Transcribe. Model terbaru ini dirancang untuk mengubah percakapan dan rekaman audio menjadi teks dengan kemampuan memahami lebih dari 85 bahasa sekaligus mengenali istilah teknis yang digunakan pengguna.

Gemini 3.5 Transcribe mulai tersedia pada 26 Agustus 2026. Kehadirannya menjadi pengembangan lanjutan dari model transkripsi Chirp 3, dengan fokus pada peningkatan kemampuan multibahasa, akurasi pengenalan kata, serta pemahaman cara berbicara yang lebih alami.

Gemini 3.5 Transcribe Bawa Kemampuan Transkripsi Lebih Canggih

Google menyebut Gemini 3.5 Transcribe menghadirkan peningkatan besar dibandingkan Chirp 3, terutama dalam menangani berbagai bahasa dan mengurangi tingkat kesalahan ketika mengubah audio menjadi teks.

Model ini tidak sekadar menyalin percakapan secara mentah. Gemini 3.5 Transcribe dapat menyusun hasil transkripsi secara otomatis agar lebih mudah dibaca, termasuk menghilangkan kata pengisi seperti “um” dan “uh”.

Pengguna juga dapat melakukan penyuntingan melalui perintah suara. Kemampuan tersebut memungkinkan proses mengubah atau memperbaiki hasil transkripsi dilakukan secara lebih natural tanpa harus selalu menyentuh keyboard.

Salah satu kemampuan yang menarik adalah dukungan kosakata khusus. Pengguna dapat memberikan istilah atau ejaan tertentu kepada model sehingga sistem dapat menyesuaikan hasil transkripsi dengan jargon yang digunakan dalam bidang tertentu.

Fitur tersebut berpotensi membantu pekerjaan yang menggunakan banyak istilah teknis, termasuk rapat profesional, dokumentasi, podcast, hingga pencatatan informasi dengan kode atau nomor tertentu.

Gemini 3.5 Transcribe juga mampu membedakan hingga tiga pembicara dalam rekaman audio. Hasilnya dilengkapi cap waktu hingga tingkat kata sehingga pengguna dapat mengetahui bagian percakapan dan waktu ketika sebuah kalimat diucapkan.

Mampu Memahami Koreksi dan Gaya Bicara

Google turut membekali model ini dengan kemampuan memahami maksud pengguna serta gaya berbicara secara lebih baik. Sistem dapat menangani koreksi yang dilakukan seseorang ketika berbicara tanpa membuat hasil akhir terdengar berantakan.

Kemampuan tersebut menjadi penting dalam percakapan spontan karena seseorang sering mengulang, memperbaiki, atau mengubah kalimat ketika berbicara.

Gemini 3.5 Transcribe juga diklaim mampu menangani informasi berupa kombinasi huruf dan angka dengan akurat. Contohnya mencakup nomor pesanan maupun kode pos yang membutuhkan ketelitian lebih tinggi dibandingkan percakapan biasa.

Google berencana memperluas pemanfaatan teknologi ini ke lebih banyak produk. Salah satunya adalah Chrome, yang nantinya memungkinkan pengguna melakukan transkripsi suara langsung pada berbagai kolom teks di halaman web.

Dengan dukungan tersebut, pengguna dapat mendiktekan balasan, membuat unggahan, atau memberikan instruksi kepada Gemini menggunakan suara.

Sudah Terintegrasi di Sejumlah Layanan Google

Untuk tahap awal, Gemini 3.5 Transcribe tersedia di aplikasi Gemini untuk macOS dalam bahasa Inggris. Teknologi ini juga digunakan pada fitur Rambler di Android untuk sejumlah negara dan bahasa tertentu.

Di ekosistem pengembangan AI, model tersebut telah tersedia di Google Antigravity. Pengembang juga dapat mengaksesnya melalui API di AI Studio dan Antigravity dalam tahap pratinjau publik.

Google berencana membawa kemampuan Gemini 3.5 Transcribe ke lebih banyak layanan, termasuk Search Live, Gemini Live, Docs, Keep, dan Gmail.

Model tersebut juga menjadi bagian dari kemampuan Rambler pada perangkat Android, termasuk ponsel seri Pixel 11.

Meski begitu, Google memberikan klarifikasi terkait sejumlah model lain yang sebelumnya ikut disebut dalam informasi awal. Gemini 3.5 Live dan Gemini 3.5 Live Experimental belum diluncurkan dan Google belum memberikan tanggal baru untuk keduanya.

Jadi Langkah Baru Google di Teknologi Suara

Peluncuran Gemini 3.5 Transcribe menunjukkan bahwa Google tidak hanya mengejar kemampuan AI dalam menghasilkan teks, tetapi juga meningkatkan cara sistem memahami percakapan manusia.

Dukungan lebih dari 85 bahasa, pengenalan jargon, pemisahan pembicara, serta pemformatan otomatis membuat teknologi ini berpotensi digunakan untuk berbagai kebutuhan.

Ketersediaannya di sejumlah layanan Google juga membuka peluang agar kemampuan transkripsi tersebut tidak berhenti sebagai fitur tersendiri. Jika integrasi ke Chrome, Docs, Gmail, dan layanan lainnya berjalan sesuai rencana, pengguna nantinya dapat memanfaatkan input suara dalam lebih banyak aktivitas sehari-hari.

Untuk saat ini, akses Gemini 3.5 Transcribe memang masih terbatas pada platform dan wilayah tertentu. Namun, Google telah menyiapkan perluasan dukungan ke berbagai produk lain dalam ekosistemnya.