MOMSMONEY.ID - Google Gemini 3.5 Transcribe resmi meluncur, transkripsi suara makin keren. Google telah meluncurkan pembaruan untuk platform Gemini Audio yang mencakup model Gemini 3.5 Live, Gemini 3.5 Live Experimental, dan Gemini 3.5 Transcribe.
Jess Weatherbed, pengamat media sosial dari Theverge.com, menyebutkan, alat-alat baru ini dirancang untuk meningkatkan fitur suara AI, termasuk kemampuan mengenali ucapan di tengah kebisingan latar belakang, saat terjadi interupsi pembicara, serta penggunaan istilah profesional.
Tambahan utamanya adalah Gemini 3.5 Transcribe, sebuah model untuk transkripsi audio secara real-time.
Google menyatakan, model ini merupakan kemajuan signifikan dibandingkan sistem Chirp 3 sebelumnya. Model ini mampu menangani berbagai bahasa dengan lebih efektif dan mengurangi tingkat kesalahan pengenalan kata.
Baca Juga: Fitur Mute Panggilan Nomor Tak Dikenal di WhatsApp Lindungi dari Phishing
Kemampuan Gemini 3.5 Transcribe untuk transkripsi audio
Gemini 3.5 Transcribe mendukung lebih dari 85 bahasa dan mampu mengubah bahasa lisan menjadi teks terstruktur tanpa memerlukan banyak penyuntingan manual. Model ini secara otomatis memformat transkrip dan filler words yang umum digunakan, seperti "um" dan "uh".
Teks hasil transkripsi dapat disunting menggunakan perintah suara. Hal ini memungkinkan perbaikan segmen transkrip, pengubahan kalimat, atau klarifikasi rekaman dilakukan dengan lebih cepat tanpa perlu menggunakan keyboard.
Fitur lainnya yang tak kalah keren adalah kamus kustom. Kamus ini dapat memuat istilah khusus, nama, konsep profesional, atau ejaan non-standar.
Dengan demikian, Gemini 3.5 Transcribe dapat menyesuaikan hasil transkripsi agar lebih akurat dengan bidang topik tertentu seperti percakapan bisnis atau wawancara. Saat memproses audio yang telah direkam sebelumnya, model ini mampu mengenali hingga tiga pembicara.
Model ini juga menambahkan penanda waktu pada setiap kata, sehingga memudahkan pencarian momen tertentu dalam rekaman. Alat ini dapat digunakan untuk mentranskripsikan rapat, wawancara, materi kuliah, dan percakapan yang melibatkan banyak peserta.
Baca Juga: Peluang Baru WhatsApp: Ini Mempengaruhi Fitur Nama Pengguna untuk Branding Bisnis
Gemini 3.5 Live dan obrolan suara yang diperbarui
Selain model transkripsi, Google juga memperbarui teknologi komunikasi suara Gemini. Gemini 3.5 Live dirancang untuk interaksi yang lebih alami selama percakapan.
Model ini merespons interupsi dengan lebih baik, mengenali ucapan secara lebih akurat, serta mampu memproses informasi visual secara real-time. Gemini 3.5 Live Experimental ditujukan untuk tugas-tugas yang lebih kompleks.
Model ini dapat menjelaskan langkah-langkah pelaksanaan suatu tindakan, sehingga memudahkan pengguna untuk mengikuti alur kerja model serta memahami logika di balik respons yang diberikan. Kemampuan Gemini yang telah diperbarui sudah mulai diluncurkan bagi pengguna aplikasi Gemini berbahasa Inggris di macOS.
Beberapa fitur juga tersedia dalam fitur dikte Rambler di Android untuk bahasa-bahasa tertentu. Pengembang dapat mencoba Gemini 3.5 Transcribe, Gemini 3.5 Live, dan Gemini 3.5 Live Experimental melalui Gemini API, AI Studio, dan Antigravity dalam tahap pratinjau publik.
Google juga telah mengumumkan, dukungan untuk fitur-fitur Gemini Audio baru ini akan segera hadir di peramban Chrome. Perluasan ketersediaan model-model ini diharapkan dapat membuat penggunaan input suara, transkripsi, dan tugas-tugas terkait audio menjadi lebih praktis.
Demikian informasi mengenai Google Gemini 3.5 Transcribe resmi rilis, semoga bermanfaat.
Cek Berita dan Artikel yang lain di Google News