Skip to content Skip to sidebar Skip to footer

Bikin Takjub! GigaChat Audio Kini Bisa Baca Emosi Manusia dan Rangkum Rekaman Suara 3 Jam

Bikin Takjub! GigaChat Audio Kini Bisa Baca Emosi Manusia dan Rangkum Rekaman Suara 3 Jam - Perkembangan teknologi Kecerdasan Buatan (AI) makin di luar nalar! Pada Selasa (14/7/2026), perusahaan teknologi asal Rusia, Sber, resmi meluncurkan pembaruan masif untuk asisten pintar mereka lewat model GigaChat Audio.

Berbeda dengan AI kebanyakan, Large Language Model (LLM) terbaru ini sanggup memproses file audio panjang dan pesan suara secara langsung, tanpa perlu mengubah ucapan menjadi teks (Speech-to-Text) terlebih dahulu! Model ini telah dilatih khusus untuk memahami intonasi dan mengolah data suara dengan performa tingkat tinggi.

Bikin Takjub! GigaChat Audio Kini Bisa Baca Emosi Manusia dan Rangkum Rekaman Suara 3 Jam


Lebih gilanya lagi, teknologi canggih ini tidak dikunci rapat-rapat. Sber menyediakannya secara gratis melalui asisten AI GigaChat dan merilis kode open-source-nya untuk para developer di seluruh dunia.

“Suara adalah cara paling alami untuk berinteraksi dengan teknologi, namun juga yang paling menuntut. Sedikit saja ada kesalahan deteksi atau salah membaca emosi, kepercayaan Anda pada asisten virtual akan langsung hancur,” ujar Anton Frolov, Senior Vice President & Head of GenAI Development Sberbank.

Frolov menambahkan bahwa teknologi suara memiliki potensi aplikasi yang sangat luas, mulai dari terjemahan suara real-time hingga layanan khusus bagi penyandang gangguan bicara.

Baca juga:Infinix Hot 50 Review: Performa Oke dan Fitur Lengkap, Tapi…

Lantas, apa saja "kekuatan super" dari GigaChat Audio ini?

1. Asisten AI yang Punya "Empati"

GigaChat kini bukan sekadar robot kaku. Ia mampu mendeteksi emosi positif atau negatif pengguna berdasarkan intonasi, karakteristik suara, hingga nuansa pengucapan. Jika ia mendeteksi Anda sedang kesal, ia akan merespons dengan nada yang lebih lembut. Sebaliknya, ia bisa mencerminkan keceriaan saat Anda membagikan kabar baik.

2. Bedah dan Rangkum Rekaman Suara 3 Jam Non-Stop!

Lupa mencatat hasil meeting penting? GigaChat Audio bisa memproses rekaman suara berdurasi hingga tiga jam dan menavigasi isinya dengan mudah.

Anda cukup bertanya lewat suara pada menit ke berapa sebuah topik dibahas, meminta ringkasan di segmen tertentu, atau meminta rangkuman seluruh rekaman lengkap dengan timestamp (penanda waktu). AI ini bahkan cukup pintar untuk membedakan siapa saja yang sedang berbicara dalam rekaman tersebut!

3. Ingatan Super dan Anti-Pikun

Asisten AI ini sekarang bisa mengingat fakta atau preferensi penting yang Anda sampaikan langsung melalui dialog suara dan menggunakannya untuk sesi obrolan di masa depan. Misalnya, ia akan merencanakan rute perjalanan liburan berdasarkan minat yang pernah Anda sebutkan sebelumnya. Tentu saja, demi privasi, Anda memegang kendali penuh untuk melihat, mengedit, atau menghapus memori tersebut di pengaturan profil.

Baca juga:Review Kamera Realme Note 60x: Sehebat Apa 8 Megapiksel di 2026?

Performa Garang: Libas Gemini 2.5 Pro!

Dalam pengujian internal yang ketat (Arena-Hard-Audio benchmark), GigaChat Audio membuktikan taringnya dengan meraih win rate 70%. Angka ini menempatkannya nyaris sejajar dengan Gemini 3 Flash preview (77,5%) dan secara telak mengalahkan Gemini 2.5 Pro (62%).

Urusan deteksi emosi? Model andalan Sber ini mencatatkan akurasi hingga 80%, mengasapi pesaing beratnya seperti Qwen3-Omni-30B (70%) dan Kimi-Audio (62%).

Kabar Gembira Buat Developer: Gratis & Open-Source!

Sber memanjakan komunitas developer dengan merilis GigaChat3.1-Audio-10B, versi ringan open-source yang mampu mengenali bahasa Rusia, Inggris, dan beberapa bahasa lainnya.

Tak berhenti di situ, Sber juga merilis GigaAM Multilingual, model pengenalan ucapan otomatis (ASR) pertama dari Rusia yang mendukung berbagai bahasa (Rusia, Inggris, Kirgistan, Kazakh, dan Uzbek). Menurut benchmark, GigaAM mampu menekan tingkat kesalahan (error rate) hingga 1,5–2 kali lipat lebih baik dari pesaing terdekatnya!

Kedua model AI ini sudah bisa diunduh langsung melalui platform GitVerse dan Hugging Face. Berkat pelatihan awal yang matang, developer hanya butuh beberapa puluh jam rekaman audio tambahan untuk menyetel ulang (fine-tuning) model ini agar mendukung bahasa baru, termasuk bahasa negara-negara lain.

Anda mungkin suka:iQOO Z11x 5G Mendarat di Tuxlin Blog, Terbaik Buat Ngojol?

Post a Comment for "Bikin Takjub! GigaChat Audio Kini Bisa Baca Emosi Manusia dan Rangkum Rekaman Suara 3 Jam"