Google har presenterat Gemini 3.5 Transcribe, en ny modell för tal-till-text som företaget beskriver som sin mest precisa hittills.
Modellen är byggd för mer naturlig diktering än traditionell taligenkänning. Den kan förstå självrättningar mitt i en mening, ta bort utfyllnadsord som ”öh” och ”äh”, formatera text automatiskt och anpassa sig efter egna ordlistor med exempelvis facktermer och ovanliga namn.
Gemini 3.5 Transcribe kan automatiskt känna igen och transkribera över 85 språk. För inspelat ljud finns dessutom stöd för att skilja på flera talare och lägga till tidsstämplar.
Tekniken används redan i Googles Rambler-funktion på Android och i Gemini-appen för Mac. Den finns även för utvecklare via Gemini API och ska framöver dyka upp i Chrome, där Google planerar att låta användare diktera direkt i textfält på webben.
Enligt Google når modellen en genomsnittlig felprocent på 4,0 procent vid strömmande transkribering och 2,6 procent för förinspelat ljud, baserat på mätningar från Artificial Analysis. Det intressanta här är dock inte bara bättre träffsäkerhet, utan att Google försöker göra diktering mer likt hur människor faktiskt pratar – med pauser, omtagningar och korrigeringar inkluderade.
