Ruka hadi maudhui makuu
Miundo na Teknolojia

Google yazindua modeli ya Gemini 3.5 Transcribe ya kubadilisha sauti kuwa maandishi, inaweza kuondoa maneno ya kujaza kiotomatiki

Mtindo huu wa AI unaweza kuondoa kiotomatiki maneno ya kujaza katika sauti, kurekebisha makosa ya maudhui, kuongeza kasi ya unukuzi wa sauti kwa takriban 70%, na kupunguza kiwango cha makosa ya sauti ya wakati halisi hadi 5.5%. Pia unaunga mkono kamusi maalum. Hata hivyo, uhariri mahiri unaweza kubadilisha maneno ya awali, hivyo haufai kwa hali zinazohitaji kuhifadhi kauli halisi. #GoogleAIModel#

Google yazindua Gemini 3.5 Transcribe, modeli ya sauti kuwa maandishi inayoondoa maneno ya kujaza

Wakati ulimwengu bado unasubiri kuzinduliwa kwa Gemini 3.5 Pro, Google imeanza kwa kuzindua modeli nyingine katika mfululizo wa 3.5. Kampuni hiyo leo imezindua Gemini 3.5 Transcribe, modeli ya AI ya kubadilisha sauti kuwa maandishi iliyoundwa kuboresha matumizi ya kuingiza sauti. Inaweza kuondoa kiotomatiki maneno ya kujaza kama “mmm” na “eeh”, pamoja na sehemu ambazo mzungumzaji alikosea na kujirekebisha, na hatimaye kutengeneza maandishi yaliyo fasaha na safi zaidi.

Google yazindua Gemini 3.5 Transcribe, modeli ya sauti kuwa maandishi inayoondoa maneno ya kujaza

Kwa sasa modeli hii inawezesha kipengele cha “Rambler” katika kibodi ya Gboard kwenye Pixel 11, na baadaye itaingizwa hatua kwa hatua katika bidhaa na huduma zaidi za Google.

Google inasema kuwa, ikilinganishwa na injini ya awali ya sauti kuwa maandishi iliyokuwa ikiitwa Chirp 3, Gemini 3.5 Transcribe imeboreshwa katika kasi na usahihi. Kuanzia mtumiaji anapozungumza hadi maandishi ya unukuzi yanapotengenezwa, kasi ya jumla inatarajiwa kuongezeka kwa takriban 70%; katika hali ya sauti ya wakati halisi, kiwango cha makosa kimepungua hadi 5.5%.

Google yazindua Gemini 3.5 Transcribe, modeli ya sauti kuwa maandishi inayoondoa maneno ya kujaza

Hata hivyo, ongezeko la usahihi si kubwa sana. Kulingana na data ya Google, kiwango cha makosa cha Chirp 3 ni 7.32%. Lakini kwa watumiaji wanaotumia mara kwa mara kuingiza sauti, hata kupunguza makosa machache ya kuandika kunamaanisha kuwa kuna maandishi machache ya kurekebisha kwa mkono baadaye, hivyo bado ni uboreshaji wa manufaa.

Uwezo wa Gemini 3.5 Transcribe hauishii tu katika “kusikia kwa usahihi” kile ambacho mtumiaji amesema; pia hujaribu kuelewa maana ambayo mtumiaji anakusudia kuwasilisha. Wakati wa kuzungumza, modeli inaweza kuondoa kiotomatiki maneno ya kujaza kama “mmm” na “eeh” yanayoathiri ufasaha wa sentensi. Mtumiaji akisema jambo kwa makosa na kulirekebisha mara moja, modeli inaweza pia kurekebisha maandishi ambayo tayari yametengenezwa kwa wakati halisi. Zaidi ya hayo, watumiaji wanaweza kutoa kamusi maalum ili kusaidia modeli kutambua istilahi za kitaalamu na msamiati wa maeneo mahususi.

Kwa sasa modeli hii inaunga mkono lugha 85 na inaweza kuchakata sauti iliyorekodiwa awali yenye hadi wazungumzaji 3.

Bila shaka, kipengele hiki pia kina tatizo moja lililo wazi: mtumiaji anahitaji kuamini kuwa AI inaweza kuelewa kwa usahihi kile anachokusudia kusema. Angalau katika maandishi mafupi, kwa kuzingatia matumizi halisi ya kipengele cha Rambler, modeli inaweza kusafisha vizuri ifadha zisizolingana na kusita wakati wa kuzungumza, na kufanya maandishi yaonekane ya asili zaidi.

Wakati huohuo, Gemini 3.5 Transcribe haibadilishi sauti kuwa maandishi kwa njia rahisi tu. Katika kupanga maudhui, AI inaweza kubadilisha maneno ambayo mtumiaji alitumia awali. Kwa hiyo, katika hali zinazohitaji kuhifadhi kwa ukamilifu kauli halisi na ambako uwasilishaji haupaswi kubadilishwa kiholela, aina hii ya “uhariri mahiri” huenda isifae kutumiwa.