گوگل مدل جدید Gemini 3.5 Transcribe را معرفی کرده است؛ مدلی که این شرکت آن را دقیقترین مدل تبدیل گفتار به متن خود میداند. این مدل هماکنون در برخی محصولات گوگل مانند Gboard Rambler و اپلیکیشن Gemini برای macOS استفاده میشود و بهزودی قابلیت تبدیل گفتار به متن را به مرورگر کروم نیز میآورد.
🔷 مدل Gemini 3.5 Transcribe مدل جدید گوگل برای تبدیل دقیق گفتار به متن است.
🔷 این مدل در شرایط نویزی، اصطلاحات تخصصی و تشخیص خوداصلاحیهای گفتاری عملکرد بهتری دارد.
🔷 مدل Gemini 3.5 Transcribe از بیشاز ۸۵ زبان و تشخیص حداکثر سه گوینده پشتیبانی میکند.
🔷 این مدل هماکنون در برخی محصولات گوگل فعال است و بهزودی به Chrome میآید.
گوگل میگوید Gemini 3.5 Transcribe برخلاف مدلهای متداول تشخیص گفتار، میتواند صدای خام را مستقیماً به متنی دقیق، مرتب و قالببندیشده تبدیل کند. این مدل برای درک بهتر منظور کاربر، سبک طبیعی صحبتکردن او را درنظر میگیرد و میتواند واژگان سفارشی را نیز تشخیص دهد.
یکی از قابلیتهای مهم مدل جدید، پردازش طبیعیتر گفتار است. برای مثال، اگر کاربر هنگام صحبتکردن جمله خود را اصلاح کند و بگوید «سهشنبه، نه چهارشنبه»، مدل میتواند نسخه اصلاحشده را در متن نهایی قرار دهد. همچنین کلمات پرکننده مانند «اِم» و «آه» را حذف میکند.
مدل Gemini 3.5 Transcribe علاوهبر تبدیل گفتار به متن، امکان قالببندی خودکار متن و ویرایش طبیعی با فرمان صوتی را نیز فراهم میکند.
برپایه اندازهگیریهای Artificial Analysis، مدل جدید گوگل در حالت استریمینگ به میانگین ۴ درصد نرخ خطای کلمه (WER) و در حالت غیر استریمینگ به ۲٫۶ درصد میرسد. گوگل میگوید این مدل در محیطهای واقعی و پر از نویز نیز عملکرد قابلتوجهی دارد. Gemini 3.5 Transcribe همچنین میتواند مواردی مانند کدهای پستی و شناسههای سفارش را که ترکیبی از حروف و اعداد هستند، با دقت بیشتری تشخیص دهد.

سنجش دقت تشخیص گفتار استریمینگ در زبانهای مختلف (هرچه کمتر، بهتر)
گوگل درمجموع میگوید زمان لازم برای رسیدن به متن نهایی نسبتبه مدل Chirp 3 که در سال ۲۰۲۵ معرفی شد، حدود ۷۰ درصد کاهش یافته است.
یکی از ویژگیهای مهم مدل جدید، پشتیبانی از بیشاز ۸۵ زبان است. Gemini 3.5 Transcribe میتواند زبان گفتار را بهصورت خودکار تشخیص دهد و با لهجههای منطقهای و گویشهای مختلف کار کند.
این مدل همچنین برای فایلهای صوتی ازپیشضبطشده، قابلیت تشخیص گوینده دارد. درحالحاضر امکان نسبتدادن متن به حداکثر سه گوینده همراه با زمانبندی وجود دارد و پشتیبانی از تعداد بیشتر گویندگان همچنان آزمایشی است.
گوگل درحالحاضر از این مدل در چند محصول و قابلیت مختلف استفاده میکند. یکی از آنها Gboard Rambler در اندروید است که از قابلیتهای مدل جدید برای پردازش گفتار استفاده میکند.
اپلیکیشن Gemini برای macOS نیز از Gemini 3.5 Transcribe بهره میبرد. قابلیت Speak to Window در این اپلیکیشن به کاربر اجازه میدهد با صدا با محیط کار تعامل داشته باشد و وظایف مختلفی را اجرا کند.
مدل Gemini 3.5 Transcribe همچنین در Google Antigravity در دسترس است. این مدل با اجازه کاربر میتواند زمینه صفحهنمایش و تاریخچه چت را درنظر بگیرد تا هنگام پردازش نام فایلها، افکار عامل هوش مصنوعی و اسناد فعال، دقت بیشتری ارائه دهد.

سنجش دقت تشخیص گفتار غیر استریمینگ در زبانهای مختلف (هرچه کمتر، بهتر)
گوگل اعلام کرده است که Gemini 3.5 Transcribe در آینده به مرورگر Chrome اضافه میشود. این قابلیت به کاربران اجازه میدهد در هر فیلد متنی وب با استفاده از صدا تایپ کنند. بهاینترتیب، کاربران میتوانند برای مثال پاسخهای خود را دیکته کنند، پست بنویسند یا حتی درخواستهای خود برای Gemini در Chrome را بهصورت صوتی وارد کنند.
گوگل Gemini 3.5 Transcribe را برای توسعهدهندگان در حالت Public Preview از طریق Gemini API در Google AI Studio و همچنین Google Antigravity ارائه کرده است.
نسخه سازمانی این مدل نیز در حالت پیشنمایش عمومی از طریق Gemini Enterprise Agent Platform در دسترس قرار دارد و گوگل اعلام کرده است که آن را بهزودی به Gemini Enterprise for Customer Experience نیز اضافه میکند.

تمرکز اصلی Gemini 3.5 Transcribe فقط روی تبدیل کلمهبهکلمه صدا به متن نیست. گوگل تلاش کرده است این مدل بتواند ساختار طبیعی گفتار، اصلاح جملهها، کلمات زائد، واژگان تخصصی و حتی زمینه مرتبط با محتوای کاربر را بهتر درک کند.
همچنین قابلیت Function Calling به مدل اجازه میدهد وظایف پیچیدهتر را به دیگر مدلهای Gemini بسپارد؛ برای مثال، در سناریوهای مشخص میتواند انجام وظایفی مانند تولید تصویر یا تحلیل فایل را به مدلهای دیگر واگذار کند.
مدل Gemini 3.5 Transcribe تلاش جدید گوگل برای بهبود تبدیل گفتار به متن است و با پشتیبانی از بیشاز ۸۵ زبان، تشخیص گوینده، حذف کلمات زائد، درک خوداصلاحیهای گفتاری و کاهش چشمگیر زمان پردازش، امکاناتی فراتر از یک ابزار معمول تبدیل صدا به متن ارائه میدهد. گوگل اکنون این مدل را در برخی محصولات خود بهکار گرفته و قصد دارد قابلیت آن را به Chrome نیز گسترش دهد.
بهنظر شما، آیا دقت و قابلیتهای Gemini 3.5 Transcribe میتواند شیوه تایپکردن کاربران در Chrome و گوشیهای اندرویدی را تغییر دهد؟