حساب کاربری ندارید؟ ثبت نام کنید

گوگل Gemini 3.5 Transcribe را با دقت بالاتر برای تبدیل گفتار به متن معرفی کرد

نوشته

4 ساعت قبل | بدون دیدگاه | گوگل، هوش مصنوعی

گوگل مدل جدید Gemini 3.5 Transcribe را معرفی کرده است؛ مدلی که این شرکت آن را دقیق‌ترین مدل تبدیل گفتار به متن خود می‌داند. این مدل هم‌اکنون در برخی محصولات گوگل مانند Gboard Rambler و اپلیکیشن Gemini برای macOS استفاده می‌شود و به‌زودی قابلیت تبدیل گفتار به متن را به مرورگر کروم نیز می‌آورد.

خلاصه خبر در یک نگاه:

🔷 مدل Gemini 3.5 Transcribe مدل جدید گوگل برای تبدیل دقیق گفتار به متن است.
🔷 این مدل در شرایط نویزی، اصطلاحات تخصصی و تشخیص خوداصلاحی‌های گفتاری عملکرد بهتری دارد.
🔷 مدل Gemini 3.5 Transcribe از بیش‌از ۸۵ زبان و تشخیص حداکثر سه گوینده پشتیبانی می‌کند.
🔷 این مدل هم‌اکنون در برخی محصولات گوگل فعال است و به‌زودی به Chrome می‌آید.

مدل Gemini 3.5 Transcribe چه قابلیت‌هایی دارد؟

گوگل می‌گوید Gemini 3.5 Transcribe برخلاف مدل‌های متداول تشخیص گفتار، می‌تواند صدای خام را مستقیماً به متنی دقیق، مرتب و قالب‌بندی‌شده تبدیل کند. این مدل برای درک بهتر منظور کاربر، سبک طبیعی صحبت‌کردن او را درنظر می‌گیرد و می‌تواند واژگان سفارشی را نیز تشخیص دهد.

یکی از قابلیت‌های مهم مدل جدید، پردازش طبیعی‌تر گفتار است. برای مثال، اگر کاربر هنگام صحبت‌کردن جمله خود را اصلاح کند و بگوید «سه‌شنبه، نه چهارشنبه»، مدل می‌تواند نسخه اصلاح‌شده را در متن نهایی قرار دهد. همچنین کلمات پرکننده مانند «اِم» و «آه» را حذف می‌کند.

مدل Gemini 3.5 Transcribe علاوه‌بر تبدیل گفتار به متن، امکان قالب‌بندی خودکار متن و ویرایش طبیعی با فرمان صوتی را نیز فراهم می‌کند.

دقت Gemini 3.5 Transcribe چقدر است؟

برپایه اندازه‌گیری‌های Artificial Analysis، مدل جدید گوگل در حالت استریمینگ به میانگین ۴ درصد نرخ خطای کلمه (WER) و در حالت غیر استریمینگ به ۲٫۶ درصد می‌رسد. گوگل می‌گوید این مدل در محیط‌های واقعی و پر از نویز نیز عملکرد قابل‌توجهی دارد. Gemini 3.5 Transcribe همچنین می‌تواند مواردی مانند کدهای پستی و شناسه‌های سفارش را که ترکیبی از حروف و اعداد هستند، با دقت بیشتری تشخیص دهد.

سنجش دقت تشخیص گفتار استریمینگ در زبان‌های مختلف (هرچه کمتر، بهتر)

سنجش دقت تشخیص گفتار استریمینگ در زبان‌های مختلف (هرچه کمتر، بهتر)

گوگل درمجموع می‌گوید زمان لازم برای رسیدن به متن نهایی نسبت‌به مدل Chirp 3 که در سال ۲۰۲۵ معرفی شد، حدود ۷۰ درصد کاهش یافته است.

مدل Gemini 3.5 Transcribe  گوگل از چند زبان پشتیبانی می‌کند؟

یکی از ویژگی‌های مهم مدل جدید، پشتیبانی از بیش‌از ۸۵ زبان است. Gemini 3.5 Transcribe می‌تواند زبان گفتار را به‌صورت خودکار تشخیص دهد و با لهجه‌های منطقه‌ای و گویش‌های مختلف کار کند.

این مدل همچنین برای فایل‌های صوتی ازپیش‌ضبط‌شده، قابلیت تشخیص گوینده دارد. درحال‌حاضر امکان نسبت‌دادن متن به حداکثر سه گوینده همراه با زمان‌بندی وجود دارد و پشتیبانی از تعداد بیشتر گویندگان همچنان آزمایشی است.

محصولات گوگل که از Gemini 3.5 Transcribe استفاده می‌کنند

گوگل درحال‌حاضر از این مدل در چند محصول و قابلیت مختلف استفاده می‌کند. یکی از آن‌ها Gboard Rambler در اندروید است که از قابلیت‌های مدل جدید برای پردازش گفتار استفاده می‌کند.

اپلیکیشن Gemini برای macOS نیز از Gemini 3.5 Transcribe بهره می‌برد. قابلیت Speak to Window در این اپلیکیشن به کاربر اجازه می‌دهد با صدا با محیط کار تعامل داشته باشد و وظایف مختلفی را اجرا کند.

مدل Gemini 3.5 Transcribe همچنین در Google Antigravity در دسترس است. این مدل با اجازه کاربر می‌تواند زمینه صفحه‌نمایش و تاریخچه چت را درنظر بگیرد تا هنگام پردازش نام فایل‌ها، افکار عامل هوش مصنوعی و اسناد فعال، دقت بیشتری ارائه دهد.

سنجش دقت تشخیص گفتار غیر استریمینگ در زبان‌های مختلف (هرچه کمتر، بهتر)

سنجش دقت تشخیص گفتار غیر استریمینگ در زبان‌های مختلف (هرچه کمتر، بهتر)

این مدل چه زمانی به Chrome می‌آید؟

گوگل اعلام کرده است که Gemini 3.5 Transcribe در آینده به مرورگر Chrome اضافه می‌شود. این قابلیت به کاربران اجازه می‌دهد در هر فیلد متنی وب با استفاده از صدا تایپ کنند. به‌این‌ترتیب، کاربران می‌توانند برای مثال پاسخ‌های خود را دیکته کنند، پست بنویسند یا حتی درخواست‌های خود برای Gemini در Chrome را به‌صورت صوتی وارد کنند.

مدل Gemini 3.5 Transcribe برای توسعه‌دهندگان در دسترس است

گوگل Gemini 3.5 Transcribe را برای توسعه‌دهندگان در حالت Public Preview از طریق Gemini API در Google AI Studio و همچنین Google Antigravity ارائه کرده است.

نسخه سازمانی این مدل نیز در حالت پیش‌نمایش عمومی از طریق Gemini Enterprise Agent Platform در دسترس قرار دارد و گوگل اعلام کرده است که آن را به‌زودی به Gemini Enterprise for Customer Experience نیز اضافه می‌کند.

Gemini

تفاوت مدل Gemini 3.5 Transcribe با مدل‌های قبلی

تمرکز اصلی Gemini 3.5 Transcribe فقط روی تبدیل کلمه‌به‌کلمه صدا به متن نیست. گوگل تلاش کرده است این مدل بتواند ساختار طبیعی گفتار، اصلاح جمله‌ها، کلمات زائد، واژگان تخصصی و حتی زمینه مرتبط با محتوای کاربر را بهتر درک کند.

همچنین قابلیت Function Calling به مدل اجازه می‌دهد وظایف پیچیده‌تر را به دیگر مدل‌های Gemini بسپارد؛ برای مثال، در سناریوهای مشخص می‌تواند انجام وظایفی مانند تولید تصویر یا تحلیل فایل را به مدل‌های دیگر واگذار کند.

جمع‌بندی

مدل Gemini 3.5 Transcribe تلاش جدید گوگل برای بهبود تبدیل گفتار به متن است و با پشتیبانی از بیش‌از ۸۵ زبان، تشخیص گوینده، حذف کلمات زائد، درک خوداصلاحی‌های گفتاری و کاهش چشمگیر زمان پردازش، امکاناتی فراتر از یک ابزار معمول تبدیل صدا به متن ارائه می‌دهد. گوگل اکنون این مدل را در برخی محصولات خود به‌کار گرفته و قصد دارد قابلیت آن را به Chrome نیز گسترش دهد.

به‌نظر شما، آیا دقت و قابلیت‌های Gemini 3.5 Transcribe می‌تواند شیوه تایپ‌کردن کاربران در Chrome و گوشی‌های اندرویدی را تغییر دهد؟

اشتراک در
اطلاع از
0 Comments
بازخورد (Feedback) های اینلاین
مشاهده همه دیدگاه ها
رپورتاژ آگهی پربازده
رپورتاژ آگهی پربازده
ساحل عطایی