حساب کاربری ندارید؟ ثبت نام کنید

گوگل از مدل‌های Gemini 3.8 Flash TTS و Flash-Lite با قابلیت کنترل احساسات و لهجه رونمایی کرد

نوشته

1 ساعت قبل | بدون دیدگاه | گوگل، هوش مصنوعی

گوگل عرضه مدل‌های جدید Gemini 3.8 Flash TTS و Flash-Lite TTS را آغاز کرده است؛ مدل‌هایی که قابلیت تبدیل متن به گفتار جمینای را طبیعی‌تر و قابل‌کنترل‌تر می‌کنند. شبیه‌سازی صدا با جمینای نیز امکان‌پذیر شده و مدل Flash TTS می‌تواند با دریافت تنها ۳۰ ثانیه نمونه صوتی و پس از احراز مجوز استفاده، صدایی سازگار با نمونه ایجاد کند.

خلاصه خبر در یک نگاه:

🔷 شبیه‌سازی صدا با جمینای تنها به ۳۰ ثانیه نمونه صوتی مجاز نیاز دارد.
🔷 مدل Gemini 3.8 Flash TTS از بیش از ۱۰۰ زبان و گویش پشتیبانی می‌کند.
🔷 کاربران می‌توانند احساس، لهجه، سرعت، مکث، خنده، زمزمه و نحوه اجرای متن را کنترل کنند.
🔷 مدل‌های جدید امکان اجرای مکالمه دو نفره با صداهای ثابت را فراهم می‌کنند.
🔷 گوگل از SynthID، استاندارد C2PA و بررسی رضایت صاحب صدا برای کاهش سوءاستفاده استفاده می‌کند.

شبیه‌سازی صدا با جمینای چگونه کار می‌کند؟

یکی از قابلیت‌های اصلی Gemini 3.8 Flash TTS بازتولید صدای مجاز افراد است. این مدل می‌تواند با یک نمونه صوتی ۳۰ ثانیه‌ای صدایی سازگار با صدای موردنظر ایجاد کند؛ البته گوگل داشتن اجازه برای استفاده از آن صدا را الزامی کرده است.

قابلیت‌های مدل جدید تنها به شبیه‌سازی صدای موجود محدود نمی‌شوند. کاربران می‌توانند یک صدای کاملاً جدید را نیز با توضیح متنی و زبان طبیعی طراحی کنند. گوگل همچنین بیش از ۲۰۰۰ صدای آماده را ارائه می‌کند.

مدل Flash TTS از بیش از ۱۰۰ زبان و گویش پشتیبانی می‌کند؛ موضوعی که دامنه استفاده از آن را برای تولید محتوای صوتی چندزبانه گسترش می‌دهد.

عملکرد برتر Gemini 3.8 Flash TTS در بنچمارک کیفیت تبدیل متن به گفتار

عملکرد برتر Gemini 3.8 Flash TTS در بنچمارک کیفیت تبدیل متن به گفتار

جمینای چگونه یک متن را شبیه بازیگر اجرا می‌کند؟

قابلیت‌های صوتی جدید جمینای فراتر از خواندن ساده یک متن هستند. هر دو مدل می‌توانند دستورالعمل‌های جداگانه برای خطوط مختلف یک سناریو را دنبال کرده و لحن، سرعت گفتار، لهجه و احساس را براساس دستور کاربر تغییر دهند.

مدل‌ها همچنین نشانه‌های مکالمه‌ای مانند زمزمه، خنده، آه‌کشیدن و مکث را اجرا می‌کنند. به‌عنوان‌مثال، تولیدکننده محتوا می‌تواند مشخص کند یک جمله با لحن خاصی بیان شود و جمله بعدی حالت احساسی متفاوتی داشته باشد.

گوگل امکان اجرای مکالمه دو نفره را نیز فراهم کرده است. کاربر می‌تواند یک سناریو را در اختیار جمینای قرار دهد و مدل نقش دو گوینده را با صداهای مجزا اجرا کند.

صدای تولیدشده در محتوای طولانی ثابت باقی می‌ماند

یکی دیگر از قابلیت‌های مهم مدل‌های جدید، حفظ ثبات صدا طی چندین ساعت محتوای صوتی است. تغییر ناخواسته ویژگی‌های صدا در محتوای طولانی می‌تواند استفاده از مدل‌های تبدیل متن به گفتار را دشوار کند.

این ویژگی می‌تواند برای تولید پادکست، کتاب صوتی، دوبله، ویدئوهای روایت‌شده و دستیارهای صوتی کاربرد داشته باشد. کنترل دقیق اجرای متن نیز کمک می‌کند صدای تولیدشده حالت مکانیکی کمتری داشته باشد.

عملکرد Gemini 3.8 Flash TTS و Flash-Lite در زبان‌های مختلف Voice Arena

عملکرد Gemini 3.8 Flash TTS و Flash-Lite در زبان‌های مختلف Voice Arena

عملکرد Gemini 3.8 Flash TTS در آزمایش‌ها چگونه است؟

مدل Gemini 3.8 Flash TTS در Voice Design Benchmark متعلق به Hume AI رتبه نخست مجموع را کسب کرده و امتیاز ۶۰.۸ را در بخش لهجه‌ها به‌دست آورده است.

مدل‌های Flash و Flash-Lite نیز دو جایگاه اول شاخص کلی کیفیت Hume را کسب کردند. آزمایش‌های Voice Arena نیز این مدل‌ها را در چندین زبان در میان گزینه‌های برتر یا نزدیک به صدر قرار داده‌اند.

بااین‌حال، ElevenLabs در بخش‌های جداگانه کیفیت صدا و تنوع گفتاری شبیه انسان در ارزیابی Hume امتیاز بالاتری کسب کرده است.

برتری Gemini 3.8 Flash TTS در بنچمارک طراحی صدای Hume AI

برتری Gemini 3.8 Flash TTS در بنچمارک طراحی صدای Hume AI

🔴 همچنین بخوانید: گوگل Gemini 3.8 Live را معرفی کرد؛ دستیار هوش مصنوعی حالا هم‌زمان فکر می‌کند و صحبت می‌کند

قابلیت‌های صوتی جدید جمینای کجا در دسترس هستند؟

گوگل ارائه Flash TTS در Gemini Notebook را آغاز کرده است. مدل Flash-Lite TTS نیز به Google Vids راه پیدا می‌کند. توسعه‌دهندگان می‌توانند به هر دو مدل ازطریق Gemini API و Google AI Studio دسترسی داشته باشند و قابلیت‌های تبدیل متن به گفتار را در محصولات خود به‌کار بگیرند.

گوگل چگونه جلوی سوءاستفاده از شبیه‌سازی صدا را می‌گیرد؟

امکان تقلید صدای افراد می‌تواند خطرهایی مانند جعل صوتی و جعل هویت ایجاد کند. گوگل برای شبیه‌سازی صدا با جمینای مجموعه‌ای از محدودیت‌ها و ابزارهای تشخیص محتوای تولیدشده با هوش مصنوعی را درنظر گرفته است.

  • احراز رضایت برای استفاده از صدای موردنظر
  • استفاده از واترمارک SynthID
  • افزودن اطلاعات اصالت محتوا براساس C2PA
  • محدودیت منطقه‌ای برای قابلیت شبیه‌سازی صدا در AI Studio

قابلیت شبیه‌سازی صدا در Google AI Studio در چند منطقه ازجمله بریتانیا، منطقه اقتصادی اروپا (EEA)، هند و ایالت‌های تگزاس و ایلینوی آمریکا در دسترس نیست.

گوگل جمینای

جمع‌بندی

مدل Gemini 3.8 Flash TTS تبدیل متن به گفتار را از خواندن ساده سناریو فراتر می‌برد و امکان طراحی یا شبیه‌سازی صدا و کنترل جزئیاتی مانند احساس، لهجه، مکث و سرعت را فراهم می‌کند. پشتیبانی از مکالمه دو نفره و حفظ ثبات صدا در محتوای طولانی نیز استفاده از آن را برای پادکست، دوبله و کتاب صوتی امکان‌پذیرتر می‌کند.

به‌نظر شما قابلیت شبیه‌سازی صدا با هوش مصنوعی بیشتر برای تولید محتوا کاربرد خواهد داشت یا خطر جعل صوتی را افزایش می‌دهد؟ دیدگاه خود را در بخش نظرات بنویسید.

اشتراک در
اطلاع از
0 Comments
بازخورد (Feedback) های اینلاین
مشاهده همه دیدگاه ها
مطالب اخیر
ساحل عطایی