حساب کاربری ندارید؟ ثبت نام کنید

متا اولین مدل درک صوتی هم‌زمان خود را با نام Muse Voice Transcribe عرضه کرد

نوشته

3 ساعت قبل | بدون دیدگاه | متا، هوش مصنوعی

متا مدل Muse Voice Transcribe را به‌عنوان نخستین مدل درک صوتی هم‌زمان خود عرضه کرد. این مدل قابلیت رونویسی جریانی و چندزبانه را به Meta AI برای مک و Muse Code اضافه می‌کند و توسعه‌دهندگان نیز می‌توانند ازطریق Meta Model API به آن دسترسی داشته باشند.

خلاصه خبر در یک نگاه:

🔷 مدل Muse Voice Transcribe متا گفتار را به‌صورت هم‌زمان به متن تبدیل می‌کند.
🔷 متا این مدل را با داده‌هایی از بیش از ۷۰ زبان آموزش داده و ۲۵ زبان را هنگام عرضه اعتبارسنجی کرده است.
🔷 مدل می‌تواند بیش از ۲۰ گوینده را از یکدیگر تفکیک کند و فایل‌های صوتی طولانی‌تر از یک ساعت را پردازش کند.
🔷 کاربران مک می‌توانند با نگه‌داشتن کلید Fn در هر اپلیکیشنی دیکته صوتی انجام دهند.
🔷 هزینه استفاده توسعه‌دهندگان ۳ دلار به‌ازای هر ۱۰۰۰ دقیقه صوت، معادل ۰.۱۸ دلار در ساعت است.

مدل Muse Voice Transcribe متا چگونه کار می‌کند؟

آزمایشگاه Meta Superintelligence Labs در Muse Voice Transcribe چند فناوری پردازش صوت را در یک مدل ترکیب کرده است. این فناوری‌ها شامل تشخیص خودکار و جریانی گفتار، تفکیک گویندگان و تشخیص پایان صحبت می‌شوند.

درعمل، Muse Voice Transcribe می‌تواند هم‌زمان با صحبت‌کردن کاربر، گفتار او را به متن تبدیل کند. مدل همچنین گویندگان مختلف را از یکدیگر تشخیص می‌دهد و زمان پایان صحبت هر فرد را مشخص می‌کند؛ بدون اینکه برای انجام این کارها به مرحله پردازش جداگانه پس از رونویسی نیاز داشته باشد.

مدل Muse Voice Transcribe از چند زبان پشتیبانی می‌کند؟

متا مدل جدید خود را با داده‌هایی از بیش از ۷۰ زبان آموزش داده است. این شرکت هنگام عرضه، عملکرد مدل را برای ۲۵ زبان اعتبارسنجی کرده است. Muse Voice Transcribe همچنین از Code-Switching به‌صورت بومی پشتیبانی می‌کند؛ یعنی اگر گوینده در یک جمله یا میان چند جمله زبان خود را تغییر دهد، مدل می‌تواند این تغییر را مدیریت کند.

امکان تنظیم مدل برپایه زبان، کلمات کلیدی و اطلاعات زمینه‌ای نیز وجود دارد. این قابلیت می‌تواند به افزایش دقت تشخیص اصطلاحات، واژه‌های خاص یا محتوایی که زمینه مشخصی دارد کمک کند.

مدل Muse Voice Transcribe متا امکان تبدیل هم‌زمان گفتار به متن را در مک فراهم می‌کند.

مدل Muse Voice Transcribe متا امکان تبدیل هم‌زمان گفتار به متن را در مک فراهم می‌کند.

مدل صوتی جدید متا بیش از ۲۰ گوینده را تفکیک می‌کند

یکی از قابلیت‌های مهم Muse Voice Transcribe، تفکیک گویندگان یا Speaker Diarization است. این مدل می‌تواند در فایل‌های صوتی دارای بیش از ۲۰ صدای متفاوت، گویندگان را از یکدیگر تشخیص دهد.

متا پشتیبانی از فایل‌ها و جریان‌های صوتی طولانی‌تر از یک ساعت را نیز فراهم کرده است. این ویژگی می‌تواند مدل را برای رونویسی جلسات، گفت‌وگوهای طولانی و سایر محتواهای چندنفره کاربردی کند.

فناوری Adaptive Delay چگونه سرعت و دقت تبدیل گفتار به متن را تنظیم می‌کند؟

سیستم‌های تبدیل گفتار به متن هم‌زمان معمولاً باید میان سرعت نمایش کلمات و میزان اطلاعات صوتی مورد استفاده برای تشخیص دقیق‌تر تعادل برقرار کنند. متا برای مدیریت این موضوع از قابلیتی با نام Adaptive Delay استفاده کرده است.

به‌جای استفاده از تأخیر ثابت، Muse Voice Transcribe به‌صورت پویا تصمیم می‌گیرد پیش از ثبت هر کلمه چه مدت به گفتار گوش دهد. مدل می‌تواند کلمات ساده‌تر را به‌سرعت تشخیص دهد و برای عبارت‌های دشوارتر، منتظر دریافت اطلاعات صوتی بیشتری بماند.

Muse Voice Transcribe چه جایگاهی در بنچمارک تبدیل گفتار به متن دارد؟

متا اعلام کرده است که Muse Voice Transcribe در تاریخ ۱ سپتامبر ۲۰۲۶ (۱۰ شهریور) رتبه نخست جدول مدل‌های تبدیل جریانی گفتار به متن Artificial Analysis را در اختیار داشته است. این رتبه به عملکرد مدل در ارزیابی Artificial Analysis مربوط می‌شود و لزوماً به‌تنهایی تعیین‌کننده کیفیت آن برای تمام زبان‌ها، لهجه‌ها و شرایط صوتی نیست.

متا Muse Voice Transcribe را با پشتیبانی از بیش از ۷۰ زبان معرفی کرد.

متا مدل Muse Voice Transcribe را با پشتیبانی از بیش از ۷۰ زبان معرفی کرد.

دیکته صوتی Meta AI در مک چگونه فعال می‌شود؟

متا مدل جدید را در Meta AI برای مک به‌کار گرفته و دیکته صوتی را در سطح سیستم در دسترس قرار داده است. کاربران می‌توانند کلید Fn را نگه دارند و در هر اپلیکیشنی شروع به صحبت کنند تا مدل صدای آن‌ها را به متن تبدیل کند.

Muse Voice Transcribe همچنین قابلیت دیکته صوتی Muse Code را تأمین می‌کند. به‌این‌ترتیب، کاربرد مدل به سرویس مستقل تبدیل صوت به متن محدود نمی‌شود و متا آن را مستقیماً در ابزارهای خود نیز ادغام کرده است.

هزینه استفاده از Muse Voice Transcribe چقدر است؟

توسعه‌دهندگان از امروز ۱۰ شهریور می‌توانند ازطریق Meta Model API به مدل جدید دسترسی داشته باشند. متا هزینه استفاده را ۳ دلار به‌ازای هر ۱۰۰۰ دقیقه صوت تعیین کرده است. این قیمت معادل ۰.۱۸ دلار برای هر ساعت صوت است. توسعه‌دهندگان می‌توانند از API برای اضافه‌کردن قابلیت رونویسی جریانی و تشخیص گفتار به سرویس‌ها و اپلیکیشن‌های خود استفاده کنند.

جمع‌بندی

مدل Muse Voice Transcribe متا قابلیت‌هایی مانند رونویسی هم‌زمان، پشتیبانی چندزبانه، تفکیک بیش از ۲۰ گوینده، تشخیص پایان صحبت و تنظیم تطبیقی تأخیر را در یک مدل ارائه می‌دهد. ادغام مستقیم آن با Meta AI برای مک و ارائه API نیز نشان می‌دهد متا این فناوری را هم برای کاربران عادی و هم توسعه‌دهندگان درنظر گرفته است.

به‌نظر شما دیکته صوتی هوشمند و هم‌زمان می‌تواند جای تایپ‌کردن را در بخشی از کارهای روزمره بگیرد؟ دیدگاه خود را در بخش نظرات بنویسید.

اشتراک در
اطلاع از
0 Comments
بازخورد (Feedback) های اینلاین
مشاهده همه دیدگاه ها
ساحل عطایی