متا مدل Muse Voice Transcribe را بهعنوان نخستین مدل درک صوتی همزمان خود عرضه کرد. این مدل قابلیت رونویسی جریانی و چندزبانه را به Meta AI برای مک و Muse Code اضافه میکند و توسعهدهندگان نیز میتوانند ازطریق Meta Model API به آن دسترسی داشته باشند.
🔷 مدل Muse Voice Transcribe متا گفتار را بهصورت همزمان به متن تبدیل میکند.
🔷 متا این مدل را با دادههایی از بیش از ۷۰ زبان آموزش داده و ۲۵ زبان را هنگام عرضه اعتبارسنجی کرده است.
🔷 مدل میتواند بیش از ۲۰ گوینده را از یکدیگر تفکیک کند و فایلهای صوتی طولانیتر از یک ساعت را پردازش کند.
🔷 کاربران مک میتوانند با نگهداشتن کلید Fn در هر اپلیکیشنی دیکته صوتی انجام دهند.
🔷 هزینه استفاده توسعهدهندگان ۳ دلار بهازای هر ۱۰۰۰ دقیقه صوت، معادل ۰.۱۸ دلار در ساعت است.
آزمایشگاه Meta Superintelligence Labs در Muse Voice Transcribe چند فناوری پردازش صوت را در یک مدل ترکیب کرده است. این فناوریها شامل تشخیص خودکار و جریانی گفتار، تفکیک گویندگان و تشخیص پایان صحبت میشوند.
درعمل، Muse Voice Transcribe میتواند همزمان با صحبتکردن کاربر، گفتار او را به متن تبدیل کند. مدل همچنین گویندگان مختلف را از یکدیگر تشخیص میدهد و زمان پایان صحبت هر فرد را مشخص میکند؛ بدون اینکه برای انجام این کارها به مرحله پردازش جداگانه پس از رونویسی نیاز داشته باشد.
متا مدل جدید خود را با دادههایی از بیش از ۷۰ زبان آموزش داده است. این شرکت هنگام عرضه، عملکرد مدل را برای ۲۵ زبان اعتبارسنجی کرده است. Muse Voice Transcribe همچنین از Code-Switching بهصورت بومی پشتیبانی میکند؛ یعنی اگر گوینده در یک جمله یا میان چند جمله زبان خود را تغییر دهد، مدل میتواند این تغییر را مدیریت کند.
امکان تنظیم مدل برپایه زبان، کلمات کلیدی و اطلاعات زمینهای نیز وجود دارد. این قابلیت میتواند به افزایش دقت تشخیص اصطلاحات، واژههای خاص یا محتوایی که زمینه مشخصی دارد کمک کند.

مدل Muse Voice Transcribe متا امکان تبدیل همزمان گفتار به متن را در مک فراهم میکند.
یکی از قابلیتهای مهم Muse Voice Transcribe، تفکیک گویندگان یا Speaker Diarization است. این مدل میتواند در فایلهای صوتی دارای بیش از ۲۰ صدای متفاوت، گویندگان را از یکدیگر تشخیص دهد.
متا پشتیبانی از فایلها و جریانهای صوتی طولانیتر از یک ساعت را نیز فراهم کرده است. این ویژگی میتواند مدل را برای رونویسی جلسات، گفتوگوهای طولانی و سایر محتواهای چندنفره کاربردی کند.
سیستمهای تبدیل گفتار به متن همزمان معمولاً باید میان سرعت نمایش کلمات و میزان اطلاعات صوتی مورد استفاده برای تشخیص دقیقتر تعادل برقرار کنند. متا برای مدیریت این موضوع از قابلیتی با نام Adaptive Delay استفاده کرده است.
بهجای استفاده از تأخیر ثابت، Muse Voice Transcribe بهصورت پویا تصمیم میگیرد پیش از ثبت هر کلمه چه مدت به گفتار گوش دهد. مدل میتواند کلمات سادهتر را بهسرعت تشخیص دهد و برای عبارتهای دشوارتر، منتظر دریافت اطلاعات صوتی بیشتری بماند.
متا اعلام کرده است که Muse Voice Transcribe در تاریخ ۱ سپتامبر ۲۰۲۶ (۱۰ شهریور) رتبه نخست جدول مدلهای تبدیل جریانی گفتار به متن Artificial Analysis را در اختیار داشته است. این رتبه به عملکرد مدل در ارزیابی Artificial Analysis مربوط میشود و لزوماً بهتنهایی تعیینکننده کیفیت آن برای تمام زبانها، لهجهها و شرایط صوتی نیست.

متا مدل Muse Voice Transcribe را با پشتیبانی از بیش از ۷۰ زبان معرفی کرد.
متا مدل جدید را در Meta AI برای مک بهکار گرفته و دیکته صوتی را در سطح سیستم در دسترس قرار داده است. کاربران میتوانند کلید Fn را نگه دارند و در هر اپلیکیشنی شروع به صحبت کنند تا مدل صدای آنها را به متن تبدیل کند.
Muse Voice Transcribe همچنین قابلیت دیکته صوتی Muse Code را تأمین میکند. بهاینترتیب، کاربرد مدل به سرویس مستقل تبدیل صوت به متن محدود نمیشود و متا آن را مستقیماً در ابزارهای خود نیز ادغام کرده است.
توسعهدهندگان از امروز ۱۰ شهریور میتوانند ازطریق Meta Model API به مدل جدید دسترسی داشته باشند. متا هزینه استفاده را ۳ دلار بهازای هر ۱۰۰۰ دقیقه صوت تعیین کرده است. این قیمت معادل ۰.۱۸ دلار برای هر ساعت صوت است. توسعهدهندگان میتوانند از API برای اضافهکردن قابلیت رونویسی جریانی و تشخیص گفتار به سرویسها و اپلیکیشنهای خود استفاده کنند.
مدل Muse Voice Transcribe متا قابلیتهایی مانند رونویسی همزمان، پشتیبانی چندزبانه، تفکیک بیش از ۲۰ گوینده، تشخیص پایان صحبت و تنظیم تطبیقی تأخیر را در یک مدل ارائه میدهد. ادغام مستقیم آن با Meta AI برای مک و ارائه API نیز نشان میدهد متا این فناوری را هم برای کاربران عادی و هم توسعهدهندگان درنظر گرفته است.
بهنظر شما دیکته صوتی هوشمند و همزمان میتواند جای تایپکردن را در بخشی از کارهای روزمره بگیرد؟ دیدگاه خود را در بخش نظرات بنویسید.