کمپانی xAI از هوش مصنوعی Voice Transcribe 2.0، جدیدترین مدل تبدیل گفتار به متن خود، رونمایی کرد. این مدل که برای پردازش صوت در شرایط واقعی و پرنویز طراحی شده است، به گفته xAI در مقایسه با Grok Voice Transcribe 1.0 دقت بیشتری دارد و قیمت پردازش دستهای آن همچنان ۰٫۱۰ دلار به ازای هر ساعت صوت است.
🔷 مدل Voice Transcribe 2.0 جدیدترین مدل تبدیل گفتار به متن xAI است.
🔷 کمپانی xAI میگوید مدل جدید نسبت به نسخه 1.0 دقت بالاتری دارد و در چندین آزمون داخلی عملکرد بهتری نشان داده است.
🔷 مدل جدید از رونویسی چندزبانه، تشخیص خودکار زبان و تغییر زبان در میانه فایل پشتیبانی میکند.
🔷 قیمت پردازش دستهای ۰٫۱۰ دلار و پردازش بلادرنگ ۰٫۲۰ دلار به ازای هر ساعت صوت است.
🔷 نسخه 2.0 بهزودی مدل پیشفرض API تبدیل گفتار به متن xAI خواهد شد.
گراک Voice Transcribe 2.0 بر پایه مدل بنیادی صوتی مورد استفاده در Grok Voice ساخته شده است. xAI میگوید Grok Voice در حال حاضر روزانه برای دهها هزار تماس پشتیبانی مشتری استفاده میشود، میلیونها ساعت روایت ویدیویی را رونویسی میکند و در محصولات فیزیکی نیز بهعنوان عامل صوتی به کار میرود؛ از جمله دستیار Grok در خودروهای تسلا.

به گفته xAI، مدل جدید با مجموعهای از فایلهای صوتی واقعی، پرنویز و چندزبانه که در محیطهای مختلف ضبط شدهاند آموزش داده شده است. این شرکت همچنین اعلام کرده که پس از آموزش اولیه، فرایندهای تکمیلی برای بهبود مدل انجام شده و نتیجه نهایی برای رونویسی گفتار در شرایط واقعی بهینه شده است.
کمپانی xAI اعلام کرده است که Voice Transcribe 2.0 از نظر دقت، در میان ۳۲ مدل استریمینگ موجود در رتبه نخست جدول عمومی Artificial Analysis قرار گرفته است.
این شرکت علاوه بر بنچمارکهای عمومی، نرخ خطای کلمه یا Word Error Rate (WER) را در چهار مجموعه آزمایشی داخلی نیز بررسی کرده است. این مجموعهها از ترافیک واقعی تولید شدهاند و شامل صدای تماسهای پشتیبانی تلفنی، مکالمات با Grok، اطلاعاتی مانند کدهای حساب و آدرسهای ایمیل و همچنین فرمانهای صوتی کوتاه چندزبانه هستند.
بر اساس دادههای منتشرشده از سوی xAI، مدل جدید در هر چهار مجموعه نسبت به Grok Voice Transcribe 1.0 عملکرد بهتری دارد. در مجموعه مربوط به تماسهای تلفنی نیز که شامل تماسهای پشتیبانی انگلیسی با کیفیت ۸ کیلوهرتز است، Voice Transcribe 2.0 در آزمایشهای xAI از تمام مدلهای بررسیشده عملکرد بهتری داشته است.
ایکسایآی در نمودارهای خود این مدل را با مدلهایی مانند Gemini 3.5 Transcribe، MAI-Transcribe-2، ElevenLabs Scribe v2، Deepgram Nova-3 و Whisper Large v3 مقایسه کرده است.
به گفته xAI، بزرگترین افزایش دقت Voice Transcribe 2.0 نسبت به نسل قبل در رونویسی چندزبانه دیده میشود. این مدل میتواند دهها زبان را رونویسی کند، زبان مورد استفاده را بهصورت خودکار تشخیص دهد و حتی در صورت تغییر زبان در میانه یک فایل صوتی، بدون نیاز به پردازش جداگانه به کار خود ادامه دهد.
این قابلیت برای عبارتهای کوتاه، مانند فرمانهای صوتی داخل خودرو، اهمیت بیشتری دارد؛ زیرا مدل در چنین مواردی متن و زمینه بسیار محدودی برای تشخیص زبان در اختیار دارد.
کمپانی xAI در مجموعه آزمایشی مربوط به عبارتهای کوتاه دستیار صوتی که فرمانهایی به ۱۹ زبان مختلف را شامل میشود، اعلام کرده است که نرخ خطای کلمه از ۲۰٫۶ درصد به ۶٫۸ درصد کاهش یافته است.
مدل جدید از طریق Speech-to-Text API در دسترس است و هم امکان رونویسی دستهای فایلها و URLها و هم تبدیل گفتار به متن بهصورت بلادرنگ را فراهم میکند.
مهمترین قابلیتهای مستندشده این API عبارتاند از:
گفته میشود سرویسهایی که پیشتر به Speech-to-Text API متصل شدهاند، میتوانند بهبود دقت مدل جدید را بدون نیاز به تغییر کد دریافت کنند.
مستندات رسمی API از ۱۲ فرمت صوتی پشتیبانی میکنند و حداکثر اندازه فایل قابل پردازش ۵۰۰ مگابایت اعلام شده است. نرخهای نمونهبرداری ۸۰۰۰، ۱۶۰۰۰، ۲۲۰۵۰، ۲۴۰۰۰، ۴۴۱۰۰ و ۴۸۰۰۰ هرتز نیز پشتیبانی میشوند.
پارامتر زبان امکان قالببندی متن خروجی را در ۲۵ زبان فراهم میکند که از جمله آنها میتوان به انگلیسی، اسپانیایی، فرانسوی، آلمانی، هندی، ژاپنی و کرهای اشاره کرد.
قیمت مدل جدید نسبت به Grok Voice Transcribe 1.0 تغییری نکرده است. xAI برای پردازش دستهای و استریمینگ، قیمتهای زیر را اعلام کرده است:
| نوع پردازش | قیمت به ازای هر ساعت صوت |
|---|---|
| پردازش دستهای (Batch) | ۰٫۱۰ دلار |
| پردازش بلادرنگ (Streaming) | ۰٫۲۰ دلار |
قابلیتهایی مانند تشخیص گوینده، زمانبندی کلمات و عبارتهای کلیدی نیز در همین قیمت ارائه میشوند و هزینه جداگانهای ندارند.
ایکسایآی اعلام کرده است که Voice Transcribe 2.0 بهزودی به مدل پیشفرض Speech-to-Text API تبدیل خواهد شد. نسخه 1.0 نیز قرار است طی هفتههای آینده از چرخه پشتیبانی خارج شود.
کاربرانی که در دوره انتقال همچنان به نسخه قدیمی نیاز دارند، میتوانند مدل قبلی را در درخواستهای خود بهصورت دستی مشخص کنند. مستندات فعلی xAI همچنان نسخه 1.0 را در صورت مشخص نکردن پارامتر مدل بهعنوان مدل پیشفرض نشان میدهد، اما نسخه 2.0 نیز از طریق هر دو رابط REST و WebSocket قابل انتخاب است.
مدل Voice Transcribe 2.0 با تمرکز بر افزایش دقت در گفتار واقعی، رونویسی چندزبانه و پردازش صوت در شرایط مختلف معرفی شده است. xAI علاوه بر بهبود دقت نسبت به نسل قبل، قابلیتهایی مانند تشخیص گوینده، زمانبندی کلمات، پردازش چندکاناله و رونویسی بلادرنگ را در اختیار توسعهدهندگان قرار میدهد.
🔴 همچنین بخوانید: شرکت xAI از مدل هوش مصنوعی Imagine Image 2.0 با ابزارهای ویرایش و قالبهای آماده رونمایی کرد
نظر شما درباره Voice Transcribe 2.0 چیست؟ آیا چنین سرویسهایی میتوانند جایگزین ابزارهای فعلی تبدیل گفتار به متن شوند؟