حساب کاربری ندارید؟ ثبت نام کنید

مدل هوش مصنوعی Voice Transcribe 2.0 گراک معرفی شد؛ دقت دوبرابری در تبدیل گفتار به متن

نوشته

3 ساعت قبل | بدون دیدگاه | هوش مصنوعی

کمپانی xAI از هوش مصنوعی Voice Transcribe 2.0، جدیدترین مدل تبدیل گفتار به متن خود، رونمایی کرد. این مدل که برای پردازش صوت در شرایط واقعی و پرنویز طراحی شده است، به گفته xAI در مقایسه با Grok Voice Transcribe 1.0 دقت بیشتری دارد و قیمت پردازش دسته‌ای آن همچنان ۰٫۱۰ دلار به ازای هر ساعت صوت است.

خلاصه خبر در یک نگاه

🔷 مدل Voice Transcribe 2.0 جدیدترین مدل تبدیل گفتار به متن xAI است.

🔷 کمپانی xAI می‌گوید مدل جدید نسبت به نسخه 1.0 دقت بالاتری دارد و در چندین آزمون داخلی عملکرد بهتری نشان داده است.

🔷 مدل جدید از رونویسی چندزبانه، تشخیص خودکار زبان و تغییر زبان در میانه فایل پشتیبانی می‌کند.

🔷 قیمت پردازش دسته‌ای ۰٫۱۰ دلار و پردازش بلادرنگ ۰٫۲۰ دلار به ازای هر ساعت صوت است.

🔷 نسخه 2.0 به‌زودی مدل پیش‌فرض API تبدیل گفتار به متن xAI خواهد شد.

مدل Voice Transcribe 2.0 بر پایه فناوری صوتی Grok ساخته شده است

گراک Voice Transcribe 2.0 بر پایه مدل بنیادی صوتی مورد استفاده در Grok Voice ساخته شده است. xAI می‌گوید Grok Voice در حال حاضر روزانه برای ده‌ها هزار تماس پشتیبانی مشتری استفاده می‌شود، میلیون‌ها ساعت روایت ویدیویی را رونویسی می‌کند و در محصولات فیزیکی نیز به‌عنوان عامل صوتی به کار می‌رود؛ از جمله دستیار Grok در خودروهای تسلا.

به گفته xAI، مدل جدید با مجموعه‌ای از فایل‌های صوتی واقعی، پرنویز و چندزبانه که در محیط‌های مختلف ضبط شده‌اند آموزش داده شده است. این شرکت همچنین اعلام کرده که پس از آموزش اولیه، فرایندهای تکمیلی برای بهبود مدل انجام شده و نتیجه نهایی برای رونویسی گفتار در شرایط واقعی بهینه شده است.

دقت مدل Voice Transcribe 2.0

کمپانی xAI اعلام کرده است که Voice Transcribe 2.0 از نظر دقت، در میان ۳۲ مدل استریمینگ موجود در رتبه نخست جدول عمومی Artificial Analysis قرار گرفته است.

این شرکت علاوه بر بنچمارک‌های عمومی، نرخ خطای کلمه یا Word Error Rate (WER) را در چهار مجموعه آزمایشی داخلی نیز بررسی کرده است. این مجموعه‌ها از ترافیک واقعی تولید شده‌اند و شامل صدای تماس‌های پشتیبانی تلفنی، مکالمات با Grok، اطلاعاتی مانند کدهای حساب و آدرس‌های ایمیل و همچنین فرمان‌های صوتی کوتاه چندزبانه هستند.

بر اساس داده‌های منتشرشده از سوی xAI، مدل جدید در هر چهار مجموعه نسبت به Grok Voice Transcribe 1.0 عملکرد بهتری دارد. در مجموعه مربوط به تماس‌های تلفنی نیز که شامل تماس‌های پشتیبانی انگلیسی با کیفیت ۸ کیلوهرتز است، Voice Transcribe 2.0 در آزمایش‌های xAI از تمام مدل‌های بررسی‌شده عملکرد بهتری داشته است.

ایکس‌ای‌آی در نمودارهای خود این مدل را با مدل‌هایی مانند Gemini 3.5 Transcribe، MAI-Transcribe-2، ElevenLabs Scribe v2، Deepgram Nova-3 و Whisper Large v3 مقایسه کرده است.

پیشرفت چشمگیر در رونویسی چندزبانه

به گفته xAI، بزرگ‌ترین افزایش دقت Voice Transcribe 2.0 نسبت به نسل قبل در رونویسی چندزبانه دیده می‌شود. این مدل می‌تواند ده‌ها زبان را رونویسی کند، زبان مورد استفاده را به‌صورت خودکار تشخیص دهد و حتی در صورت تغییر زبان در میانه یک فایل صوتی، بدون نیاز به پردازش جداگانه به کار خود ادامه دهد.

این قابلیت برای عبارت‌های کوتاه، مانند فرمان‌های صوتی داخل خودرو، اهمیت بیشتری دارد؛ زیرا مدل در چنین مواردی متن و زمینه بسیار محدودی برای تشخیص زبان در اختیار دارد.

کمپانی xAI در مجموعه آزمایشی مربوط به عبارت‌های کوتاه دستیار صوتی که فرمان‌هایی به ۱۹ زبان مختلف را شامل می‌شود، اعلام کرده است که نرخ خطای کلمه از ۲۰٫۶ درصد به ۶٫۸ درصد کاهش یافته است.

قابلیت‌های API مدل Voice Transcribe 2.0

مدل جدید از طریق Speech-to-Text API در دسترس است و هم امکان رونویسی دسته‌ای فایل‌ها و URLها و هم تبدیل گفتار به متن به‌صورت بلادرنگ را فراهم می‌کند.

مهم‌ترین قابلیت‌های مستندشده این API عبارت‌اند از:

  • نمایش زمان دقیق هر کلمه همراه با امتیاز اطمینان
  • تشخیص و تفکیک گویندگان بدون هزینه اضافی
  • رونویسی چندکاناله تا سقف هشت کانال
  • پشتیبانی از حداکثر ۱۰۰ عبارت تخصصی برای بهبود تشخیص کلمات کلیدی
  • قالب‌بندی خودکار اعداد، تاریخ‌ها، ارزها، شماره تلفن و آدرس‌های ایمیل
  • حذف کلمات پرکننده در گفتار
  • تشخیص هوشمند پایان نوبت صحبت برای استفاده در عامل‌های صوتی

گفته می‌شود سرویس‌هایی که پیش‌تر به Speech-to-Text API متصل شده‌اند، می‌توانند بهبود دقت مدل جدید را بدون نیاز به تغییر کد دریافت کنند.

پشتیبانی از ۱۲ فرمت صوتی، فایل‌هایی تا ۵۰۰ مگابایت و ۲۵ زبان

مستندات رسمی API از ۱۲ فرمت صوتی پشتیبانی می‌کنند و حداکثر اندازه فایل قابل پردازش ۵۰۰ مگابایت اعلام شده است. نرخ‌های نمونه‌برداری ۸۰۰۰، ۱۶۰۰۰، ۲۲۰۵۰، ۲۴۰۰۰، ۴۴۱۰۰ و ۴۸۰۰۰ هرتز نیز پشتیبانی می‌شوند.

پارامتر زبان امکان قالب‌بندی متن خروجی را در ۲۵ زبان فراهم می‌کند که از جمله آن‌ها می‌توان به انگلیسی، اسپانیایی، فرانسوی، آلمانی، هندی، ژاپنی و کره‌ای اشاره کرد.

قیمت Voice Transcribe 2.0 چقدر است؟

قیمت مدل جدید نسبت به Grok Voice Transcribe 1.0 تغییری نکرده است. xAI برای پردازش دسته‌ای و استریمینگ، قیمت‌های زیر را اعلام کرده است:

نوع پردازش قیمت به ازای هر ساعت صوت
پردازش دسته‌ای (Batch) ۰٫۱۰ دلار
پردازش بلادرنگ (Streaming) ۰٫۲۰ دلار

قابلیت‌هایی مانند تشخیص گوینده، زمان‌بندی کلمات و عبارت‌های کلیدی نیز در همین قیمت ارائه می‌شوند و هزینه جداگانه‌ای ندارند.

گراک Voice Transcribe 1.0 به‌زودی بازنشسته می‌شود

ایکس‌ای‌آی اعلام کرده است که Voice Transcribe 2.0 به‌زودی به مدل پیش‌فرض Speech-to-Text API تبدیل خواهد شد. نسخه 1.0 نیز قرار است طی هفته‌های آینده از چرخه پشتیبانی خارج شود.

کاربرانی که در دوره انتقال همچنان به نسخه قدیمی نیاز دارند، می‌توانند مدل قبلی را در درخواست‌های خود به‌صورت دستی مشخص کنند. مستندات فعلی xAI همچنان نسخه 1.0 را در صورت مشخص نکردن پارامتر مدل به‌عنوان مدل پیش‌فرض نشان می‌دهد، اما نسخه 2.0 نیز از طریق هر دو رابط REST و WebSocket قابل انتخاب است.

نظر شما چیست؟

مدل Voice Transcribe 2.0 با تمرکز بر افزایش دقت در گفتار واقعی، رونویسی چندزبانه و پردازش صوت در شرایط مختلف معرفی شده است. xAI علاوه بر بهبود دقت نسبت به نسل قبل، قابلیت‌هایی مانند تشخیص گوینده، زمان‌بندی کلمات، پردازش چندکاناله و رونویسی بلادرنگ را در اختیار توسعه‌دهندگان قرار می‌دهد.

🔴 همچنین بخوانید: شرکت xAI از مدل هوش مصنوعی Imagine Image 2.0 با ابزارهای ویرایش و قالب‌های آماده رونمایی کرد

نظر شما درباره Voice Transcribe 2.0 چیست؟ آیا چنین سرویس‌هایی می‌توانند جایگزین ابزارهای فعلی تبدیل گفتار به متن شوند؟

اشتراک در
اطلاع از
0 Comments
بازخورد (Feedback) های اینلاین
مشاهده همه دیدگاه ها
مطالب اخیر
سهیل سلیمانی