حساب کاربری ندارید؟ ثبت نام کنید

شرکت OpenAI مدل صوتی GPT-Live-1 را برای توسعه‌دهندگان در API عرضه کرد

نوشته

2 ساعت قبل | بدون دیدگاه | هوش مصنوعی

شرکت OpenAI مدل صوتی GPT-Live-1 را در API و OpenAI Platform عرضه کرده است تا توسعه‌دهندگان بتوانند قابلیت مکالمه صوتی طبیعی ChatGPT را در اپلیکیشن‌ها و فرایندهای کاری خود به کار بگیرند. این مدل می‌تواند هم‌زمان به صدا گوش دهد و صحبت کند، به قطع شدن مکالمه واکنش نشان دهد و در حالی که مدل‌ها و ابزارهای دیگر مشغول استدلال یا انجام اقدامات هستند، جریان گفت‌وگو را حفظ کند.

خلاصه خبر در یک نگاه

🔹 مدل GPT-Live-1 قابلیت مکالمه صوتی تمام‌دوطرفه ChatGPT را به API می‌آورد و برای ساخت اپلیکیشن‌ها و فرایندهای صوتی طراحی شده است.
🔹 این مدل صوت ورودی و خروجی را به‌صورت یکپارچه پردازش می‌کند و با وقفه، سکوت، صدای پس‌زمینه و تشخیص نوبت صحبت سازگار است.
🔹 توسعه‌دهندگان می‌توانند لحن، سرعت و سبک گفتار را کنترل کنند و مدل پشتیبان و چارچوب عامل خود را انتخاب کنند.
🔹 مدل GPT-Live-1 در API به ازای هر دقیقه ۰٫۰۵ دلار هزینه دارد و هزینه مدل پشتیبان و چارچوب عامل جداگانه محاسبه می‌شود.
🔹 این مدل با ۱۲ صدای مختلف عرضه شده و حضور اولیه آن در محصولاتی مانند Yelp Host ،Speak ،Fin شرکت Intercom و Devin شرکت Cognition گزارش شده است.

مکالمه صوتی هم‌زمان و طبیعی‌تر

در معماری سنتی عامل‌های صوتی، معمولاً تشخیص گفتار، مدل استدلال و تبدیل متن به گفتار به‌صورت زنجیره‌ای در کنار یکدیگر قرار می‌گیرند. GPT-Live-1 رویکرد متفاوتی دارد و صدای ورودی و خروجی را به‌صورت هم‌زمان پردازش می‌کند.

به گفته اوپن‌ای‌آی، این معماری می‌تواند تأخیر و تحویل‌های شکننده میان اجزای مختلف را کاهش دهد؛ مشکلاتی که ممکن است زمان‌بندی، زمینه مکالمه و ریتم گفت‌وگو را مختل کنند.

توسعه‌دهندگان می‌توانند از طریق system prompt، لحن، سرعت و سبک صحبت کردن مدل را کنترل کنند. آن‌ها همچنین امکان انتخاب مدل پشتیبان و چارچوب عامل مورد نظر خود را دارند.

از دیگر قابلیت‌های ارائه‌شده می‌توان به رونوشت‌های ASR، متن پاسخ، تقویت کلمات کلیدی، تشخیص حروف و اعداد و تشخیص بومی نوبت صحبت اشاره کرد.

کاربرد در تلفن و خدمات مشتری

پشتیبانی تلفنی GPT-Live-1 برای کاربردهایی مانند رزرو، اعلام وضعیت سفارش و خدمات مشتری هدف‌گذاری شده است. این مدل همچنین برای کار در محیط‌هایی با صدای پس‌زمینه و سکوت طراحی شده تا هنگام صحبت کاربر روی او صحبت نکند یا تمام مراحل پردازش را به‌صورت صوتی توضیح ندهد.

این معماری به مدل اجازه می‌دهد در زمان اجرای استدلال عمیق‌تر یا اقدامات عملی توسط مدل‌ها و ابزارهای دیگر نیز مکالمه را در جریان نگه دارد. در این فرایند می‌توان مدل‌هایی مانند GPT-6 Astra ،Codex و ChatGPT Work را در کنار GPT-Live-1 به کار گرفت.

مدل صوتی GPT-Live-1

مدل صوتی GPT-Live-1

نتایج اولیه GPT-Live-1

نتایج اولیه منتشرشده از این مدل نشان می‌دهد که نحوه مدیریت نوبت صحبت می‌تواند به شکل محسوسی تغییر کرده باشد. شرکت Speak گزارش کرده است که GPT-Live-1 در مقایسه با سیستم‌های قبلی مبتنی بر نوبت، تقریباً ۸۰ درصد وقفه‌های کمتری ایجاد کرده است؛ موضوعی که به زبان‌آموزان زمان بیشتری برای فکر کردن می‌دهد.

اوپن‌ای‌آی همچنین اعلام کرده است که GPT-Live-1 در آزمون Full Duplex Bench نسبت به GPT-Realtime-2.1 حدود ۳۰ واحد درصد بهبود داشته و در آزمون Tau3 نیز هنگام استفاده در کنار GPT-6 Astra با سطح استدلال متوسط، رتبه نخست را کسب کرده است.

از کاربران اولیه این مدل می‌توان به Yelp Host ،Speak ،Fin شرکت Intercom و Devin شرکت Cognition اشاره کرد.

یکی از مشتریان نیز اعلام کرده است که مهاجرت از یک سیستم زنجیره‌ای باعث شده حجم کدهای صوتی آن‌ها ۸۰ درصد کاهش پیدا کند و ۲۳ هزار خط کد مورد استفاده برای مکالمات لحظه‌ای با بیماران حذف شود.

قیمت و صداهای قابل انتخاب

هزینه استفاده از GPT-Live-1 در API برابر با ۰٫۰۵ دلار به ازای هر دقیقه است. هزینه مدل پشتیبان و چارچوب عامل به‌صورت جداگانه محاسبه می‌شود.

این مدل در زمان عرضه با ۱۲ صدای مختلف در دسترس قرار گرفته است که طیفی از لهجه‌ها، گویش‌ها و زبان‌ها را پوشش می‌دهند. دسترسی به صدای سفارشی نیازمند تماس با تیم فروش اوپن‌ای‌آی است.

اوپن‌ای‌آی قصد دارد در آینده صداها و زبان‌های بیشتری به این سرویس اضافه کند.

مسیر جدید برای ساخت عامل‌های صوتی

عرضه GPT-Live-1 یک لایه صوتی در اختیار توسعه‌دهندگان قرار می‌دهد که می‌تواند روی یک زنجیره استدلالی انتخاب‌شده و دارای قیمت‌گذاری جداگانه قرار بگیرد. به این ترتیب، لایه مکالمه صوتی می‌تواند از مدل و چارچوب عامل مورد استفاده برای پردازش‌های عمیق‌تر جدا باشد.

اوپن‌ای‌آی همچنین سازمان‌ها را به استفاده از Presence برای فرایندهای کاری بلادرنگ هدایت می‌کند. این محیط می‌تواند از سیستم‌های سازمانی استفاده کند، اقدامات مورد تأیید را انجام دهد و در صورت نیاز مکالمه را به نیروی انسانی ارجاع دهد.

جمع‌بندی

GPT-Live-1 قابلیت مکالمه صوتی طبیعی و تمام‌دوطرفه ChatGPT را به API می‌آورد و با پردازش هم‌زمان صدای ورودی و خروجی، کنترل بیشتری روی تجربه عامل‌های صوتی در اختیار توسعه‌دهندگان قرار می‌دهد. این مدل با قیمت ۰٫۰۵ دلار در دقیقه، ۱۲ صدای اولیه و امکان اتصال به مدل‌ها و ابزارهای دیگر عرضه شده و اوپن‌ای‌آی برنامه دارد پشتیبانی از صداها و زبان‌های بیشتری را به آن اضافه کند.

به نظر شما کدام کاربردهای صوتی بیشترین بهره را از مکالمه هم‌زمان و کاهش وقفه‌های GPT-Live-1 خواهند برد؟

اشتراک در
اطلاع از
0 Comments
بازخورد (Feedback) های اینلاین
مشاهده همه دیدگاه ها
مطالب اخیر
امیرحسین ملکی