شرکت OpenAI مدل صوتی GPT-Live-1 را در API و OpenAI Platform عرضه کرده است تا توسعهدهندگان بتوانند قابلیت مکالمه صوتی طبیعی ChatGPT را در اپلیکیشنها و فرایندهای کاری خود به کار بگیرند. این مدل میتواند همزمان به صدا گوش دهد و صحبت کند، به قطع شدن مکالمه واکنش نشان دهد و در حالی که مدلها و ابزارهای دیگر مشغول استدلال یا انجام اقدامات هستند، جریان گفتوگو را حفظ کند.
🔹 مدل GPT-Live-1 قابلیت مکالمه صوتی تمامدوطرفه ChatGPT را به API میآورد و برای ساخت اپلیکیشنها و فرایندهای صوتی طراحی شده است.
🔹 این مدل صوت ورودی و خروجی را بهصورت یکپارچه پردازش میکند و با وقفه، سکوت، صدای پسزمینه و تشخیص نوبت صحبت سازگار است.
🔹 توسعهدهندگان میتوانند لحن، سرعت و سبک گفتار را کنترل کنند و مدل پشتیبان و چارچوب عامل خود را انتخاب کنند.
🔹 مدل GPT-Live-1 در API به ازای هر دقیقه ۰٫۰۵ دلار هزینه دارد و هزینه مدل پشتیبان و چارچوب عامل جداگانه محاسبه میشود.
🔹 این مدل با ۱۲ صدای مختلف عرضه شده و حضور اولیه آن در محصولاتی مانند Yelp Host ،Speak ،Fin شرکت Intercom و Devin شرکت Cognition گزارش شده است.
در معماری سنتی عاملهای صوتی، معمولاً تشخیص گفتار، مدل استدلال و تبدیل متن به گفتار بهصورت زنجیرهای در کنار یکدیگر قرار میگیرند. GPT-Live-1 رویکرد متفاوتی دارد و صدای ورودی و خروجی را بهصورت همزمان پردازش میکند.
به گفته اوپنایآی، این معماری میتواند تأخیر و تحویلهای شکننده میان اجزای مختلف را کاهش دهد؛ مشکلاتی که ممکن است زمانبندی، زمینه مکالمه و ریتم گفتوگو را مختل کنند.
توسعهدهندگان میتوانند از طریق system prompt، لحن، سرعت و سبک صحبت کردن مدل را کنترل کنند. آنها همچنین امکان انتخاب مدل پشتیبان و چارچوب عامل مورد نظر خود را دارند.
از دیگر قابلیتهای ارائهشده میتوان به رونوشتهای ASR، متن پاسخ، تقویت کلمات کلیدی، تشخیص حروف و اعداد و تشخیص بومی نوبت صحبت اشاره کرد.
پشتیبانی تلفنی GPT-Live-1 برای کاربردهایی مانند رزرو، اعلام وضعیت سفارش و خدمات مشتری هدفگذاری شده است. این مدل همچنین برای کار در محیطهایی با صدای پسزمینه و سکوت طراحی شده تا هنگام صحبت کاربر روی او صحبت نکند یا تمام مراحل پردازش را بهصورت صوتی توضیح ندهد.
این معماری به مدل اجازه میدهد در زمان اجرای استدلال عمیقتر یا اقدامات عملی توسط مدلها و ابزارهای دیگر نیز مکالمه را در جریان نگه دارد. در این فرایند میتوان مدلهایی مانند GPT-6 Astra ،Codex و ChatGPT Work را در کنار GPT-Live-1 به کار گرفت.
نتایج اولیه منتشرشده از این مدل نشان میدهد که نحوه مدیریت نوبت صحبت میتواند به شکل محسوسی تغییر کرده باشد. شرکت Speak گزارش کرده است که GPT-Live-1 در مقایسه با سیستمهای قبلی مبتنی بر نوبت، تقریباً ۸۰ درصد وقفههای کمتری ایجاد کرده است؛ موضوعی که به زبانآموزان زمان بیشتری برای فکر کردن میدهد.
اوپنایآی همچنین اعلام کرده است که GPT-Live-1 در آزمون Full Duplex Bench نسبت به GPT-Realtime-2.1 حدود ۳۰ واحد درصد بهبود داشته و در آزمون Tau3 نیز هنگام استفاده در کنار GPT-6 Astra با سطح استدلال متوسط، رتبه نخست را کسب کرده است.
از کاربران اولیه این مدل میتوان به Yelp Host ،Speak ،Fin شرکت Intercom و Devin شرکت Cognition اشاره کرد.
یکی از مشتریان نیز اعلام کرده است که مهاجرت از یک سیستم زنجیرهای باعث شده حجم کدهای صوتی آنها ۸۰ درصد کاهش پیدا کند و ۲۳ هزار خط کد مورد استفاده برای مکالمات لحظهای با بیماران حذف شود.
هزینه استفاده از GPT-Live-1 در API برابر با ۰٫۰۵ دلار به ازای هر دقیقه است. هزینه مدل پشتیبان و چارچوب عامل بهصورت جداگانه محاسبه میشود.
این مدل در زمان عرضه با ۱۲ صدای مختلف در دسترس قرار گرفته است که طیفی از لهجهها، گویشها و زبانها را پوشش میدهند. دسترسی به صدای سفارشی نیازمند تماس با تیم فروش اوپنایآی است.
اوپنایآی قصد دارد در آینده صداها و زبانهای بیشتری به این سرویس اضافه کند.
عرضه GPT-Live-1 یک لایه صوتی در اختیار توسعهدهندگان قرار میدهد که میتواند روی یک زنجیره استدلالی انتخابشده و دارای قیمتگذاری جداگانه قرار بگیرد. به این ترتیب، لایه مکالمه صوتی میتواند از مدل و چارچوب عامل مورد استفاده برای پردازشهای عمیقتر جدا باشد.
اوپنایآی همچنین سازمانها را به استفاده از Presence برای فرایندهای کاری بلادرنگ هدایت میکند. این محیط میتواند از سیستمهای سازمانی استفاده کند، اقدامات مورد تأیید را انجام دهد و در صورت نیاز مکالمه را به نیروی انسانی ارجاع دهد.
GPT-Live-1 قابلیت مکالمه صوتی طبیعی و تمامدوطرفه ChatGPT را به API میآورد و با پردازش همزمان صدای ورودی و خروجی، کنترل بیشتری روی تجربه عاملهای صوتی در اختیار توسعهدهندگان قرار میدهد. این مدل با قیمت ۰٫۰۵ دلار در دقیقه، ۱۲ صدای اولیه و امکان اتصال به مدلها و ابزارهای دیگر عرضه شده و اوپنایآی برنامه دارد پشتیبانی از صداها و زبانهای بیشتری را به آن اضافه کند.
به نظر شما کدام کاربردهای صوتی بیشترین بهره را از مکالمه همزمان و کاهش وقفههای GPT-Live-1 خواهند برد؟