حساب کاربری ندارید؟ ثبت نام کنید

قابلیت Live Avatar برای Gemini 3.8 Live معرفی شد؛ آواتار هوش مصنوعی با مکالمه تصویری زنده

نوشته

2 ساعت قبل | بدون دیدگاه | گوگل، هوش مصنوعی

گوگل قابلیت جدید Live Avatar را برای Gemini 3.8 Live معرفی کرده است که به ایجنت‌های هوش مصنوعی سازمانی امکان می‌دهد با یک آواتار تصویری و به‌صورت زنده با کاربران مکالمه کنند. این فناوری تولید ویدیوی تقریباً بلادرنگ را با گفت‌وگوی صوتی ترکیب می‌کند و از هماهنگی حرکت لب‌ها، حالات طبیعی چهره، تعامل چندوجهی و مکالمه صوتی در ۹۷ زبان پشتیبانی می‌کند.

خلاصه خبر در یک نگاه

🔹 قابلیت Live Avatar حضور تصویری بلادرنگ را به مکالمات Gemini 3.8 Live اضافه می‌کند.
🔹 آواتار می‌تواند ورودی‌های صوتی و تصویری را هم‌زمان پردازش کند و با هماهنگی دقیق لب و حالات طبیعی چهره پاسخ دهد.
🔹 اجرای غیرهم‌زمان ابزارها به ایحنت هوش مصنوعی اجازه می‌دهد هنگام ادامه مکالمه، اطلاعات موردنیاز را در پس‌زمینه دریافت کند.
🔹 مکالمه صوتی چندزبانه در ۹۷ زبان پشتیبانی می‌شود و حرکات لب و چهره هنگام تغییر زبان به‌صورت پویا تنظیم می‌شوند.
🔹 قابلیت Gemini 3.8 Live with Live Avatar از امروز در Gemini Enterprise در دسترس قرار گرفته است.

آواتار زنده به Gemini 3.8 Live اضافه شد

گوگل پس از معرفی Gemini 3.8 Live در هفته گذشته، اکنون قابلیت Live Avatar را به آن اضافه کرده است. این فناوری قابلیت مکالمه زنده مدل را با استریم ویدیویی کم‌تأخیر ترکیب می‌کند.

Live Avatar با ترکیب تولید ویدیوی تقریباً بلادرنگ و گفتار، یک شخصیت تصویری پویا ایجاد می‌کند که می‌تواند در جریان مکالمه گوش دهد، ببیند و صحبت کند.

گوگل برای طبیعی‌تر شدن تعامل روی هماهنگی دقیق حرکت لب‌ها با گفتار، حالات طبیعی چهره و جابه‌جایی روان نوبت مکالمه تمرکز کرده است.

مکالمه چندوجهی با پردازش هم‌زمان صدا و تصویر

قابلیت Live Avatar می‌تواند ورودی‌های صوتی و تصویری را به‌طور هم‌زمان پردازش کند. این اطلاعات در کنار مدل گفت‌وگوی زنده Gemini برای ایجاد تعامل چندوجهی مورد استفاده قرار می‌گیرند.

در نتیجه، عامل‌های سازمانی می‌توانند در مکالمه‌ای شرکت کنند که شامل گفتار، اطلاعات بصری و حالات چهره است.

گوگل کاربردهایی مانند خدمات مشتری و راهنمای تعاملی را برای این فناوری مطرح کرده است؛ موقعیت‌هایی که در آن یک عامل هوش مصنوعی سازمانی از طریق آواتار تصویری مستقیماً با کاربر ارتباط برقرار می‌کند.

اجرای ابزارها بدون متوقف شدن مکالمه

یکی دیگر از قابلیت‌های مهم Live Avatar، استفاده از استدلال Gemini در کنار فراخوانی غیرهم‌زمان ابزارها است.

عامل هوش مصنوعی می‌تواند هنگام ادامه گفت‌وگو، یک ابزار را در پس‌زمینه اجرا کرده و اطلاعات موردنیاز خود را دریافت کند. بنابراین لازم نیست مکالمه تا زمان دریافت پاسخ ابزار متوقف شود.

این ویژگی به Live Avatar اجازه می‌دهد وظایف پیچیده‌تری را انجام دهد و هم‌زمان جریان طبیعی مکالمه با کاربر را حفظ کند.

پشتیبانی Live Avatar از مکالمه صوتی در ۹۷ زبان

گوگل برای Live Avatar از همگام‌سازی بومی گفتار به گفتار در ۹۷ زبان پشتیبانی می‌کند.

هنگامی که کاربر یا عامل در جریان مکالمه از یک زبان به زبان دیگری تغییر می‌کند، سیستم می‌تواند هماهنگی حرکت لب‌ها و حالات چهره را به‌صورت پویا با زبان جدید تطبیق دهد.

به گفته گوگل، کیفیت ویدیو هنگام این تغییر زبان‌ها حفظ می‌شود و سیستم از ایجاد انحراف بصری در تصویر جلوگیری می‌کند.

قابلیت Live Avatar برای Gemini 3.8 Live

قابلیت Live Avatar برای Gemini 3.8 Live

امکان انتخاب آواتار آماده یا ساخت آواتار اختصاصی

سازمان‌ها برای استفاده از Live Avatar می‌توانند از مجموعه‌ای از آواتارهای آماده و متنوع استفاده کنند یا آواتار اختصاصی خود را بسازند.

توسعه‌دهندگان می‌توانند با استفاده از یک تصویر مرجع باکیفیت، یک آواتار کاملاً متحرک و واکنش‌گرا ایجاد کنند. طبق اطلاعات ارائه‌شده، سیستم هنگام ساخت آواتار اختصاصی می‌تواند شباهت به تصویر مرجع، سبک بصری برند و هویت شخصیت را حفظ کند.

با این حال، قابلیت ساخت آواتار اختصاصی در حال حاضر تنها برای سازمان‌هایی در دسترس است که از طریق فهرست مجاز سازمانی به آن دسترسی پیدا کرده‌اند.

واترمارک SynthID برای محتوای تولیدشده با هوش مصنوعی

گوگل برای Live Avatar مجموعه‌ای از تدابیر ایمنی را نیز در نظر گرفته است که هدف آن‌ها رعایت هویت افراد و شفاف‌تر کردن محتوای تولیدشده توسط هوش مصنوعی است.

طبق اعلام گوگل، خروجی تولیدشده توسط محصولات هوش مصنوعی این شرکت دارای واترمارک SynthID است. این واترمارک نامحسوس مستقیماً در محتوای صوتی و ویدیویی تولیدشده قرار می‌گیرد.

هدف از این فناوری کمک به تشخیص محتوای تولیدشده با هوش مصنوعی و کاهش احتمال انتشار اطلاعات نادرست یا انتساب اشتباه محتوا عنوان شده است. گوگل همچنین یک Model Card درباره رویکرد ایمنی و استقرار مسئولانه این فناوری ارائه کرده است.

زمان دسترسی به Gemini 3.8 Live with Live Avatar

قابلیت Gemini 3.8 Live with Live Avatar از زمان معرفی در Gemini Enterprise در دسترس قرار گرفته است.

گوگل همچنین مستندات API مربوط به این قابلیت را منتشر کرده تا توسعه‌دهندگان بتوانند استفاده از Live Avatar را در محصولات و سرویس‌های سازمانی خود آغاز کنند.

جمع‌بندی

قابلیت Live Avatar با افزودن تولید ویدیوی کم‌تأخیر، هماهنگی لب و چهره، پردازش هم‌زمان صدا و تصویر و پشتیبانی از مکالمه در ۹۷ زبان، حضور تصویری را به Gemini 3.8 Live اضافه می‌کند. اجرای ابزارها در پس‌زمینه، امکان ساخت آواتارهای اختصاصی و استفاده از واترمارک SynthID نیز از دیگر ویژگی‌های این فناوری برای کاربردهای سازمانی هستند.

به نظر شما آواتارهای زنده هوش مصنوعی می‌توانند جایگاه مهمی در خدمات مشتری و تعامل کاربران با سرویس‌های آنلاین پیدا کنند؟

اشتراک در
اطلاع از
0 Comments
بازخورد (Feedback) های اینلاین
مشاهده همه دیدگاه ها
مطالب اخیر
امیرحسین ملکی