گوگل قابلیت جدید Live Avatar را برای Gemini 3.8 Live معرفی کرده است که به ایجنتهای هوش مصنوعی سازمانی امکان میدهد با یک آواتار تصویری و بهصورت زنده با کاربران مکالمه کنند. این فناوری تولید ویدیوی تقریباً بلادرنگ را با گفتوگوی صوتی ترکیب میکند و از هماهنگی حرکت لبها، حالات طبیعی چهره، تعامل چندوجهی و مکالمه صوتی در ۹۷ زبان پشتیبانی میکند.
🔹 قابلیت Live Avatar حضور تصویری بلادرنگ را به مکالمات Gemini 3.8 Live اضافه میکند.
🔹 آواتار میتواند ورودیهای صوتی و تصویری را همزمان پردازش کند و با هماهنگی دقیق لب و حالات طبیعی چهره پاسخ دهد.
🔹 اجرای غیرهمزمان ابزارها به ایحنت هوش مصنوعی اجازه میدهد هنگام ادامه مکالمه، اطلاعات موردنیاز را در پسزمینه دریافت کند.
🔹 مکالمه صوتی چندزبانه در ۹۷ زبان پشتیبانی میشود و حرکات لب و چهره هنگام تغییر زبان بهصورت پویا تنظیم میشوند.
🔹 قابلیت Gemini 3.8 Live with Live Avatar از امروز در Gemini Enterprise در دسترس قرار گرفته است.
گوگل پس از معرفی Gemini 3.8 Live در هفته گذشته، اکنون قابلیت Live Avatar را به آن اضافه کرده است. این فناوری قابلیت مکالمه زنده مدل را با استریم ویدیویی کمتأخیر ترکیب میکند.
Live Avatar با ترکیب تولید ویدیوی تقریباً بلادرنگ و گفتار، یک شخصیت تصویری پویا ایجاد میکند که میتواند در جریان مکالمه گوش دهد، ببیند و صحبت کند.
گوگل برای طبیعیتر شدن تعامل روی هماهنگی دقیق حرکت لبها با گفتار، حالات طبیعی چهره و جابهجایی روان نوبت مکالمه تمرکز کرده است.
قابلیت Live Avatar میتواند ورودیهای صوتی و تصویری را بهطور همزمان پردازش کند. این اطلاعات در کنار مدل گفتوگوی زنده Gemini برای ایجاد تعامل چندوجهی مورد استفاده قرار میگیرند.
در نتیجه، عاملهای سازمانی میتوانند در مکالمهای شرکت کنند که شامل گفتار، اطلاعات بصری و حالات چهره است.
گوگل کاربردهایی مانند خدمات مشتری و راهنمای تعاملی را برای این فناوری مطرح کرده است؛ موقعیتهایی که در آن یک عامل هوش مصنوعی سازمانی از طریق آواتار تصویری مستقیماً با کاربر ارتباط برقرار میکند.
یکی دیگر از قابلیتهای مهم Live Avatar، استفاده از استدلال Gemini در کنار فراخوانی غیرهمزمان ابزارها است.
عامل هوش مصنوعی میتواند هنگام ادامه گفتوگو، یک ابزار را در پسزمینه اجرا کرده و اطلاعات موردنیاز خود را دریافت کند. بنابراین لازم نیست مکالمه تا زمان دریافت پاسخ ابزار متوقف شود.
این ویژگی به Live Avatar اجازه میدهد وظایف پیچیدهتری را انجام دهد و همزمان جریان طبیعی مکالمه با کاربر را حفظ کند.
گوگل برای Live Avatar از همگامسازی بومی گفتار به گفتار در ۹۷ زبان پشتیبانی میکند.
هنگامی که کاربر یا عامل در جریان مکالمه از یک زبان به زبان دیگری تغییر میکند، سیستم میتواند هماهنگی حرکت لبها و حالات چهره را بهصورت پویا با زبان جدید تطبیق دهد.
به گفته گوگل، کیفیت ویدیو هنگام این تغییر زبانها حفظ میشود و سیستم از ایجاد انحراف بصری در تصویر جلوگیری میکند.
سازمانها برای استفاده از Live Avatar میتوانند از مجموعهای از آواتارهای آماده و متنوع استفاده کنند یا آواتار اختصاصی خود را بسازند.
توسعهدهندگان میتوانند با استفاده از یک تصویر مرجع باکیفیت، یک آواتار کاملاً متحرک و واکنشگرا ایجاد کنند. طبق اطلاعات ارائهشده، سیستم هنگام ساخت آواتار اختصاصی میتواند شباهت به تصویر مرجع، سبک بصری برند و هویت شخصیت را حفظ کند.
با این حال، قابلیت ساخت آواتار اختصاصی در حال حاضر تنها برای سازمانهایی در دسترس است که از طریق فهرست مجاز سازمانی به آن دسترسی پیدا کردهاند.
گوگل برای Live Avatar مجموعهای از تدابیر ایمنی را نیز در نظر گرفته است که هدف آنها رعایت هویت افراد و شفافتر کردن محتوای تولیدشده توسط هوش مصنوعی است.
طبق اعلام گوگل، خروجی تولیدشده توسط محصولات هوش مصنوعی این شرکت دارای واترمارک SynthID است. این واترمارک نامحسوس مستقیماً در محتوای صوتی و ویدیویی تولیدشده قرار میگیرد.
هدف از این فناوری کمک به تشخیص محتوای تولیدشده با هوش مصنوعی و کاهش احتمال انتشار اطلاعات نادرست یا انتساب اشتباه محتوا عنوان شده است. گوگل همچنین یک Model Card درباره رویکرد ایمنی و استقرار مسئولانه این فناوری ارائه کرده است.
قابلیت Gemini 3.8 Live with Live Avatar از زمان معرفی در Gemini Enterprise در دسترس قرار گرفته است.
گوگل همچنین مستندات API مربوط به این قابلیت را منتشر کرده تا توسعهدهندگان بتوانند استفاده از Live Avatar را در محصولات و سرویسهای سازمانی خود آغاز کنند.
قابلیت Live Avatar با افزودن تولید ویدیوی کمتأخیر، هماهنگی لب و چهره، پردازش همزمان صدا و تصویر و پشتیبانی از مکالمه در ۹۷ زبان، حضور تصویری را به Gemini 3.8 Live اضافه میکند. اجرای ابزارها در پسزمینه، امکان ساخت آواتارهای اختصاصی و استفاده از واترمارک SynthID نیز از دیگر ویژگیهای این فناوری برای کاربردهای سازمانی هستند.
به نظر شما آواتارهای زنده هوش مصنوعی میتوانند جایگاه مهمی در خدمات مشتری و تعامل کاربران با سرویسهای آنلاین پیدا کنند؟