گوگل Gemini 3.8 Live و تفکر گسترده پشتیبانی با چت صوتی بلادرنگ ۹۷ زبان و استدلال چند مرحله ای را معرفی کرد.
به گزارش سرویس هوش مصنوعی مجردمهندس ارشد گوگل تام اویانگ و عضو تیم فنی مالینی جاگاناتان مدل ها را از طرف تیم جمینی Audio معرفی کردند.
گوگل می گوید این دو مدل پیشرفته ترین مدل های چت زنده این شرکت هستند و برای مکالمات طبیعی طراحی شده اند.
به گفته گوگل، افزایش توانایی هوش مصنوعی و استدلال موازی، تعامل صوتی با این مدل ها را برای انجام کارهای پیچیده طبیعی تر و ساده تر کرده است.
گوگل مدل Gemini 3.8 Live را برای استفاده گسترده و مقرون به صرفه طراحی کرده است. این مدل هوش محاوره ای را با مکالمه روان و درک محتوای بصری ترکیب می کند.
در مقابل، Gemini 3.8 Live Extended Thinking برای کارهای پیچیده ای طراحی شده است که به توانایی بیشتر و استدلال چند مرحله ای نیاز دارند.
نتایج معیارهای اعلام شده
گوگل اعلام کرده است که Gemini 3.8 Live Extended Thinking با امتیاز 82.6 در رتبه اول در شاخص کیفیت گفتار به گفتار تحلیل مصنوعی قرار گرفته است.
این مدل همچنین امتیاز 68.6% را در معیار τ-Voice و 35.1% را در آزمون بانکداری سیرا به نام τ-Voice-banking در تکمیل وظایف عامل محور به دست آورده است.
گوگل همچنین امتیاز 97.7 درصدی را برای این مدل در Big Bench Audio اعلام کرده و میگوید که Extended Thinking در مقایسه با سایر مدلهای سطح بالا، قیمت رقابتی دارد.
Gemini 3.8 Live همچنین در Arena Speech Agent Analysis Artificial Analysis دوم شد.
گوگل می گوید که کاربران از این مدل بسیار استقبال کرده اند و آن را گزینه ای مقرون به صرفه برای استفاده گسترده می دانند.
در معیار EVA-Bench ServiceNow که برای ارزیابی عوامل صوتی استفاده میشود، گوگل میگوید مدلهای جدید میتوانند تعادلی بین دقت و کیفیت مکالمه برای کارهای پیچیده ایجاد کنند.
این ارزیابی با استفاده از Live API در پلتفرم عامل سازمانی Gemini انجام شد.
بیشتر بخوانید: گوگل اپلیکیشن Gemini خود را برای ویندوز منتشر کرده است
گفتگوی همزمان و استدلال عمیق تر
به گفته گوگل، Gemini 3.8 Live تقریباً به طور همزمان ورودی های بصری را پردازش می کند و از این اطلاعات برای ارائه پاسخ های مرتبط تر استفاده می کند.
این مدل می تواند به طور خودکار 97 زبان پشتیبانی شده را در میانه مکالمه تشخیص دهد و بین آنها سوئیچ کند.
Gemini 3.8 Live همچنین میتواند ابزارها و تماسهای API را در پسزمینه اجرا کند، در حالی که مکالمه ادامه دارد.
در این شرایط، مدل درخواست کاربر را تایید می کند و مکالمه را برای تکمیل کار در پس زمینه ادامه می دهد.
در کارهایی که نیاز به استدلال عمیق تری دارند، تفکر گسترده می تواند همزمان با استدلال صحبت کند.
این مدل از پاسخهای صوتی اولیه برای تأیید درخواست طبیعی استفاده میکند و کاربر را از کارهای چند مرحلهای با توضیح زنده از پیشرفت مطلع میکند.
بیشتر بخوانید: حذف چت های Gemini همیشه به معنای حذف شدن آنها نیست
ویژگی های جدید برای توسعه دهندگان
گوگل در نمایشهای نمایشی نشان داده است که Gemini 3.8 Live میتواند به سوالات در جلسه آموزشی کارکنان پاسخ دهد، از اطلاعات بصری برای پاسخ دادن به سوالات استفاده کند، شطرنج بازی کند و با دریافت دستورات صوتی، برنامههای تجاری و ابزارهای بازاریابی سفارشی ایجاد کند.
Extended Thinking همچنین در دموها برای تبدیل نمونههای اولیه و بازخورد صوتی به اجزای عملکردی React تقریباً همزمان استفاده میشود.
این مدل همچنین میتواند با استفاده از تماسهای ناهمزمان، بدون وقفه در مکالمه، رزرو رستوران چند مرحلهای را انجام دهد.
نمونه های دیگر استفاده از این مدل را در Docs Live، Gmail Live و Keep Live نشان می دهد.
گوگل اعلام کرده است که پلتفرم های Agora، Fishjam، LiveKit، Pipecat، Vercel و Vision Agents از Gemini Live API برای ساخت رابط های صوتی استفاده می کنند.
این پلتفرمها زیرساختهای پخش رسانهای را در زمان واقعی مدیریت میکنند و توسعهدهندگان میتوانند روی ساخت رابطهای صوتی تمرکز کنند.
استفاده گسترده از Live API
مستندات رسمی Live API این رابط را برای تعاملات صوتی و تصویری با تأخیر کم، در زمان واقعی با Gemini معرفی می کند.
این API جریانهای پیوسته صدا، ویدیو و متن را پردازش میکند و پاسخهای صوتی فوری را از طریق یک اتصال WebSocket ارائه میدهد.
ورودی صوتی این رابط، صدای خام 16 بیتی PCM با سرعت 16 کیلوهرتز است و تصاویر JPEG حداکثر با یک فریم در ثانیه دریافت می شود.
خروجی صدا با فرمت 16 بیتی PCM خام و نرخ 24 کیلوهرتز ارائه می شود.
توسعه دهندگان می توانند از معماری سرور به سرور استفاده کنند که در آن یک Backend داده های جریان کاربر را به Live API ارسال می کند.
گزینه دیگر معماری کلاینت به سرور است که در آن کد فرانت اند مستقیماً از طریق WebSocket به API متصل می شود.
گوگل کاربردهای این فناوری را در دستیاران خرید و پشتیبانی، شخصیت های تعاملی بازی، روباتیک، عینک هوشمند، اتومبیل، همراهان سلامت صوتی، ابزارهای مشاوره مالی، آموزش، ترجمه همزمان و رونویسی و زیرنویس زنده معرفی کرده است.
گوگل همچنین می گوید که تمام صداهای تولید شده توسط محصولات هوش مصنوعی این شرکت با SynthID واترمارک خواهند شد.
این واترمارک نامرئی مستقیماً روی خروجی صدا قرار می گیرد تا امکان شناسایی محتوای تولید شده توسط هوش مصنوعی و جلوگیری از انتشار اطلاعات نادرست را فراهم کند.
زمان انتشار Gemini 3.8 Live
عرضه هر دو مدل از 15 سپتامبر آغاز شده است. توسعه دهندگان می توانند از آنها در Gemini API و Google AI Studio استفاده کنند.
این مدل ها به عنوان پیش نمایش خصوصی Gemini Enterprise برای کاربران سازمانی نیز در دسترس هستند.
Gemini 3.8 Live برای همه کاربران Search Live فعال است. Extended Thinking همچنین در Gemini Live و در بخش Docs برای مشترکین Google AI Pro و Ultra از طریق Workspace در دسترس است.
این مدل در Gmail و Keep برای همه مشترکین هوش مصنوعی گوگل نیز موجود است.
گوگل اعلام کرده است که به زودی پشتیبانی از هر دو مدل در Gemini Enterprise برای خدمات مشتریان ارائه خواهد شد.
Extended Thinking همچنین در آینده نزدیک برای مشتریان تجاری Google Workspace در دسترس خواهد بود.
















گفتگو در مورد این post