• تبلیغات
  • تماس با ما
پنجشنبه, مهر ۲, ۱۴۰۵
  • ورود
خبرجو
  • صفحه اصلی
  • فرهنگ و هنر
  • تناسب اندام
  • فناوری
  • اقتصاد و سرمایه
  • سلامتی
  • شیوه زندگی
  • ارز دیجیتال
بدون نتیجه
مشاهده تمام نتایج
  • صفحه اصلی
  • فرهنگ و هنر
  • تناسب اندام
  • فناوری
  • اقتصاد و سرمایه
  • سلامتی
  • شیوه زندگی
  • ارز دیجیتال
بدون نتیجه
مشاهده تمام نتایج
خبرجو
بدون نتیجه
مشاهده تمام نتایج
صفحه اصلی فناوری

مدل صوتی جدید گوگل امکان ایجاد صدای اختصاصی را فراهم می کند

سامان پاکدل توسط سامان پاکدل
۰۱ مهر ۱۴۰۵
در فناوری
مدت زمان مطالعه: 3 دقیقه
0
لوگوی گوگل روی یک المان سه‌بعدی در فضایی دیجیتال با نورهای رنگی، نمادی از فناوری‌های هوش مصنوعی و صوتی این شرکت
1790203762 970 مدل صوتی جدید گوگل امکان ایجاد صدای اختصاصی را فراهم

گوگل از دو مدل جدید تبدیل متن به گفتار، Gemini 3.8 Flash TTS و Gemini 3.8 Flash-Lite TTS رونمایی کرد و گفت این محصولات تولید صدا را از مجموعه ای از صداهای ایستا و آماده به محیطی خلاقانه و پویاتر تبدیل می کنند.

به گزارش سرویس هوش مصنوعی Technak، این شرکت می گوید که مدل های جدید برای تولید تجربیات صوتی طبیعی و بیان محور طراحی شده اند و در Google AI Studio، Gemini API، Gemini Enterprise، Gemini Notebook و Google Vids استفاده می شوند.

گوگل اعلام کرد این دو مدل برای گروه های مختلف کاربران ساخته شده اند. Flash TTS بیشتر بر طراحی شخصیت های صوتی و کارگردانی خلاقانه تمرکز دارد و Flash-Lite TTS برای تولید انبوه، دوبله گسترده و استفاده مقرون به صرفه در مقیاس بالا در نظر گرفته شده است.

روی ایجاد صداهای تازه و سفارشی سازی گسترده تمرکز کنید

معرفی مدل های Gemini 3.8 Flash TTS و Gemini 3.8 Flash-Lite TTS گوگل برای تولید گفتار با هوش مصنوعی

یکی از مهم ترین ویژگی های Gemini 3.8 Flash TTS ایجاد صدای دلخواه از ابتدا می باشد. گوگل می گوید که کاربران می توانند با استفاده از دستور زبان طبیعی زبان، نقش، لهجه و ویژگی های صدای مورد نظر را تعریف کرده و یک کاراکتر صوتی جدید ایجاد کنند. این ویژگی برای بازی ها، کتاب های صوتی، پادکست ها و رسانه های تعاملی در نظر گرفته شده است.

گوگل می گوید این ویژگی در بیش از 100 زبان و گویش کار می کند. به گفته این شرکت، کاربر می تواند برای یک شخصیت در یک نمایش، یک راوی با لهجه منطقه ای، یا حتی یک روبات با صدای یکنواخت، صدایی طراحی کند. به گفته گوگل، این ویژگی نشان می دهد که تولید صدا دیگر محدود به انتخاب از چند گزینه محدود نیست.

گوگل علاوه بر ایجاد صداهای جدید، کتابخانه ای با بیش از 2000 صدای آماده را نیز اعلام کرده است. این مجموعه زبان‌ها و انواع منطقه‌ای، از جمله نمونه‌هایی مانند اسپانیایی مکزیکی، فرانسوی کبکی و انگلیسی اسکاتلندی را پوشش می‌دهد. گوگل می گوید که این تنوع به کاربر این امکان را می دهد که بسته به نیاز پروژه، بین استفاده از صدای آماده یا طراحی هویت صوتی جدید یکی را انتخاب کند.

یکی دیگر از قابلیت های معرفی شده شبیه سازی صدا است. گوگل می گوید یک کاربر می تواند با یک نمونه 30 ثانیه ای از صدای خود یا صدایی که حق استفاده از آن را دارد، یک نمایه صدای ثابت ایجاد کند. این شرکت همچنین اعلام کرده است که کاربران می توانند صداهای ایجاد شده را ذخیره و مدیریت کنند تا در پروژه های بعدی همان کیفیت و شخصیت صدا را حفظ کنند.

کنترل دقیق اجرا و هدایت دیالوگ ها

گوگل می گوید هر دو مدل جدید تنها برای ایجاد صدای جدید نیستند، بلکه امکان کنترل اجرای متن را نیز فراهم می کنند. پس از انتخاب صدا، کاربر می تواند نشانه ها و دستوراتی را برای هر خط از اسکریپت بنویسد تا مدل، لحن و بیان را بر اساس آن تنظیم کند. این ویژگی را می توان برای صحنه های آرام، دیالوگ های پر تعلیق یا مکالمات تعاملی استفاده کرد.

به گفته گوگل، Flash TTS همچنین از تولید محتوای طولانی مدت پشتیبانی می کند و می تواند کیفیت صدا، سرعت گفتار طبیعی و تایم آوازی کاراکتر را طی چندین ساعت صدای مداوم حفظ کند.

یکی دیگر از ویژگی های برجسته صحنه سازی بومی برای دو سخنران است. گوگل می گوید کاربران می توانند یک مکالمه چند مرحله ای را در یک اسکریپت تعریف کنند و این مدل به طور طبیعی چرخش های مکالمه را بین دو صدا انجام می دهد.

گوگل همچنین بر امکان افزودن نشانه های غیرکلامی و واکنش های کوتاه تاکید کرده است. با توجه به توضیحات شرکت، کاربر می تواند نشانه هایی مانند خنده، آه یا نفس نفس زدن ناگهانی و واکنش هایی مانند “هوم” یا “بله” را وارد کند تا لایه طبیعی تری به عملکرد اضافه کند.

مدل Lite برای مقیاس بالا و هزینه کمتر

در کنار مدل اصلی، گوگل از Gemini 3.8 Flash-Lite TTS به عنوان گزینه ای برای تولید صدای با حجم بالا نام می برد. به گفته این شرکت، این مدل برای دوبله گسترده، تولید محتوای صوتی و ایجاد عامل صوتی طراحی شده است، در حالی که همچنان به کاربر امکان کنترل لحن، سرعت و ظرافت های بیان را می دهد.

گوگل می گوید تفاوت اصلی بین Flash-Lite TTS و مدل Flash TTS تمرکز آن بر هزینه و مقیاس است. به عبارت دیگر، این مدل برای شرایطی ساخته شده است که سازمان یا توسعه دهنده نیاز به تولید تعداد زیادی فایل صوتی یا ارائه خدمات صوتی در مقیاس بزرگ دارد.

این شرکت در معرفی مدل لایت بر کاربردهای کاربردی آن تاکید کرده است. از دیدگاه گوگل، دوبله محتوای چندزبانه، تولید محتوای صوتی با حجم بالا و توسعه عوامل صوتی بیان محور از مهم ترین زمینه هایی است که می توان از این مدل استفاده کرد.

گوگل این دو مدل را نیز در کنار دیگر محصولات صوتی خود معرفی کرده است. به گفته این شرکت، انتشار آنها به دنبال معرفی 3.5 Live Translate، 3.5 Transcribe، 3.8 Live و 3.8 Live Extended Thinking است.

بیشتر بخوانید: گوگل اپلیکیشن گفتار به متن هوشمند آفلاین را راه اندازی کرد

نتایج ارزیابی و پشتیبانی گسترده زبان

جدول مقایسه کیفیت مدل های تبدیل متن به گفتار شامل Gemini 3.8 Flash TTS، Gemini 3.8 Flash-Lite TTS و چندین مدل رقیب
مقایسه عملکرد مدل‌های تبدیل متن به گفتار در معیار هوش مصنوعی Hume که برتری Gemini 3.8 Flash TTS را در کیفیت کلی، پشتیبانی از چند بلندگو و کنترل سبک نشان می‌دهد.

گوگل در بخشی دیگر از معرفی این محصولات به نتایج چندین ارزیابی خارجی اشاره کرده است. بر اساس اعلام این شرکت، Gemini 3.8 Flash TTS با امتیاز 71.4 در رتبه اول بنچمارک طراحی صوتی Hume AI قرار گرفته است. گوگل همچنین گفته است که این مدل در زمینه شبیه سازی لهجه با امتیاز 60.8 مقام اول را کسب کرده است.

این شرکت اضافه کرد که Gemini 3.8 Flash TTS و Gemini 3.8 Flash-Lite TTS نیز مقام های اول و دوم را در شاخص کیفیت کلی مربوط به هوش مصنوعی Hume کسب کرده اند. گوگل می‌گوید این نتایج نشان می‌دهد که مدل‌های جدید بدون به خطر انداختن ثبات و قابلیت اطمینان، عملکرد واضحی را ارائه می‌دهند.

گوگل همچنین اعلام کرده است که مدل‌های جدید نسبت به Gemini 3.1 Flash TTS در برخی برنامه‌ها، مانند محتوای طولانی و کنترل اسکریپت با دو بلندگو، بهبود یافته‌اند. این شرکت جزئیات فنی بیشتری در مورد روش مقایسه ارائه نکرده است.

در ارزیابی‌های انسانی ناشناس در Voice Arena، گوگل می‌گوید که مدل‌های Flash و Flash-Lite TTS در چندین زبان مهم دنیا به جایگاه بالایی در میان رقبا دست یافته‌اند. زبان هایی که گوگل ذکر کرده است عبارتند از ژاپنی، پرتغالی برزیلی، ویتنامی، عربی استاندارد مدرن، اسپانیایی مکزیکی و هندی.

بیشتر بخوانید: مدل جدید گفتار به متن xAI معرفی شد

ایمنی، رضایت و شفافیت در تولید صدا

گوگل بخشی از معرفی این دو مدل را به مکانیزم های ایمنی اختصاص داده است. این شرکت می‌گوید قابلیت‌های ایجاد و تکثیر صدا با مجموعه‌ای از اقدامات حفاظتی برای محافظت از صاحبان صدا، احترام به هویت افراد و ایجاد شفافیت بیشتر در مورد محتوای تولید شده توسط هوش مصنوعی همراه است.

در مورد تقلید صدا، گوگل می گوید از مکانیزم تایید رضایت استفاده می کند. با توجه به توضیحات شرکت، کاربر باید فایل صوتی حاوی رضایت صاحب صدا را ارائه دهد و این فایل باید با صدای نمونه مرجع مطابقت داشته باشد. فقط در این صورت است که می توان یک نسخه شبیه سازی شده از آن صدا ساخت.

گوگل همچنین اعلام کرده است که تمامی فایل های صوتی تولید شده با مدل های Gemini Audio با SynthID واترمارک خواهند شد. به گفته این شرکت، این واترمارک نامحسوس مستقیماً در خروجی صدا قرار می گیرد و به شناسایی محتوای تولید شده توسط هوش مصنوعی کمک می کند. گوگل هدف از این کار را کاهش خطر انتشار اطلاعات نادرست اعلام کرده است.

علاوه بر این موارد، گوگل به استفاده از اعتبار C2PA نیز اشاره کرده است. این شرکت می گوید چنین ابزارهایی برای محافظت از توسعه دهندگان و استعدادهای صوتی در نظر گرفته شده است.

زمان انتشار و دسترسی به پلتفرم ها

گوگل اعلام کرده است که هر دو مدل جدید از امروز عرضه شده اند. بر این اساس، Gemini 3.8 Flash TTS از طریق Gemini API و Google AI Studio در دسترس توسعه دهندگان قرار گرفته است. این شرکت گفته است که دسترسی سازمانی به این مدل به زودی از طریق یک API در Gemini Enterprise فراهم می شود و کاربران عمومی نیز می توانند از آن در Gemini Notebook استفاده کنند.

برنامه مشابهی برای Gemini 3.8 Flash-Lite TTS اعلام شده است. گوگل می گوید این مدل از طریق Gemini API و Google AI Studio در دسترس توسعه دهندگان قرار خواهد گرفت، دسترسی سازمانی بعداً از طریق Gemini Enterprise انجام خواهد شد و کاربران عمومی می توانند از آن در Google Vids استفاده کنند.

در همان زمان، گوگل یک محیط آزمایشی جدید را در استودیوی هوش مصنوعی گوگل معرفی کرده است که آن را به یک فضای کاری طراحی صدا تشبیه کرده است. این شرکت می‌گوید در این محیط، توسعه‌دهندگان می‌توانند صداهای جدید را از ابتدا ایجاد کنند یا صدای خود را شبیه‌سازی کنند و سپس آنها را به ویرایشگر اسکریپت دو بلندگو وارد کنند.

علاوه بر این، گوگل لیستی از شرکت ها و پلتفرم های شریک را ذکر کرده است. به گفته این شرکت، پلتفرم هایی مانند Agora، LiveKit، Pipecat و Vercel از Gemini API برای ساخت و استقرار تجربیات تولید گفتار استفاده می کنند. گوگل همچنین گفت که شرکت هایی مانند Figma، HeyGen، Linguana، Wondercraft، 99.co و Ollang در حال ادغام مدل های جدید هستند.

در مجموع، معرفی Gemini 3.8 Flash TTS و Gemini 3.8 Flash-Lite TTS نشان می‌دهد که گوگل می‌خواهد حضور قوی‌تری در بازار ابزارهای صوتی هوش مصنوعی در بازار جهانی فناوری صوتی امروز داشته باشد. این شرکت در معرفی این دو مدل، هم بر آزادی عمل در طراحی صدا و کارگردانی دیالوگ ها و هم بر مقیاس پذیری، پوشش زبان و مکانیسم های ایمنی تاکید کرد. در صورت تحقق این وعده ها، خانواده جمینی آدیو می توانند نقش مهم تری در دوبله، گویندگی دیجیتال، تولید محتوای صوتی و توسعه عامل صوتی داشته باشند.

بیشتر بخوانید: 10 افزونه تبدیل متن به گفتار در مرورگرها

پست قبلی

قیمت اونس طلا امروز اول مهر؛ کاهش روزانه ادامه داشت

پست‌ بعدی

جهش هزینه عبور از هرمز؛ بیمه محموله‌های نفتی تا ۲۰ میلیون دلار

سامان پاکدل

سامان پاکدل

مرتبط پست ها

برنامه‌نویسان در عصر هوش مصنوعی به اپراتور مدل‌های زبانی تبدیل می‌شوند
فناوری

هوش مصنوعی برنامه نویسان را برای فشار دادن enter محدود کرده است

۰۲ مهر ۱۴۰۵
کوالکام از شما می‌خواهد به عامل‌های هوش مصنوعی اجازه دهید با پول‌تان خرید کنند
فناوری

کوالکام از شما می خواهد که به عوامل هوش مصنوعی اجازه دهید با پول شما خرید کنند

۰۲ مهر ۱۴۰۵
شارژ خودرو های برقی فقط در ۴ دقیقه؛ رونمایی هیجان‌انگیز جیلی از فناوری شارژ فوق‌ سریع ۲.۲ مگاواتی
فناوری

شارژ خودروهای برقی تنها در 4 دقیقه؛ رونمایی هیجان انگیز جیلی از فناوری شارژ فوق سریع 2.2 مگاواتی

۰۲ مهر ۱۴۰۵
1790215150 افغانی امروز چقدر است؟
فناوری

افغانی امروز چقدر است؟

۰۲ مهر ۱۴۰۵
قابلیت‌های عامل‌محور صوتی به نسخه موبایل ChatGPT اضافه می‌شوند
فناوری

نسخه موبایل ChatGPT مجهز به قابلیت های عامل مبتنی بر صدا است

۰۲ مهر ۱۴۰۵
قیمت لیر ترکیه امروز 1 مهر 1405
فناوری

قیمت لیر ترکیه امروز 1 مهر 1405

۰۲ مهر ۱۴۰۵
بارگذاری بیشتر
پست‌ بعدی
جهش هزینه عبور از هرمز؛ بیمه محموله‌های نفتی تا ۲۰

جهش هزینه عبور از هرمز؛ بیمه محموله‌های نفتی تا ۲۰ میلیون دلار

گفتگو در مورد این post

توصیه شده

افق میهن

نامه فلسطین به فیفا برای تحریم اسرائیل

3 سال پیش
ذخایر دوج کوین Robinhood کاهش یافت

Robinhood اکنون 2 میلیارد DOGE دارد

3 سال پیش
حضور فوتبالیست معروف در ویدئوی تبلیغاتی گوگل!

حضور فوتبالیست معروف در ویدئوی تبلیغاتی گوگل!

3 سال پیش
نصب کنتورهای هوشمند در ادارات تکمیل می‌شود

نصب کنتورهای هوشمند در ادارات تکمیل می‌شود

2 سال پیش

از دست ندهید

فرماندار افزایش ۲۷ درصدی اعتبارات امسال شهرستان تهران

فرماندار: افزایش ۲۷ درصدی اعتبارات امسال شهرستان تهران

۰۲ مهر ۱۴۰۵
برنامه‌نویسان در عصر هوش مصنوعی به اپراتور مدل‌های زبانی تبدیل می‌شوند

هوش مصنوعی برنامه نویسان را برای فشار دادن enter محدود کرده است

۰۲ مهر ۱۴۰۵
کوالکام از شما می‌خواهد به عامل‌های هوش مصنوعی اجازه دهید با پول‌تان خرید کنند

کوالکام از شما می خواهد که به عوامل هوش مصنوعی اجازه دهید با پول شما خرید کنند

۰۲ مهر ۱۴۰۵
پیش‌بینی بورس فردا یکشنبه ۱۵ شهریور ۱۴۰۵

بازآرایی شطرنج سرمایه‌گذاری در کشایش جنگ آسیا و غرب

۰۲ مهر ۱۴۰۵

دیگر رسانه ها

اجاره خودرو

خبرجو تازه‌ترین اخبار در سراسر دنیا در حوره های مالی , فرهنگی , اقتصادی و ... را برای شما به اشتراک خواهد گذاشت.

ما را دنبال کنید

اخبار اخیر

فرماندار افزایش ۲۷ درصدی اعتبارات امسال شهرستان تهران

فرماندار: افزایش ۲۷ درصدی اعتبارات امسال شهرستان تهران

۰۲ مهر ۱۴۰۵
برنامه‌نویسان در عصر هوش مصنوعی به اپراتور مدل‌های زبانی تبدیل می‌شوند

هوش مصنوعی برنامه نویسان را برای فشار دادن enter محدود کرده است

۰۲ مهر ۱۴۰۵

دسته بندی ها

  • ارز دیجیتال
  • اقتصاد و سرمایه
  • تناسب اندام
  • دسته‌بندی نشده
  • سلامتی
  • شیوه زندگی
  • فرهنگ و هنر
  • فناوری

همکاران

  • اخبار اقتصاد
  • تبلیغات
  • تماس با ما

خوش آمدید!

به حساب خود در زیر وارد شوید

رمز عبور را فراموش کرده اید؟

رمز عبور خود را بازیابی کنید

لطفا نام کاربری یا آدرس ایمیل خود را برای بازنشانی رمز عبور خود وارد کنید.

ورود به سیستم
بدون نتیجه
مشاهده تمام نتایج
  • صفحه اصلی
  • فرهنگ و هنر
  • تناسب اندام
  • فناوری
  • اقتصاد و سرمایه
  • سلامتی
  • شیوه زندگی
  • ارز دیجیتال