xAI مدل گفتار به متن Grok Voice Transcript 2.0 را با کاهش خطاهای رونویسی چند زبانه و دقت بیشتر نسبت به نسل قبلی معرفی کرده است.
گزارش کردن سرویس هوش مصنوعی یک مرحله ایپس از ارزیابی این مدل، Atlassian شروع به استفاده از آن برای رونویسی تمام ویدیوهای Loom کرده است.
xAI اعلام کرد که این نسخه عملکرد دقیق تری نسبت به Grok Voice Transcribe 1.0 در محیط های واقعی، پر سر و صدا و چند زبانه ارائه می دهد. این مدل بر اساس همان مدل صوتی اولیه ای که Grok Voice استفاده می کند توسعه یافته است.
به گفته xAI، فناوری صوتی Grok روزانه دهها هزار تماس با پشتیبانی مشتری را پردازش میکند، میلیونها ساعت روایت ویدیویی را به متن تبدیل میکند و در محصولاتی مانند Grok Assistant در خودروهای تسلا استفاده میشود.
بیشتر بخوانید: مایکروسافت: آموزش هوش مصنوعی بزرگترین سرقت نیروی کار در تاریخ است
جهش دقت در رونویسی چند زبانه
مهمترین توسعه مدل جدید گفتار به متن xAI مربوط به رونویسی چند زبانه است. xAI اعلام کرده است که میزان خطای کلمه در مجموعه عبارات کوتاه دستیار صوتی در 19 زبان از 20.6 درصد در نسخه قبلی به 6.8 درصد کاهش یافته است.
جملات کوتاه برای مدلهای تشخیص گفتار دشوارتر هستند، زیرا اطلاعات متنی کمتری را برای تشخیص زبان به مدل ارائه میدهند. Grok Voice Transcript 2.0 می تواند به طور خودکار زبان گفتار را تشخیص دهد و تغییرات زبان را در وسط یک فایل صوتی در یک مرحله ردیابی کند.
xAI همچنین مدل جدید را در چهار مجموعه تست داخلی ارزیابی کرده است. این مجموعه ها شامل تماس های پشتیبانی مشتری، مکالمه با Grok، اطلاعات شفاهی مانند کد حساب و آدرس ایمیل و دستورات صوتی چندزبانه کوتاه است. به گفته این شرکت، نسخه 2.0 در هر چهار مجموعه از دقت بیشتری نسبت به نسل قبلی برخوردار است.
این شرکت اعلام کرد که Grok Voice Transcript 2.0 از نظر دقت در بین 32 مدل استریم در رتبه اول جدول کلی تحلیل مصنوعی قرار گرفته است. xAI این مدل را با گزینه هایی مانند Gemini 3.5 Transcribe، MAI-Transcribe-2، ElevenLabs Scribe v2، Deepgram Nova-3 و Whisper Large v3 مقایسه می کند.
بیشتر بخوانید: حمله سایبری جمنای به سه شرکت طی تست امنیتی
قابلیت های API مدل گفتار به متن xAI
مدل جدید از طریق API گفتار به متن xAI در دسترس است و از رونویسی دستهای فایلها و URLهای ضبط شده و همچنین پردازش صوتی زنده پشتیبانی میکند. کاربران همچنین می توانند زمان هر کلمه، اطمینان مدل، جداسازی بلندگو و رونویسی چند کاناله تا هشت کانال را دریافت کنند.
این سرویس امکان اولویت بندی تا 100 اصطلاح تخصصی، قالب بندی خودکار اعداد، تاریخ، ارز، شماره تلفن و آدرس ایمیل، حذف کلمات غیر ضروری و تشخیص پایان مکالمه را ارائه می دهد. xAI اظهار داشت که کاربران API موجود می توانند از پیشرفت های دقت نسخه جدید بدون تغییر کد استفاده کنند.
با توجه به اسناد رسمی، این سرویس از 12 فرمت صوتی، فایلهای تا حجم 500 مگابایت و چندین نرخ نمونه رایج پشتیبانی میکند. قالب بندی متن نیز برای 25 زبان موجود است.
اطلسیان پس از مقایسه این مدل با راه حل قبلی خود اعلام کرده است که Grok Voice Transcript 2.0 دقیق تر است و اکنون تمامی ویدیوهای Loom با این مدل رونویسی می شوند.
قیمت نسبت به نسل قبل تغییری نکرده است. هزینه رونویسی دسته ای در هر ساعت صوتی 0.10 دلار و پردازش جریانی 0.20 دلار در ساعت هزینه دارد. xAI اعلام کرده است که نسخه 2.0 به زودی به مدل پیش فرض API تبدیل خواهد شد و نسخه 1.0 در هفته های آینده بازنشسته خواهد شد.
بیشتر بخوانید: Grok با داده های استارتاپ های شکست خورده آموزش دیده است















گفتگو در مورد این post