شرکت OpenAI با معرفی مدل صوتی جدید GPT-Live تجربه مکالمه صوتی در ChatGPT را وارد مرحله تازهای کرده است؛ مدلی که با معماری دوطرفه کامل میتواند همزمان به صحبت کاربر گوش دهد و پاسخ خود را ارائه کند و با واکنشهای کوتاه و طبیعی مانند هوم و آره تلاش میکند گفتوگو با هوش مصنوعی را بیش از گذشته به مکالمه انسانی شبیه کند.
به گزارش گروه ترجمه خبرگراری برنا به نقل از انگجت، دستیارهای هوش مصنوعی در سالهای اخیر با سرعت زیادی توسعه یافتهاند و در کنار افزایش قابلیتها، دقت و سرعت پاسخگویی آنها نیز بهبود پیدا کرده است. با این حال یکی از مسیرهایی که میتواند استفاده روزمره از این ابزارها را سادهتر کند جایگزین کردن تایپ با گفتوگوی صوتی است.
نسخه اولیه حالت صوتی ChatGPT که در سال ۲۰۲۳ معرفی شد، برای برقراری مکالمه از سه سامانه جداگانه استفاده میکرد. در این فرآیند صدای کاربر ابتدا به متن تبدیل میشد سپس یک مدل زبانی پاسخ را تولید میکرد و در نهایت یک سامانه تبدیل متن به گفتار، پاسخ تولیدشده را به صورت صوتی برای کاربر میخواند.
پس از آن OpenAI حالت Advanced Voice را ارائه کرد که با استفاده از یک مدل چندوجهی واحد تجربه مکالمه را به شکل محسوسی بهبود داد. اکنون GPT-Live به عنوان مدل جدید مکالمه صوتی ChatGPT معرفی شده و قرار است طبیعیتر، سریعتر و روانتر از نسلهای قبلی با کاربران تعامل کند.
یکی از مهمترین تفاوتهای GPT-Live با نسلهای قبلی، استفاده از معماری موسوم به Full-Duplex یا دوطرفه کامل است. این معماری به مدل اجازه میدهد در زمان صحبت کردن کاربر همچنان به صدای او گوش دهد و در تعامل صوتی وقفه کمتری ایجاد شود.
در مدلهای قبلی یکی از مشکلات رایج این بود که ChatGPT گاهی یک مکث کوتاه کاربر را بهعنوان پایان صحبت تلقی میکرد و پیش از آنکه فرد جمله خود را کامل کند شروع به پاسخ دادن میکرد. این مسئله میتوانست گفتوگو را مصنوعی و تا حدی آزاردهنده کند.
GPT-Live تلاش میکند این مشکل را برطرف کند. این مدل در جریان صحبت کاربر ممکن است واکنشهای صوتی کوتاهی مانند «هوم» یا «آره» نشان دهد، واکنشهایی که در مکالمات انسانی نیز برای نشان دادن توجه و همراهی با گوینده استفاده میشوند.
از سوی دیگر GPT-Live میتواند برخی درخواستهای پیچیدهتر را در پسزمینه به مدلهای قدرتمندتر از جمله GPT-۵.۵ واگذار کند تا در صورت نیاز از تواناییهای بیشتر برای استدلال یا جستوجو استفاده شود بدون اینکه روند مکالمه صوتی بهطور کامل متوقف شود.
مدل صوتی جدید GPT-Live از طریق اپلیکیشن ChatGPT روی دستگاههای اندرویدی و iOS و همچنین نسخه تحت وب این سرویس از طریق مرورگر در دسترس است.
کاربران دارای اشتراکهای Pro، Plus و Go به مدل GPT-Live-۱ دسترسی خواهند داشت در حالی که کاربران نسخه رایگان میتوانند از GPT-Live-۱ mini استفاده کنند.
GPT-Live جایگزین مدل صوتی قبلی مبتنی بر مکالمات نوبتی شده و به عنوان گزینه پیشفرض حالت صوتی ChatGPT در نظر گرفته شده است.
برای آغاز مکالمه کافی است کاربر روی آیکون Voice در ChatGPT که به شکل یک موج صوتی در سمت راست کادر ورود متن قرار دارد ضربه بزند. در نخستین استفاده نیز ممکن است برنامه برای دسترسی به میکروفون دستگاه از کاربر اجازه بگیرد.
پس از ورود به حالت صوتی، یک گوی شناور و واکنشگرا روی صفحه نمایش داده میشود و کاربر میتواند مانند یک گفتوگوی عادی شروع به صحبت کند.
GPT-Live علاوه بر بهبود طبیعی بودن مکالمه امکان تنظیم سطح هوش مدل را نیز در اختیار برخی کاربران قرار میدهد.
با ورود به تنظیمات از طریق آیکون موجود در گوشه بالای سمت راست صفحه، سه سطح Instant، Medium و High برای انتخاب در دسترس است. سطح Instant به صورت پیشفرض فعال است و برای پرسشهای روزمره طراحی شده؛ این حالت تلاش میکند پاسخها را با سرعت بیشتری ارائه کند و در عین حال در صورت نیاز وظایف پیچیدهتر مانند جستوجو یا استدلال عمیق را به مدلهای قدرتمندتر واگذار کند.
در مقابل انتخاب حالتهای Medium و High زمان بیشتری برای پردازش درخواست در اختیار مدل قرار میدهد. بر اساس تجربه گزارششده این تغییر ممکن است تنها چند لحظه به زمان پاسخگویی اضافه کند اما برای پرسشهای پیچیدهتر میتواند کیفیت استدلال را افزایش دهد.
البته قابلیت انتخاب سطح هوش در حال حاضر برای مدل GPT-Live-۱ mini ارائه نشده و بنابراین استفاده از این امکان به کاربران دارای طرحهای پولی محدود است.
یکی دیگر از قابلیتهای GPT-Live این است که مکالمه صوتی میتواند حتی پس از جابهجایی کاربر به یک برنامه دیگر یا قفل کردن دستگاه نیز ادامه پیدا کند. این قابلیت میتواند برای استفادههای روزمره، آموزش، ترجمه زنده یا انجام گفتوگوهای طولانی کاربردی باشد و نیاز کاربر به باقی ماندن در صفحه ChatGPT را کاهش دهد.
واکنشپذیری بالاتر مدل صوتی جدید میتواند آن را به ابزاری کاربردی برای ترجمه زنده نیز تبدیل کند. کاربر میتواند در جریان گفتوگو از GPT-Live برای ترجمه مکالمات استفاده کند و بدون نیاز به توقفهای مکرر روند ترجمه را ادامه دهد.
همچنین در هر مرحله از مکالمه کاربر میتواند با پایین کشیدن صفحه، متن پیادهسازیشده یا Transcript گفتوگو را مشاهده کند. این ویژگی امکان بررسی دقیقتر صحبتهای ردوبدلشده را فراهم میکند.
GPT-Live تنها به ارائه پاسخ صوتی محدود نیست. در صورتی که مدل تشخیص دهد یک پرسش با استفاده از محتوای بصری بهتر قابل پاسخگویی است میتواند در کنار پاسخ صوتی، یک ویجت تعاملی نیز ایجاد کند.
به این ترتیب تجربه کاربر از یک گفتوگوی صرفا صوتی فراتر میرود و امکان ترکیب پاسخ صوتی با محتوای بصری و تعاملی فراهم میشود.
با وجود پیشرفتهای قابل توجه حالت صوتی جدید ChatGPT هنوز از برخی قابلیتهای نسخههای پیشین برخوردار نیست. یکی از مهمترین محدودیتهای فعلی GPT-Live، پشتیبانی نکردن از اشتراکگذاری صفحه نمایش یا ویدئو است.
کاربرانی که به این قابلیتها نیاز دارند میتوانند از طریق تنظیمات ChatGPT و بخش Voice، مدل صوتی دیگری را انتخاب کنند و به نسخه قدیمیتر بازگردند.
در همین بخش امکان انتخاب صدای مورد استفاده توسط ChatGPT، تغییر زبان و همچنین تنظیم حالت صوتی به عنوان حالت پیشفرض هنگام اجرای برنامه نیز وجود دارد.
یکی از مهمترین تفاوتهای GPT-Live با نسلهای قبلی نه صرفا افزایش تواناییهای هوش مصنوعی، بلکه تغییر نحوه تعامل آن با کاربر است.
در تجربههای اولیه، یکی از نقاط قوت اصلی مدل کاهش قطع کردن صحبت کاربر و حذف نیاز به منتظر ماندن برای پایان کامل پاسخ ChatGPT پیش از ادامه گفتوگو عنوان شده است.
در مکالمات طولانیتر نیز واکنشپذیری مدل باعث میشود روند گفتوگو بیشتر شبیه تعامل میان دو انسان باشد. مدل میتواند در جریان صحبت کاربر مکثها را بهتر مدیریت کند و با واکنشهای کوتاه نشان دهد که همچنان در حال دنبال کردن گفتوگو است.
این تغییر ممکن است در نگاه نخست کوچک به نظر برسد اما در استفاده طولانیمدت میتواند تفاوت قابل توجهی در تجربه کاربر ایجاد کند؛ چراکه یکی از موانع اصلی استفاده طبیعی از دستیارهای صوتی نوبتی بودن و وقفههای مصنوعی میان صحبت کاربر و پاسخ هوش مصنوعی بوده است.
در مجموع GPT-Live تلاش میکند فاصله میان صحبت کردن با یک نرمافزار و گفتوگو با یک طرف مقابل را کاهش دهد. معماری دوطرفه واکنشهای صوتی کوتاه، پاسخگویی سریع، امکان ترجمه زنده و ترکیب پاسخ صوتی با محتوای تعاملی از جمله قابلیتهایی هستند که OpenAI برای طبیعیتر کردن تجربه Voice در ChatGPT در نظر گرفته است.
انتهای پیام/