سایر زبان ها

صفحه نخست

فیلم

عکس

ورزشی

اجتماعی

باشگاه جوانی

سیاسی

فرهنگ و هنر

اقتصادی

هوش مصنوعی، علم و فناوری

بین الملل

استان ها

رسانه ها

بازار

صفحات داخلی

گفت‌و‌گو با هوش مصنوعی چت جی پی تی طبیعی‌تر از همیشه شد؛ GPT-Live چگونه فعال می‌شود؟

۱۴۰۵/۰۵/۱۹ - ۲۰:۰۰:۰۲
کد خبر: ۲۳۷۵۵۵۵
برنا – گروه علمی و فناوری: مدل صوتی جدید GPT-Live با امکان شنیدن همزمان با صحبت کاربر واکنش‌های طبیعی و پاسخ‌گویی روان‌تر تجربه مکالمه با ChatGPT را به گفت‌وگوی انسانی نزدیک‌تر می‌کند.

شرکت OpenAI با معرفی مدل صوتی جدید GPT-Live تجربه مکالمه صوتی در ChatGPT را وارد مرحله تازه‌ای کرده است؛ مدلی که با معماری دوطرفه کامل می‌تواند همزمان به صحبت کاربر گوش دهد و پاسخ خود را ارائه کند و با واکنش‌های کوتاه و طبیعی مانند هوم و آره تلاش می‌کند گفت‌و‌گو با هوش مصنوعی را بیش از گذشته به مکالمه انسانی شبیه کند.

به گزارش گروه ترجمه خبرگراری برنا به نقل از انگجت، دستیار‌های هوش مصنوعی در سال‌های اخیر با سرعت زیادی توسعه یافته‌اند و در کنار افزایش قابلیت‌ها، دقت و سرعت پاسخ‌گویی آنها نیز بهبود پیدا کرده است. با این حال یکی از مسیر‌هایی که می‌تواند استفاده روزمره از این ابزار‌ها را ساده‌تر کند جایگزین کردن تایپ با گفت‌وگوی صوتی است.

نسخه اولیه حالت صوتی ChatGPT که در سال ۲۰۲۳ معرفی شد، برای برقراری مکالمه از سه سامانه جداگانه استفاده می‌کرد. در این فرآیند صدای کاربر ابتدا به متن تبدیل می‌شد سپس یک مدل زبانی پاسخ را تولید می‌کرد و در نهایت یک سامانه تبدیل متن به گفتار، پاسخ تولیدشده را به صورت صوتی برای کاربر می‌خواند.

پس از آن OpenAI حالت Advanced Voice را ارائه کرد که با استفاده از یک مدل چندوجهی واحد تجربه مکالمه را به شکل محسوسی بهبود داد. اکنون GPT-Live به عنوان مدل جدید مکالمه صوتی ChatGPT معرفی شده و قرار است طبیعی‌تر، سریع‌تر و روان‌تر از نسل‌های قبلی با کاربران تعامل کند.

معماری جدید برای گفت‌وگویی روان‌تر

یکی از مهم‌ترین تفاوت‌های GPT-Live با نسل‌های قبلی، استفاده از معماری موسوم به Full-Duplex یا دوطرفه کامل است. این معماری به مدل اجازه می‌دهد در زمان صحبت کردن کاربر همچنان به صدای او گوش دهد و در تعامل صوتی وقفه کمتری ایجاد شود.

در مدل‌های قبلی یکی از مشکلات رایج این بود که ChatGPT گاهی یک مکث کوتاه کاربر را به‌عنوان پایان صحبت تلقی می‌کرد و پیش از آنکه فرد جمله خود را کامل کند شروع به پاسخ دادن می‌کرد. این مسئله می‌توانست گفت‌و‌گو را مصنوعی و تا حدی آزاردهنده کند.

GPT-Live تلاش می‌کند این مشکل را برطرف کند. این مدل در جریان صحبت کاربر ممکن است واکنش‌های صوتی کوتاهی مانند «هوم» یا «آره» نشان دهد، واکنش‌هایی که در مکالمات انسانی نیز برای نشان دادن توجه و همراهی با گوینده استفاده می‌شوند.

از سوی دیگر GPT-Live می‌تواند برخی درخواست‌های پیچیده‌تر را در پس‌زمینه به مدل‌های قدرتمندتر از جمله GPT-۵.۵ واگذار کند تا در صورت نیاز از توانایی‌های بیشتر برای استدلال یا جست‌و‌جو استفاده شود بدون اینکه روند مکالمه صوتی به‌طور کامل متوقف شود.

GPT-Live چگونه فعال می‌شود؟

مدل صوتی جدید GPT-Live از طریق اپلیکیشن ChatGPT روی دستگاه‌های اندرویدی و iOS و همچنین نسخه تحت وب این سرویس از طریق مرورگر در دسترس است.

کاربران دارای اشتراک‌های Pro، Plus و Go به مدل GPT-Live-۱ دسترسی خواهند داشت در حالی که کاربران نسخه رایگان می‌توانند از GPT-Live-۱ mini استفاده کنند.

GPT-Live جایگزین مدل صوتی قبلی مبتنی بر مکالمات نوبتی شده و به عنوان گزینه پیش‌فرض حالت صوتی ChatGPT در نظر گرفته شده است.

برای آغاز مکالمه کافی است کاربر روی آیکون Voice در ChatGPT که به شکل یک موج صوتی در سمت راست کادر ورود متن قرار دارد ضربه بزند. در نخستین استفاده نیز ممکن است برنامه برای دسترسی به میکروفون دستگاه از کاربر اجازه بگیرد.
پس از ورود به حالت صوتی، یک گوی شناور و واکنش‌گرا روی صفحه نمایش داده می‌شود و کاربر می‌تواند مانند یک گفت‌وگوی عادی شروع به صحبت کند.

امکان انتخاب سطح هوش صوتی

GPT-Live علاوه بر بهبود طبیعی بودن مکالمه امکان تنظیم سطح هوش مدل را نیز در اختیار برخی کاربران قرار می‌دهد.
با ورود به تنظیمات از طریق آیکون موجود در گوشه بالای سمت راست صفحه، سه سطح Instant، Medium و High برای انتخاب در دسترس است. سطح Instant به صورت پیش‌فرض فعال است و برای پرسش‌های روزمره طراحی شده؛ این حالت تلاش می‌کند پاسخ‌ها را با سرعت بیشتری ارائه کند و در عین حال در صورت نیاز وظایف پیچیده‌تر مانند جست‌و‌جو یا استدلال عمیق را به مدل‌های قدرتمندتر واگذار کند.

در مقابل انتخاب حالت‌های Medium و High زمان بیشتری برای پردازش درخواست در اختیار مدل قرار می‌دهد. بر اساس تجربه گزارش‌شده این تغییر ممکن است تنها چند لحظه به زمان پاسخ‌گویی اضافه کند اما برای پرسش‌های پیچیده‌تر می‌تواند کیفیت استدلال را افزایش دهد.

البته قابلیت انتخاب سطح هوش در حال حاضر برای مدل GPT-Live-۱ mini ارائه نشده و بنابراین استفاده از این امکان به کاربران دارای طرح‌های پولی محدود است.

ادامه مکالمه حتی هنگام خروج از برنامه

یکی دیگر از قابلیت‌های GPT-Live این است که مکالمه صوتی می‌تواند حتی پس از جابه‌جایی کاربر به یک برنامه دیگر یا قفل کردن دستگاه نیز ادامه پیدا کند. این قابلیت می‌تواند برای استفاده‌های روزمره، آموزش، ترجمه زنده یا انجام گفت‌و‌گو‌های طولانی کاربردی باشد و نیاز کاربر به باقی ماندن در صفحه ChatGPT را کاهش دهد.

واکنش‌پذیری بالاتر مدل صوتی جدید می‌تواند آن را به ابزاری کاربردی برای ترجمه زنده نیز تبدیل کند. کاربر می‌تواند در جریان گفت‌و‌گو از GPT-Live برای ترجمه مکالمات استفاده کند و بدون نیاز به توقف‌های مکرر روند ترجمه را ادامه دهد.

همچنین در هر مرحله از مکالمه کاربر می‌تواند با پایین کشیدن صفحه، متن پیاده‌سازی‌شده یا Transcript گفت‌و‌گو را مشاهده کند. این ویژگی امکان بررسی دقیق‌تر صحبت‌های ردوبدل‌شده را فراهم می‌کند.

پاسخ‌های صوتی همراه با محتوای تعاملی

GPT-Live تنها به ارائه پاسخ صوتی محدود نیست. در صورتی که مدل تشخیص دهد یک پرسش با استفاده از محتوای بصری بهتر قابل پاسخ‌گویی است می‌تواند در کنار پاسخ صوتی، یک ویجت تعاملی نیز ایجاد کند.

به این ترتیب تجربه کاربر از یک گفت‌وگوی صرفا صوتی فراتر می‌رود و امکان ترکیب پاسخ صوتی با محتوای بصری و تعاملی فراهم می‌شود.

GPT-Live هنوز یک محدودیت مهم دارد

با وجود پیشرفت‌های قابل توجه حالت صوتی جدید ChatGPT هنوز از برخی قابلیت‌های نسخه‌های پیشین برخوردار نیست. یکی از مهم‌ترین محدودیت‌های فعلی GPT-Live، پشتیبانی نکردن از اشتراک‌گذاری صفحه نمایش یا ویدئو است.

کاربرانی که به این قابلیت‌ها نیاز دارند می‌توانند از طریق تنظیمات ChatGPT و بخش Voice، مدل صوتی دیگری را انتخاب کنند و به نسخه قدیمی‌تر بازگردند.

در همین بخش امکان انتخاب صدای مورد استفاده توسط ChatGPT، تغییر زبان و همچنین تنظیم حالت صوتی به عنوان حالت پیش‌فرض هنگام اجرای برنامه نیز وجود دارد.

چرا مکالمه با GPT-Live طبیعی‌تر به نظر می‌رسد؟

یکی از مهم‌ترین تفاوت‌های GPT-Live با نسل‌های قبلی نه صرفا افزایش توانایی‌های هوش مصنوعی، بلکه تغییر نحوه تعامل آن با کاربر است.

در تجربه‌های اولیه، یکی از نقاط قوت اصلی مدل کاهش قطع کردن صحبت کاربر و حذف نیاز به منتظر ماندن برای پایان کامل پاسخ ChatGPT پیش از ادامه گفت‌و‌گو عنوان شده است.

در مکالمات طولانی‌تر نیز واکنش‌پذیری مدل باعث می‌شود روند گفت‌و‌گو بیشتر شبیه تعامل میان دو انسان باشد. مدل می‌تواند در جریان صحبت کاربر مکث‌ها را بهتر مدیریت کند و با واکنش‌های کوتاه نشان دهد که همچنان در حال دنبال کردن گفت‌و‌گو است.

این تغییر ممکن است در نگاه نخست کوچک به نظر برسد اما در استفاده طولانی‌مدت می‌تواند تفاوت قابل توجهی در تجربه کاربر ایجاد کند؛ چراکه یکی از موانع اصلی استفاده طبیعی از دستیار‌های صوتی نوبتی بودن و وقفه‌های مصنوعی میان صحبت کاربر و پاسخ هوش مصنوعی بوده است.

در مجموع GPT-Live تلاش می‌کند فاصله میان صحبت کردن با یک نرم‌افزار و گفت‌و‌گو با یک طرف مقابل را کاهش دهد. معماری دوطرفه واکنش‌های صوتی کوتاه، پاسخ‌گویی سریع، امکان ترجمه زنده و ترکیب پاسخ صوتی با محتوای تعاملی از جمله قابلیت‌هایی هستند که OpenAI برای طبیعی‌تر کردن تجربه Voice در ChatGPT در نظر گرفته است.

انتهای پیام/

نظر شما