ASRIN

بیایید حرف بزنیم

ثبت سفارش
۲۰۲۶/۰۹/۰۱

دو عدد متفاوت برای GPT-Live: وعده‌ی اوپن‌ای‌آی در برابر اندازه‌گیری مستقل

اوپن‌ای‌آی مدل صوتی GPT-Live را با وعده‌ی پاسخ زیر ۳۰۰ میلی‌ثانیه معرفی کرد. یک آزمایشگاه مستقل اندازه گرفت و به ۱۱۰۰ میلی‌ثانیه رسید. هر دو عدد درست‌اند — و تفاوتشان مهم‌ترین چیزی است که باید درباره‌ی دستیارهای صوتی بدانید.

نمودار میله‌ای مقایسه تأخیر پاسخ GPT-Live و Advanced Voice بر اساس اندازه‌گیری آزمایشگاه آگورا

هشتم ژوئیه، اوپن‌ای‌آی خانواده‌ی تازه‌ای از مدل‌های صوتی را با نام GPT-Live معرفی کرد. تیترها روی یک عدد قفل شدند: پاسخ در کمتر از ۳۰۰ میلی‌ثانیه.

یک روز بعد، آزمایشگاه رسانه‌ی آگورا همان مدل را با دستگاه اندازه گرفت. عددی که به دست آورد ۱۱۰۰ میلی‌ثانیه بود.

هیچ‌کدام دروغ نمی‌گویند. دو چیز متفاوت را می‌سنجند و فهمیدن این تفاوت، تنها راه برای فهمیدن این است که آیا این فناوری واقعاً به درد کار شما می‌خورد یا نه؟

چه چیزی معرفی شد!؟

GPT-Live دو مدل دارد. GPT-Live-1 نسخه‌ی توانمندتر است و پیش‌فرض حساب‌های پولی می باشد؛ GPT-Live-1-mini روی نسخه‌ی رایگان کار می‌کند. هر دو حالت صوتی چت‌جی‌پی‌تی را می‌گردانند و از راه API هم در دسترس توسعه‌دهنده‌ها هستند.

نکته‌ی جالب معماری‌اش این است: وقتی درخواستی پیچیده باشد، GPT-Live خودش آن را به GPT-5.5 پاس می‌دهد. یعنی مدل صوتی برای روان بودن مکالمه بهینه شده، نه برای فکر کردن؛ فکر کردن را به مدل بزرگ‌تر می‌سپارد.

دو عدد متفاوت، دو دلیل متفاوت

نمودار میله‌ای مقایسه تأخیر پاسخ GPT-Live و Advanced Voice بر اساس اندازه‌گیری آزمایشگاه آگورا
اندازه‌گیری آزمایشگاه رسانه‌ی آگورا، ۹ ژوئیه ۲۰۲۶.

عدد ۳۰۰ میلی‌ثانیه به زمانی اشاره دارد که سرور طول می‌کشد تا نخستین قطعه‌ی صوت را تولید کند. عدد واقعی و قابل دفاعی است، ولی فقط یک تکه از زنجیره است.

آنچه شما حس می‌کنید چیز دیگری است: فاصله‌ی بین لحظه‌ای که حرفتان تمام می‌شود تا لحظه‌ای که صدای جواب را می‌شنوید. در این فاصله، صدا باید از میکروفون بیرون بیاید، فشرده شود، از اینترنت رد شود، پردازش شود، برگردد و پخش شود.

آگورا همین را سنجید. روش کارشان هم قابل بازتولید بود: یک «دهان مصنوعی» جمله‌های ضبط‌شده را برای یک آیفون ۱۳ پخش می‌کرد و موج صدای دو طرف همزمان ضبط می‌شد. سی نمونه در هر حالت بررسی شد.

نتیجه: میانه‌ی ۱۱۰۰ میلی‌ثانیه، و صدک ۹۰ روی ۱۳۰۰. نسخه‌ی قبلی — همان Advanced Voice — میانه‌ی ۱۳۰۵ میلی‌ثانیه داشت.

یعنی بهبود واقعی، ۲۰۵ میلی‌ثانیه بوده. محسوس است، ولی آن جهشی نیست که از تیترها برداشت می‌شود.

پس چه چیزی واقعاً بهتر شده؟

اینجا جای جالب ماجراست، و اتفاقاً کسی درباره‌اش تیتر نزد.

انحراف معیار زمان پاسخ از ۴۸۹ میلی‌ثانیه به ۱۰۴ رسیده است. به زبان ساده: قبلاً بعضی جواب‌ها زود می‌آمدند و بعضی خیلی دیر، حالا تقریباً همیشه یک اندازه طول می‌کشد.

این مهم‌تر از سرعت خام است. مغز آدم با تأخیر ثابت کنار می‌آید — همان‌طور که با تأخیر تماس تلفنی بین‌شهری کنار می‌آید، ولی با تأخیر غیرقابل‌پیش‌بینی کنار نمی‌آید. همین موضوع باعث می‌شود دو نفر همزمان شروع کنند به حرف زدن و بعد هر دو ساکت شوند.

نسبت به شبکه‌ی بد هم مقاوم‌تر شده: با ۱۰ درصد از دست رفتن بسته، صدک ۹۰ آن ۱۸۳۶ میلی‌ثانیه بود که بهتر از ۲۳۱۸ میلی‌ثانیه‌ی نسخه‌ی قبلی، روی شبکه‌ی سالم، می باشد. برای کاربر ایرانی که کیفیت اتصالش ثابت نیست، این عدد ازمضوضع سرعت پاسگویی مهم‌تر است.

ارتباط دوطرفه یعنی چه؟

نمودار مقایسه معماری نیم‌دوطرفه و تمام‌دوطرفه در دستیار صوتی هوش مصنوعی
تفاوت در نوبت‌گیری است، نه در سرعت پردازش.

مدل‌های صوتی پیشین نوبتی کار می‌کردند: شما حرف می‌زدید، سیستم تشخیص می‌داد که تمام شد، بعد شروع می‌کرد به فکر کردن. مثل بی‌سیم — یکی حرف می‌زند، دیگری گوش می‌دهد.

مشکلش آن لحظه‌ی «تشخیص اتمام » بود. هر مکث کوتاه شما، هر «اِم…» وسط جمله، ممکن بود پایان نوبت خوانده شود. برای همین وسط حرف قطع می‌شدید.

GPT-Live همزمان می‌شنود و حرف می‌زند. مدام از خودش می‌پرسد آیا باید چیزی بگوید، آیا باید جستجو کند، یا باید ساکت بماند. دیگر منتظر «پایان جمله» نمی‌ماند.

ولی یک عقب‌گرد هم دارد که در اطلاعیه‌ها نیست: وقتی وسط حرفش می‌پرید، ۴۹۸ میلی‌ثانیه دیرتر از نسخه‌ی قبل ساکت می‌شود. نیم‌ثانیه حرف زدن روی حرف کسی، دقیقاً همان چیزی است که آدم حس می‌کند.

برای کار در ایران چه معنایی دارد؟

سه نکته که در هیچ اطلاعیه‌ای نیست:

مسافت، به عددها اضافه می‌شود. ۱۱۰۰ میلی‌ثانیه در آزمایشی به دست آمده است که فاصله‌ی شبکه‌اش کوتاه بوده. هر میلی‌ثانیه‌ای که بسته‌ی صوتی شما تا نزدیک‌ترین سرور طی می‌کند، دو بار به این عدد اضافه می‌شود.

کیفیت فارسی هنوز نامعلوم است. همه‌ی این اندازه‌گیری‌ها با گفتار انگلیسی انجام شده است. مدل‌های صوتی معمولاً روی زبان‌های کم‌داده‌تر هم کندتر و هم کم‌دقت‌ترند. تا کسی با فارسی نسنجد، این اعداد را نمی‌شود به فارسی تعمیم داد.

پیش از ساختن، بسنجید. اگر می‌خواهید روی این API چیزی بسازید — پشتیبانی صوتی، منشی تلفنی، دستیار داخل اپ — اول با کاربر واقعی و شبکه‌ی واقعی تست کنید. ابزارهایی مثل n8n این اتصال را بدون کدنویسی ممکن می‌کنند. عدد اطلاعیه، عددِ محیط شما نیست.

چه چیزی در راه است

همین هفته گزارش شده که اوپن‌ای‌آی آزمایش‌های داخلی مدل تازه‌ای با نام رمز GPT Astra را گسترش داده. چیز دقیقی درباره‌اش منتشر نشده و هر تحلیلی الان حدس است، ولی الگوی همیشگی این شرکت نشان می‌دهد که گسترش تست داخلی معمولاً چند هفته پیش از انتشار عمومی اتفاق می‌افتد.

حرف آخر

دفعه‌ی بعد که عددی درباره‌ی سرعت یک مدل خواندید، یک سؤال بپرسید: این عدد از کجا تا کجا را می‌سنجد؟

فاصله‌ی بین «۳۰۰ میلی‌ثانیه» و «۱۱۰۰ میلی‌ثانیه» نشانه دهنده دروغ نیست؛ بلکه تعریف متفاوت از یک کلمه است. و تقریباً همیشه، آن تعریفی که به تجربه‌ی کاربر نزدیک‌تر است، عدد بزرگ‌تری می‌دهد.

بیشتر بخوانید

اگر می‌خواهید ببینید همین مدل‌ها را چطور می‌شود بدون کدنویسی به کار گرفت، معرفی n8n نقطه‌ی شروع خوبی است.

منابع

دیدگاه شما

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *