اخبار هوش مصنوعی

آنتروپیک در کدنویسی و متن، اوپن‌ای‌آی در تصویر و گوگل در ویدئو؛ نقشه جدید رقابت هوش مصنوعی

داده‌های تازه وبگاه «Arena.ai» نشان می‌دهد رقابت در صنعت هوش مصنوعی دیگر حول یک مدل یا یک شرکت واحد نمی‌چرخد. هر آزمایشگاه در بخشی از مرز فناوری جایگاه متفاوتی پیدا کرده است؛ آنتروپیک در متن و کدنویسی پیشتاز است، اوپن‌ای‌آی در تولید و ویرایش تصویر فاصله محسوسی با رقبا دارد و گوگل در تولید ویدئو صدرنشین شده است. هم‌زمان، شرکت‌های چینی مانند مون‌شات، علی‌بابا، «Z.ai»، بایت‌دنس و مینی‌مکس نیز در برخی حوزه‌ها مستقیماً با بازیگران آمریکایی رقابت می‌کنند.

اهمیت این داده‌ها فقط به رتبه‌بندی مدل‌ها محدود نیست. «Arena.ai» مدل‌ها را در مقایسه‌های دوبه‌دو و بر اساس ترجیح کاربران واقعی ارزیابی می‌کند و امتیازها را با مدل آماری بردلی-تری محاسبه می‌کند. این پلتفرم علاوه بر امتیاز، «بازه رتبه» را نیز منتشر می‌کند تا میزان عدم قطعیت آماری مشخص باشد؛ بنابراین اختلاف چند امتیازی میان دو مدل الزاماً به معنای برتری قطعی یکی از آنها نیست. این پلتفرم در سال ۲۰۲۶ شاخص «factuality» را نیز برای بخش‌های «Text» و «Search» اضافه کرده تا صحت ادعاهای قابل بررسی را در کنار ترجیح کاربران بسنجد.

آنتروپیک صدرنشین متن و کدنویسی؛ مدل‌های چینی هم به خط مقدم رسیده‌اند

در «Text Arena»، داده‌های ۲۱ اوت ۲۰۲۶ که بر بیش از ۷.۹ میلیون رأی و ۳۹۴ مدل استوار است، برتری پررنگ خانواده «Claude» را نشان می‌دهد. «Claude Fable ۵» با امتیاز ۱۵۰۸ در رتبه نخست قرار دارد و «Claude Opus ۴.۶ High» و «Claude Opus ۴.۷ High» با امتیازهای ۱۵۰۴ و ۱۵۰۲ رتبه‌های دوم و سوم را در اختیار دارند. «Muse Spark ۱.۲ xHigh» متعلق به متا نیز با امتیاز ۱۴۹۸ در رتبه چهارم قرار گرفته است.

حضور چهار مدل آنتروپیک در میان شش رتبه نخست نشان می‌دهد برتری این شرکت به یک مدل منفرد محدود نیست و بیشتر به یک خانواده توانمندی تبدیل شده است. در نسخه انگلیسی جدول نیز «Claude Fable ۵» با امتیاز ۱۵۱۵ در صدر قرار دارد. در مقابل، بهترین مدل اوپن‌ای‌آی در داده ۱۹ اوت، «GPT-۵.۶ Sol xHigh» با امتیاز ۱۴۸۲ و رتبه ۱۸ جدول کلی متن بود.

این برتری در کدنویسی حتی پررنگ‌تر است. سه مدل «Claude Opus ۴.۶ High»، «Claude Opus ۴.۷ High» و «Claude Fable ۵» در بخش «Coding» هر سه امتیاز ۱۵۵۲ گرفته و در سه رتبه نخست قرار دارند. در همین جدول، «Kimi K۳ Max» متعلق به مون‌شات نیز با امتیاز ۱۵۴۴ در جمع مدعیان اصلی قرار گرفته است.

در «Code Arena WebDev» نیز قدرت بازیگران چینی بیشتر نمایان می‌شود. «Claude Opus ۵ Max» با امتیاز ۱۶۹۱ رتبه نخست را دارد، «Kimi K۳ Max» با ۱۶۷۴ دوم است و «Qwen ۳.۸ Max» از علی‌بابا با ۱۶۶۹ در رتبه سوم قرار دارد. «GPT-۵.۶ Sol xHigh» نیز با امتیاز ۱۶۱۹ رتبه هفتم را به دست آورده است.

این نتایج نشان می‌دهد مون‌شات و علی‌بابا دیگر صرفاً به‌عنوان عرضه‌کنندگان مدل‌های ارزان‌تر شناخته نمی‌شوند و در برخی وظایف توسعه نرم‌افزار مستقیماً به مرز عملکرد رسیده‌اند. حتی در طراحی مبتنی بر مرجع، «Kimi K۳ Max» با امتیاز ۱۷۲۱ بالاتر از «Claude Opus ۵ Max» قرار گرفته است.

اوپن‌ای‌آی در تصویر و گوگل در ویدئو؛ میدان رقابت چندقطبی‌تر می‌شود

در «Vision Arena» نیز «Claude Fable ۵» با امتیاز ۱۳۱۵ رتبه نخست را در اختیار دارد. «Qwen ۳.۸ Max» و «Claude Opus ۴.۷ High» هر دو با امتیاز ۱۳۰۱ در رتبه‌های بعدی قرار گرفته‌اند. این جدول بر بیش از ۱.۱۸ میلیون رأی و ۱۴۶ مدل استوار است.

در بخش مدل‌های باز، «Kimi K۲.۶» با امتیاز ۱۲۶۳ بهترین مدل دارای مجوز باز است و پس از آن «Gemma ۴ ۳۱B» گوگل، «Kimi K۲.۵ Thinking» و «Qwen ۳.۵» قرار دارند. فاصله مدل‌های باز با نمونه‌های اختصاصی همچنان وجود دارد، اما حضور پررنگ مدل‌های آسیایی نشان می‌دهد این شکاف در حال کاهش است.

در مقابل، حوزه تولید تصویر به یکی از نقاط قوت اصلی اوپن‌ای‌آی تبدیل شده است. در «Text-to-Image Arena»، مدل «GPT-Image-۲ Medium» با امتیاز ۱۳۸۱ صدرنشین است و «Microsoft MAI-Image-۲.۶ Preview» و «Grok Imagine Image ۲.۰» با امتیازهای ۱۳۳۶ و ۱۳۱۶ در رتبه‌های بعدی قرار دارند. فاصله ۴۵ امتیازی رتبه اول و دوم، برتری قابل‌توجه اوپن‌ای‌آی را نشان می‌دهد.

در ویرایش تصویر نیز همین الگو ادامه دارد. «GPT-Image-۲ Medium» با امتیاز ۱۴۶۳ در صدر جدول ۱۷ اوت قرار گرفته و «Grok Imagine Image ۲.۰» و «MAI-Image-۲.۶ Preview» در رتبه‌های دوم و سوم ایستاده‌اند. مجموع آرای بخش «Image Edit Arena» نیز از ۲۹ میلیون عبور کرده است.

در حوزه ویدئو اما شرایط متفاوت است. در داده‌های ۱۴ اوت «Text-to-Video Arena»، مدل «Gemini Omni Flash» گوگل با امتیاز ۱۵۱۲ رتبه نخست را دارد. «Flux ۳ Video» از Black Forest Labs و «Dreamina Seedance ۲.۰» بایت‌دنس در رتبه‌های دوم و سوم قرار گرفته‌اند. «Sora ۲ Pro» اوپن‌ای‌آی نیز با امتیاز ۱۳۶۴ در رتبه هشتم ایستاده است.

در ویرایش ویدئو، بایت‌دنس عملکرد بهتری دارد و «Dreamina Seedance ۲.۵» با امتیاز ۱۴۱۱ صدرنشین است. مینی‌مکس «H۳» و «Gemini Omni Flash» نیز رتبه‌های بعدی را در اختیار دارند. در نتیجه، برخلاف تصور یک بازار تک‌قطبی، زنجیره ارزش ویدئوی مولد میان چند شرکت تقسیم شده است.

در حوزه عامل‌های هوش مصنوعی نیز «Agent Arena» به جای صرفاً سنجش کیفیت پاسخ، موفقیت واقعی مدل در انجام وظایف، قابلیت هدایت، بازیابی پس از خطای ابزار و میزان توهم در استفاده از ابزارها را بررسی می‌کند.

داده‌های ۱۹ اوت و بیش از ۱.۹ میلیون سشن نشان می‌دهد «Claude Opus ۵ High» با روند اصلاح و بهبود حدود ۱۲.۴۷ درصد در رتبه نخست قرار دارد و نسخه «Max» و «Claude Fable ۵ High» پس از آن هستند. در سطح آزمایشگاه نیز آنتروپیک اول، مون‌شات دوم و اوپن‌ای‌آی سوم هستند. «Kimi K۳ Max» از نظر هزینه نیز قابل توجه است و هزینه میانه حدود ۰.۶۵ دلار برای هر وظیفه در برابر بیش از دو دلار برای مدل پرچم‌دار آنتروپیک گزارش شده است.

در «Search Arena» نیز «Claude Opus ۴.۶ Search» با امتیاز ۱۲۵۳ صدرنشین است و «GPT-۵.۵ Search» با امتیاز ۱۲۴۰ رتبه دوم را دارد. «Claude Fable ۵»، «Claude Opus ۴.۷» و «Ernie ۵.۱» بایدو نیز در رتبه‌های بعدی قرار گرفته‌اند.

اهمیت این بخش در این است که قدرت مدل دیگر تنها به توانایی زبانی آن وابسته نیست. دسترسی به اطلاعات، انتخاب منابع و صحت ادعاها نیز به بخش مستقلی از رقابت تبدیل شده‌اند؛ به‌ویژه آنکه پاسخ‌های «Search Arena» به‌طور متوسط نزدیک به ۱۰ ادعای واقعی دارند.

در مجموع، داده‌های «Arena.ai» تصویری از بازاری را نشان می‌دهند که دیگر نمی‌توان آن را با یک جدول واحد توضیح داد. آنتروپیک در متن، کدنویسی و عامل‌های هوشمند موقعیت قدرتمندی ساخته، اوپن‌ای‌آی در تولید و ویرایش تصویر برتری دارد و گوگل در تولید ویدئو پیشتاز است. در همین حال، شرکت‌های چینی از مون‌شات و علی‌بابا تا بایت‌دنس، مینی‌مکس، بایدو و دیگر بازیگران در حال نزدیک‌شدن به مرز عملکرد جهانی هستند.

به این ترتیب، رقابت هوش مصنوعی بیش از آنکه جنگ بر سر «بهترین مدل» باشد، به رقابتی چندلایه میان شرکت‌هایی تبدیل شده که هرکدام در بخش متفاوتی از این فناوری مزیت ایجاد کرده‌اند.

نمایش بیشتر

نوشته های مشابه

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *