
دادههای تازه وبگاه «Arena.ai» نشان میدهد رقابت در صنعت هوش مصنوعی دیگر حول یک مدل یا یک شرکت واحد نمیچرخد. هر آزمایشگاه در بخشی از مرز فناوری جایگاه متفاوتی پیدا کرده است؛ آنتروپیک در متن و کدنویسی پیشتاز است، اوپنایآی در تولید و ویرایش تصویر فاصله محسوسی با رقبا دارد و گوگل در تولید ویدئو صدرنشین شده است. همزمان، شرکتهای چینی مانند مونشات، علیبابا، «Z.ai»، بایتدنس و مینیمکس نیز در برخی حوزهها مستقیماً با بازیگران آمریکایی رقابت میکنند.
اهمیت این دادهها فقط به رتبهبندی مدلها محدود نیست. «Arena.ai» مدلها را در مقایسههای دوبهدو و بر اساس ترجیح کاربران واقعی ارزیابی میکند و امتیازها را با مدل آماری بردلی-تری محاسبه میکند. این پلتفرم علاوه بر امتیاز، «بازه رتبه» را نیز منتشر میکند تا میزان عدم قطعیت آماری مشخص باشد؛ بنابراین اختلاف چند امتیازی میان دو مدل الزاماً به معنای برتری قطعی یکی از آنها نیست. این پلتفرم در سال ۲۰۲۶ شاخص «factuality» را نیز برای بخشهای «Text» و «Search» اضافه کرده تا صحت ادعاهای قابل بررسی را در کنار ترجیح کاربران بسنجد.
آنتروپیک صدرنشین متن و کدنویسی؛ مدلهای چینی هم به خط مقدم رسیدهاند
در «Text Arena»، دادههای ۲۱ اوت ۲۰۲۶ که بر بیش از ۷.۹ میلیون رأی و ۳۹۴ مدل استوار است، برتری پررنگ خانواده «Claude» را نشان میدهد. «Claude Fable ۵» با امتیاز ۱۵۰۸ در رتبه نخست قرار دارد و «Claude Opus ۴.۶ High» و «Claude Opus ۴.۷ High» با امتیازهای ۱۵۰۴ و ۱۵۰۲ رتبههای دوم و سوم را در اختیار دارند. «Muse Spark ۱.۲ xHigh» متعلق به متا نیز با امتیاز ۱۴۹۸ در رتبه چهارم قرار گرفته است.
حضور چهار مدل آنتروپیک در میان شش رتبه نخست نشان میدهد برتری این شرکت به یک مدل منفرد محدود نیست و بیشتر به یک خانواده توانمندی تبدیل شده است. در نسخه انگلیسی جدول نیز «Claude Fable ۵» با امتیاز ۱۵۱۵ در صدر قرار دارد. در مقابل، بهترین مدل اوپنایآی در داده ۱۹ اوت، «GPT-۵.۶ Sol xHigh» با امتیاز ۱۴۸۲ و رتبه ۱۸ جدول کلی متن بود.
این برتری در کدنویسی حتی پررنگتر است. سه مدل «Claude Opus ۴.۶ High»، «Claude Opus ۴.۷ High» و «Claude Fable ۵» در بخش «Coding» هر سه امتیاز ۱۵۵۲ گرفته و در سه رتبه نخست قرار دارند. در همین جدول، «Kimi K۳ Max» متعلق به مونشات نیز با امتیاز ۱۵۴۴ در جمع مدعیان اصلی قرار گرفته است.
در «Code Arena WebDev» نیز قدرت بازیگران چینی بیشتر نمایان میشود. «Claude Opus ۵ Max» با امتیاز ۱۶۹۱ رتبه نخست را دارد، «Kimi K۳ Max» با ۱۶۷۴ دوم است و «Qwen ۳.۸ Max» از علیبابا با ۱۶۶۹ در رتبه سوم قرار دارد. «GPT-۵.۶ Sol xHigh» نیز با امتیاز ۱۶۱۹ رتبه هفتم را به دست آورده است.
این نتایج نشان میدهد مونشات و علیبابا دیگر صرفاً بهعنوان عرضهکنندگان مدلهای ارزانتر شناخته نمیشوند و در برخی وظایف توسعه نرمافزار مستقیماً به مرز عملکرد رسیدهاند. حتی در طراحی مبتنی بر مرجع، «Kimi K۳ Max» با امتیاز ۱۷۲۱ بالاتر از «Claude Opus ۵ Max» قرار گرفته است.
اوپنایآی در تصویر و گوگل در ویدئو؛ میدان رقابت چندقطبیتر میشود
در «Vision Arena» نیز «Claude Fable ۵» با امتیاز ۱۳۱۵ رتبه نخست را در اختیار دارد. «Qwen ۳.۸ Max» و «Claude Opus ۴.۷ High» هر دو با امتیاز ۱۳۰۱ در رتبههای بعدی قرار گرفتهاند. این جدول بر بیش از ۱.۱۸ میلیون رأی و ۱۴۶ مدل استوار است.
در بخش مدلهای باز، «Kimi K۲.۶» با امتیاز ۱۲۶۳ بهترین مدل دارای مجوز باز است و پس از آن «Gemma ۴ ۳۱B» گوگل، «Kimi K۲.۵ Thinking» و «Qwen ۳.۵» قرار دارند. فاصله مدلهای باز با نمونههای اختصاصی همچنان وجود دارد، اما حضور پررنگ مدلهای آسیایی نشان میدهد این شکاف در حال کاهش است.
در مقابل، حوزه تولید تصویر به یکی از نقاط قوت اصلی اوپنایآی تبدیل شده است. در «Text-to-Image Arena»، مدل «GPT-Image-۲ Medium» با امتیاز ۱۳۸۱ صدرنشین است و «Microsoft MAI-Image-۲.۶ Preview» و «Grok Imagine Image ۲.۰» با امتیازهای ۱۳۳۶ و ۱۳۱۶ در رتبههای بعدی قرار دارند. فاصله ۴۵ امتیازی رتبه اول و دوم، برتری قابلتوجه اوپنایآی را نشان میدهد.
در ویرایش تصویر نیز همین الگو ادامه دارد. «GPT-Image-۲ Medium» با امتیاز ۱۴۶۳ در صدر جدول ۱۷ اوت قرار گرفته و «Grok Imagine Image ۲.۰» و «MAI-Image-۲.۶ Preview» در رتبههای دوم و سوم ایستادهاند. مجموع آرای بخش «Image Edit Arena» نیز از ۲۹ میلیون عبور کرده است.
در حوزه ویدئو اما شرایط متفاوت است. در دادههای ۱۴ اوت «Text-to-Video Arena»، مدل «Gemini Omni Flash» گوگل با امتیاز ۱۵۱۲ رتبه نخست را دارد. «Flux ۳ Video» از Black Forest Labs و «Dreamina Seedance ۲.۰» بایتدنس در رتبههای دوم و سوم قرار گرفتهاند. «Sora ۲ Pro» اوپنایآی نیز با امتیاز ۱۳۶۴ در رتبه هشتم ایستاده است.
در ویرایش ویدئو، بایتدنس عملکرد بهتری دارد و «Dreamina Seedance ۲.۵» با امتیاز ۱۴۱۱ صدرنشین است. مینیمکس «H۳» و «Gemini Omni Flash» نیز رتبههای بعدی را در اختیار دارند. در نتیجه، برخلاف تصور یک بازار تکقطبی، زنجیره ارزش ویدئوی مولد میان چند شرکت تقسیم شده است.
در حوزه عاملهای هوش مصنوعی نیز «Agent Arena» به جای صرفاً سنجش کیفیت پاسخ، موفقیت واقعی مدل در انجام وظایف، قابلیت هدایت، بازیابی پس از خطای ابزار و میزان توهم در استفاده از ابزارها را بررسی میکند.
دادههای ۱۹ اوت و بیش از ۱.۹ میلیون سشن نشان میدهد «Claude Opus ۵ High» با روند اصلاح و بهبود حدود ۱۲.۴۷ درصد در رتبه نخست قرار دارد و نسخه «Max» و «Claude Fable ۵ High» پس از آن هستند. در سطح آزمایشگاه نیز آنتروپیک اول، مونشات دوم و اوپنایآی سوم هستند. «Kimi K۳ Max» از نظر هزینه نیز قابل توجه است و هزینه میانه حدود ۰.۶۵ دلار برای هر وظیفه در برابر بیش از دو دلار برای مدل پرچمدار آنتروپیک گزارش شده است.
در «Search Arena» نیز «Claude Opus ۴.۶ Search» با امتیاز ۱۲۵۳ صدرنشین است و «GPT-۵.۵ Search» با امتیاز ۱۲۴۰ رتبه دوم را دارد. «Claude Fable ۵»، «Claude Opus ۴.۷» و «Ernie ۵.۱» بایدو نیز در رتبههای بعدی قرار گرفتهاند.
اهمیت این بخش در این است که قدرت مدل دیگر تنها به توانایی زبانی آن وابسته نیست. دسترسی به اطلاعات، انتخاب منابع و صحت ادعاها نیز به بخش مستقلی از رقابت تبدیل شدهاند؛ بهویژه آنکه پاسخهای «Search Arena» بهطور متوسط نزدیک به ۱۰ ادعای واقعی دارند.
در مجموع، دادههای «Arena.ai» تصویری از بازاری را نشان میدهند که دیگر نمیتوان آن را با یک جدول واحد توضیح داد. آنتروپیک در متن، کدنویسی و عاملهای هوشمند موقعیت قدرتمندی ساخته، اوپنایآی در تولید و ویرایش تصویر برتری دارد و گوگل در تولید ویدئو پیشتاز است. در همین حال، شرکتهای چینی از مونشات و علیبابا تا بایتدنس، مینیمکس، بایدو و دیگر بازیگران در حال نزدیکشدن به مرز عملکرد جهانی هستند.
به این ترتیب، رقابت هوش مصنوعی بیش از آنکه جنگ بر سر «بهترین مدل» باشد، به رقابتی چندلایه میان شرکتهایی تبدیل شده که هرکدام در بخش متفاوتی از این فناوری مزیت ایجاد کردهاند.



