برتري كلود در متن و اوپنايآي در تصوير
رقابت مدلهاي هوش مصنوعي در سال ۲۰۲۶ به مرحلهاي رسيده است كه پرسش سنتي «بهترين مدل كدام است؟» بخش بزرگي از معناي خود را از دست داده است.
رقابت مدلهاي هوش مصنوعي در سال ۲۰۲۶ به مرحلهاي رسيده است كه پرسش سنتي «بهترين مدل كدام است؟» بخش بزرگي از معناي خود را از دست داده است. به گزارش مهر؛ دادههاي تازه وبگاه «Arena.ai» تصويري چندقطبي از مرز فناوري ترسيم ميكنند. بر همين اساس، آنتروپيك در متن، كدنويسي و عاملهاي هوشمند موقعيتي برجسته دارد، اوپنايآي در توليد و ويرايش تصوير فاصله معناداري با رقبا ايجاد كرده، گوگل حوزه توليد ويدئو را در اختيار گرفته و بازيگران چيني مانند مونشات، عليبابا، «Z.ai»، بايتدنس و مينيمكس در بخشهايي از مرز عملكرد، مستقيماً با آزمايشگاههاي امريكايي رقابت ميكنند. اهميت بنچمارك «Arena.ai» از روش ارزيابي آن ناشي ميشود. رتبهبنديهاي اصلي اين پلتفرم بر مقايسههاي دوبهدوي پاسخ مدلها و ترجيح كاربران واقعي بنا شدهاند و امتيازها با مدل آماري مدل بردلي-تري محاسبه ميشوند. «Arena.ai» در كنار رتبه خام، «بازه رتبه» را نيز منتشر ميكند تا عدم قطعيت آماري آشكار بماند. بنابراين تفاوت چند امتيازي ميان دو مدل الزاماً به معناي برتري قطعي يكي بر ديگري نيست. «Arena.ai» در سال ۲۰۲۶ شاخص «factuality» را نيز به «Text» و «Search» افزود كه با استخراج و راستيآزمايي ادعاهاي قابل بررسي، صحت پاسخ را در كنار ترجيح انساني اندازهگيري ميكند.
سلطه آنتروپيك بر حوزه متن
در مهمترين جدول عمومي «Arena.ai»، يعني «Text Arena»، دادههاي ۲۱ اوت ۲۰۲۶ كه بر بيش از ۷.۹ ميليون رأي و ۳۹۴ مدل استوار است، موقعيت بسيار قدرتمندي براي آنتروپيك نشان ميدهد. بر همين اساس، «Claude Fable ۵» با امتياز ۱۵۰۸ در رتبه نخست قرار دارد و «Claude Opus ۴.۶ High» با ۱۵۰۴ و «Claude Opus ۴.۷ High» با ۱۵۰۲ جايگاههاي دوم و سوم را به خود اختصاص دادهاند. پس از آنها «Muse Spark ۱.۲ xHigh» متعلق به متا با امتياز ۱۴۹۸ قرار دارد. نكته تعيينكننده، تراكم خانواده «Claude» در صدر جدول است. چهار مدل آنتروپيك در ميان شش رتبه نخست حضور دارند. چنين آرايشي نشان ميدهد برتري آنتروپيك در حال حاضر بيشتر به يك «خانواده توانمندي» شباهت دارد تا موفقيت يك مدل منفرد. همين الگو در زبان انگليسي نيز تكرار ميشود و «Claude Fable ۵» با امتياز ۱۵۱۵ صدرنشين است. در مقابل، بهترين مدل اوپنايآي در داده ۱۹ اوت، «GPT-۵.۶ Sol xHigh» با امتياز ۱۴۸۲ در رتبه ۱۸ جدول كلي متن قرار گرفته بود. فاصله رتبه، همزمان با همپوشاني بعضي بازههاي اطمينان، نشان ميدهد كه ترجيح كاربران «Arena.ai» در تعاملات عمومي متني اكنون به شكل محسوسي به سمت «Claude» متمايل شده است.
پيشتازي Claude
و مدلهاي چيني در حوزه كدنويسي
برتري آنتروپيك در حوزه كدنويسي حتي واضحتر از بخش توليد متن ديده ميشود. بر همين اساس، در زيرشاخه «Coding»، سه مدل «Claude Opus ۴.۶ High» و «Claude Opus ۴.۷ High» و «Claude Fable ۵» هر سه امتياز ۱۵۵۲ كسب كردهاند و رتبههاي نخست تا سوم را در اختيار دارند. همچنين، مدل «Kimi K۳ Max»، متعلق به شركت مونشات نيز با امتياز ۱۵۴۴ در ميان مدعيان اصلي قرار گرفته است. تصوير كلي در بخش «Code Arena WebDev» نيز مشابه است، هرچند قدرت بازيگران آسيايي در اين بخش آشكارتر ميشود. بر پايه دادههاي ۲۱ اوت و بيش از ۶۰۳ هزار رأي، «Claude Opus ۵ Max» با امتياز ۱۶۹۱ در جايگاه نخست، «Kimi K۳ Max» با ۱۶۷۴ در رتبه دوم و «Qwen ۳.۸ Max» متعلق به عليبابا با ۱۶۶۹ در رتبه سوم قرار دارند. علاوه بر اين، «GPT-۵.۶ Sol xHigh» نيز با سازوكار كدنويسي اختصاصي خود رتبه هفتم و امتياز ۱۶۱۹ را به دست آورده است. اين بخش يكي از مهمترين نشانههاي تغيير ساختار صنعت است. بر همين مبنا، به نظر ميرسد مونشات و عليبابا ديگر در سطح مدلهاي «كمهزينه جايگزين» ظاهر نميشوند و در برخي وظايف توسعه نرمافزار مستقيماً در مرز عملكرد قرار گرفتهاند. در طراحي مبتني بر مرجع نيز «Kimi K۳ Max» با امتياز ۱۷۲۱ حتي بالاتر از «Claude Opus ۵ Max» ايستاده است.
هوش چندوجهي
مدلهاي باز در تعقيب Claude
در بخش «Vision Arena» كه توانايي مدلها براي تحليل و استدلال روي وروديهاي بصري را ميسنجد، مدل «Claude Fable ۵» با امتياز ۱۳۱۵ رتبه نخست را دارد. مدلهاي «Qwen ۳.۸ Max» و «Claude Opus ۴.۷ High» هر دو با امتياز ۱۳۰۱ در رتبههاي بعدي قرار گرفتهاند. اين جدول بر بيش از ۱.۱۸ ميليون رأي و ۱۴۶ مدل استوار است. بخش متنباز اين حوزه نيز اهميت راهبردي دارد. در اين بخش، «Kimi K۲.۶» با امتياز ۱۲۶۳ بهترين مدل داراي مجوز باز در «Vision Arena» است و پس از آن «Gemma ۴ ۳۱B» گوگل، «Kimi K۲.۵ Thinking» و «Qwen ۳.۵» قرار دارند. فاصله موجود با مدلهاي اختصاصي همچنان محسوس است، اما تراكم مدلهاي متن باز آسيايي در اين رده نشان ميدهد شكاف قابليت بهتدريج در حال كاهش است.
حوزه توليد تصوير قلمرو سلطه مدل اوپنايآي
بزرگترين برتري اختصاصي يك شركت را بايد در حوزه تصوير جستوجو كرد. بر همين اساس، در بخش «Text-to-Image Arena»، مدل «GPT-Image-۲ Medium» با امتياز ۱۳۸۱ در رتبه نخست قرار دارد و «Microsoft MAI-Image-۲.۶ Preview» با ۱۳۳۶ و «Grok Imagine Image ۲.۰» با ۱۳۱۶ در رتبههاي بعدي ايستادهاند. فاصله ۴۵ امتيازي ميان رتبه اول و دوم، همراه با بازه اطمينان محدود «GPT-Image-۲»، برتري نسبتاً قدرتمند شركت اوپنايآي را نشان ميدهد. اين رتبهبندي بر نزديك به ۵.۹۲ ميليون رأي بنا شده است. در ادامه، مزيت اوپنايآي در ويرايش تصوير برجستهتر ميشود. مدل «GPT-Image-۲ Medium» با امتياز ۱۴۶۳ و حدود ۱۹۹ هزار رأي در صدر جدول ۱۷ اوت قرار دارد. «Grok Imagine Image ۲.۰» با ۱۴۳۹ و «MAI-Image-۲.۶ Preview» با ۱۴۲۰ در جايگاههاي دوم و سوم هستند. حجم كل رأيهاي بخش «Image Edit Arena» نيز از ۲۹ ميليون عبور كرده است كه اين حوزه را به يكي از بزرگترين مجموعههاي ترجيح انساني «Arena.ai» تبديل ميكند. بر همين مبنا، چنين به نظر ميرسد كه اوپنايآي در رتبهبندي عمومي متن فعلاً صدر را به آنتروپيك واگذار كرده و در لايه توليد و ويرايش تصوير مزيت تخصصي بسيار قدرتمندي ساخته است. معماري رقابت از همين نقطه چندبعدي ميشود. جايگاه يك شركت را ديگر نميتوان با يك مدل زباني واحد اندازه گرفت.
گوگل در صدر حوزه توليد ويدئو
بررسي دادههاي «Arena.ai» نشان ميدهد كه بازار توليد ويدئو ساختار متفاوتي دارد. در دادههاي ۱۴ اوت بخش «Text-to-Video Arena»، مدل «Gemini Omni Flash» گوگل با امتياز ۱۵۱۲ صدرنشين است. همچنين، «Flux ۳ Video» متعلق به «Black Forest Labs» با ۱۴۹۴ و «Dreamina Seedance ۲.۰» از بايتدنس با ۱۴۸۲ در رتبههاي دوم و سوم قرار دارند. مدل «Muse Video»، متعلق به متا و مينيمكس «H۳» نيز رتبههاي بعدي را اشغال كردهاند، در حالي كه «Sora ۲ Pro» متعلق به اوپنايآي با امتياز ۱۳۶۴ در رتبه هشتم قرار گرفته است. از سوي ديگر، جدول ويرايش ويدئو «Arena.ai» تصوير ديگري ارايه ميدهد. بر همين اساس، مدل «Dreamina Seedance ۲.۵» متعلق به بايتدنس با امتياز ۱۴۱۱ در صدر قرار دارد و مينيمكس «H۳» با ۱۳۸۸ و «Gemini Omni Flash» با ۱۳۵۸ در تعقيب آن هستند. بنابراين زنجيره ارزش ويدئوي مولد ميان چند بازيگر توزيع شده و هيچ آزمايشگاهي بر توليد و ويرايش بهطور همزمان سلطه ندارد.
عصر عاملهاي هوش مصنوعي
كيفيت مدلها در انجام كار
به عقيده كارشناسان، مهمترين تحول نسل جديد ارزيابي شايد «Agent Arena» باشد. در اين بخش، «Arena.ai» به جاي رأي دوبهدو از روش «causal tracing» استفاده ميكند و عملكرد عامل را بر مبناي موفقيت واقعي در انجام وظيفه، قابليت هدايت، بازيابي پس از خطاي ابزار و توهم در استفاده از ابزارها ميسنجد. هدف، اندازهگيري سهم مدل هماهنگكننده در يك سامانه چندجزئي است. در دادههاي ۱۹ اوت و بيش از ۱.۹ ميليون سشن پاسخ از مدلهاي مختلف هوش مصنوعي، مدل «Claude Opus ۵ High» رتبه نخست را با روند اصلاح و بهبود حدود ۱۲.۴۷ درصد در اختيار دارد و نسخه «Max» و «Claude Fable ۵ High» پس از آن قرار گرفتهاند. اگر رتبهبندي در سطح آزمايشگاه بررسي شود، آنتروپيك نخست، مونشات با «Kimi K۳ Max» دوم و اوپنايآي با «GPT-۵.۶ Sol xHigh» سوم است. همچنين، مدل «Kimi» در اين ميان از منظر اقتصاد استفاده نيز جالب توجه است و هزينه ميانه آن حدود ۰.۶۵ دلار براي هر وظيفه گزارش شده، در حالي كه هزينه مدل پرچمدار آنتروپيك بيش از دو دلار براي هر وظيفه است.
جستوجوي وب؛ اهميت «دسترسي به
اطلاعات» در كنار قدرت مدل
در بخش «Search Arena»، مدل «Claude Opus ۴.۶ Search» با امتياز ۱۲۵۳ رتبه نخست را دارد و «GPT-۵.۵ Search» با ۱۲۴۰ دوم است. علاوه بر اين، مدل «Claude Fable ۵» و «Claude Opus ۴.۷» و «Ernie ۵.۱» از شركت بايدو جايگاههاي بعدي را در اختيار دارند. اين جدول بر حدود ۹۴۰ هزار رأي استوار است و مشخصاً مدلهاي داراي جستوجوي وب يكپارچه را ارزيابي ميكند. اهميت اين بخش فراتر از رتبهبندي است. «Arena.ai» گزارش كرده كه پاسخهاي بخش «Search Arena» بهطور متوسط نزديك به ۱۰ ادعاي واقعي دارند و وجود ادعاهاي قابل بررسي در ۸۸ درصد مقايسههاي اين حوزه مشاهده شده است. از همين روي، كيفيت بازيابي، انتخاب منبع و صحت ادعا به مولفهاي مستقل از توانايي زباني مدل تبديل شده است. مرور دادههاي «Arena.ai» در ماه اوت ۲۰۲۶ يك نتيجه بنيادي دارند و بر همين اساس ميتوان چنين برآورد كرد كه مرز هوش مصنوعي ديگر يك خط واحد نيست. آنتروپيك قدرتمندترين موقعيت را در متن، كدنويسي، توسعه وب، بينايي و عاملهاي هوشمند ساخته است. اوپنايآي در توليد و ويرايش تصوير برتري كمسابقهاي دارد و در عاملهاي كدنويسي همچنان در ميان مدعيان حضور دارد. گوگل صدر توليد ويدئو را گرفته است. متا در متن و تصوير دوباره به حلقه مدعيان بازگشته و شركتهاي چيني از مونشات و عليبابا تا بايتدنس، «Z.ai»، مينيمكس، تنسنت و بايدو تقريباً در تمام حوزهها حضور رقابتي پيدا كردهاند.