The daily briefing
Only benchmark updates land as Gemini 3.6 Flash edges up on leaderboards
Tuesday, July 28, 2026 · what moved in the AI release cycle in those 24 hours.
One click creates your free account (or signs you into an existing one) and turns on alerts for the Daily Briefing. There's no password to set, and you can unsubscribe any time.
No new releases or launch news surfaced today, leaving benchmark trackers to carry the day. Gemini 3.6 Flash continued to post solid numbers across arena, coding, and multimodal evaluations, while Kimi K3 recorded a high multimodal grounding score. Otherwise, the release lull that has held since Claude Opus 5's launch continues.
An AI summary of the day’s tracked items. It may contain errors; every item below links to its source.
New benchmark readings
- Amazon Nova 2 Pro GDP.pdf: 2 · Epoch AI
- Gemini 3.5 Flash-Lite LM Arena: 1459.5143846248438 · LM Arena
- Gemini 3.5 Flash-Lite Coding: 52.18 · BenchLM.ai
- Gemini 3.5 Flash-Lite MultimodalGrounded: 64.1 · BenchLM.ai
- Gemini 3.5 Flash-Lite Knowledge: 61.8 · BenchLM.ai
- Gemini 3.6 Flash LM Arena: 1482.004576476782 · LM Arena
- Gemini 3.6 Flash Coding: 63.97 · BenchLM.ai
- Gemini 3.6 Flash Knowledge: 70.9 · BenchLM.ai
- Gemini 3.6 Flash MultimodalGrounded: 75.1 · BenchLM.ai
- Kimi K3 MultimodalGrounded: 89.6 · BenchLM.ai
- Kimi K3 Coding: 77.32 · BenchLM.ai
- Kimi K3 Agentic: 66.49 · BenchLM.ai
- Kimi K3 Knowledge: 84.8 · BenchLM.ai
- Amazon Nova Humanity's Last Exam: 3.6 · Epoch AI
- Amazon Nova LM Arena: 1290.0648584319706 · LM Arena
- Amazon Nova 2 Lite LM Arena: 1336.5695655109466 · LM Arena
- Claude 3 Haiku LM Arena: 1261.0280059615711 · LM Arena
- Claude 3 Opus LM Arena: 1321.6142881414794 · LM Arena
- Claude 3 Sonnet LM Arena: 1280.7522961056611 · LM Arena
- Claude 3.5 Haiku LM Arena: 1323.900059158991 · LM Arena
- Claude 3.5 Sonnet Humanity's Last Exam: 4.1 · Epoch AI
- Claude 3.5 Sonnet LM Arena: 1342.6212373401077 · LM Arena
- Claude 3.7 Sonnet Humanity's Last Exam: 8 · Epoch AI
- Claude 3.7 Sonnet LM Arena: 1371.5551044741073 · LM Arena
- Claude Fable 5 LM Arena: 1507.6203803915419 · LM Arena
- Claude Fable 5 Coding: 79.75 · BenchLM.ai
- Claude Fable 5 Agentic: 65.29 · BenchLM.ai
- Claude Fable 5 GDP.pdf: 30 · Epoch AI
- Claude Fable 5 Knowledge: 71.2 · BenchLM.ai
- Claude Haiku 4.5 ExploitBench: 14 · Epoch AI
- Claude Haiku 4.5 LM Arena: 1412.4075826259946 · LM Arena
- Claude Haiku 4.5 Agentic: 49.6 · BenchLM.ai
- Claude Mythos 5 Coding: 80 · BenchLM.ai
- Claude Mythos 5 Agentic: 66.31 · BenchLM.ai
- Claude Mythos 5 ExploitBench: 69 · Epoch AI
- Claude Opus 4 Humanity's Last Exam: 6.7 · Epoch AI
- Claude Opus 4 LM Arena: 1412.7206143198368 · LM Arena
- Claude Opus 4.1 Humanity's Last Exam: 7.9 · Epoch AI
- Claude Opus 4.1 LM Arena: 1447.045073475655 · LM Arena
- Claude Opus 4.5 Coding: 61.21 · BenchLM.ai
- Claude Opus 4.5 Knowledge: 60.9 · BenchLM.ai
- Claude Opus 4.5 Math: 58.6 · BenchLM.ai
- Claude Opus 4.5 MultimodalGrounded: 29.4 · BenchLM.ai
- Claude Opus 4.5 Multilingual: 82.9 · BenchLM.ai
- Claude Opus 4.5 Humanity's Last Exam: 14.2 · Epoch AI
- Claude Opus 4.5 LM Arena: 1468.76628100984 · LM Arena
- Claude Opus 4.5 InstructionFollowing: 56.4 · BenchLM.ai
- Claude Opus 4.6 LM Arena: 1497.2349733277483 · LM Arena
- Claude Opus 4.6 Coding: 61.32 · BenchLM.ai
- Claude Opus 4.6 Agentic: 55.99 · BenchLM.ai
- Claude Opus 4.6 Knowledge: 82.6 · BenchLM.ai
- Claude Opus 4.6 Humanity's Last Exam: 19 · Epoch AI
- Claude Opus 4.7 LM Arena: 1493.4422063592028 · LM Arena
- Claude Opus 4.7 Coding: 64.1 · BenchLM.ai
- Claude Opus 4.7 Agentic: 54.86 · BenchLM.ai
- Claude Opus 4.7 Knowledge: 62.8 · BenchLM.ai
- Claude Opus 4.7 Humanity's Last Exam: 36.2 · Epoch AI
- Claude Opus 4.7 ExploitBench: 28 · Epoch AI
- Claude Opus 4.7 GDP.pdf: 21 · Epoch AI
- Claude Opus 4.7 MultimodalGrounded: 50.5 · BenchLM.ai
- Claude Opus 4.8 LM Arena: 1474.3681293943873 · LM Arena
- Claude Opus 4.8 Coding: 69.79 · BenchLM.ai
- Claude Opus 4.8 Agentic: 62.85 · BenchLM.ai
- Claude Opus 4.8 Knowledge: 87.6 · BenchLM.ai
- Claude Opus 4.8 MultimodalGrounded: 90.2 · BenchLM.ai
- Claude Opus 4.8 GDP.pdf: 23 · Epoch AI
- Claude Opus 4.8 Math: 66.9 · BenchLM.ai
- Claude Opus 5 Coding: 77.77 · BenchLM.ai
- Claude Opus 5 Agentic: 71.71 · BenchLM.ai
- Claude Opus 5 Knowledge: 93.5 · BenchLM.ai
- Claude Opus 5 MultimodalGrounded: 89.1 · BenchLM.ai
- Claude Sonnet 4 Humanity's Last Exam: 5.5 · Epoch AI
- Claude Sonnet 4 LM Arena: 1389.207370915054 · LM Arena
- Claude Sonnet 4.5 Humanity's Last Exam: 7.5 · Epoch AI
- Claude Sonnet 4.5 LM Arena: 1454.9446300171744 · LM Arena
- Claude Sonnet 4.6 LM Arena: 1472.0305302584916 · LM Arena
- Claude Sonnet 4.6 Coding: 58.37 · BenchLM.ai
- Claude Sonnet 4.6 Agentic: 51.1 · BenchLM.ai
- Claude Sonnet 4.6 Knowledge: 76.9 · BenchLM.ai
- Claude Sonnet 4.6 ExploitBench: 24 · Epoch AI
- Claude Sonnet 5 Coding: 67.68 · BenchLM.ai
- Claude Sonnet 5 Agentic: 59.19 · BenchLM.ai
- Claude Sonnet 5 Knowledge: 85.9 · BenchLM.ai
- Claude Sonnet 5 MultimodalGrounded: 79.9 · BenchLM.ai
- Command A LM Arena: 1354.0016059573231 · LM Arena
- Command A MultimodalGrounded: 8 · BenchLM.ai
- Command R LM Arena: 1226.282017941045 · LM Arena
- Command R+ LM Arena: 1261.263111801816 · LM Arena
- DeepSeek LLM LM Arena: 1184.1441528982295 · LM Arena
- DeepSeek V4 Flash Coding: 52.57 · BenchLM.ai
- DeepSeek V4 Flash Knowledge: 60.1 · BenchLM.ai
- DeepSeek V4 Flash LM Arena: 1435.8113541983098 · LM Arena
- DeepSeek V4 Pro Coding: 53.48 · BenchLM.ai
- DeepSeek V4 Pro Knowledge: 64.3 · BenchLM.ai
- DeepSeek V4 Pro SWE-Bench Pro: 55.4 · Hugging Faceself reported
- DeepSeek V4 Pro LM Arena: 1455.053614601571 · LM Arena
- DeepSeek V4 Pro Agentic: 52.18 · BenchLM.ai
- DeepSeek-R1 LM Arena: 1398.1311334069815 · LM Arena
- DeepSeek-V2.5 LM Arena: 1307.1451197115507 · LM Arena
- DeepSeek-V3 LM Arena: 1358.5089542025596 · LM Arena
- DeepSeek-V3.1 LM Arena: 1416.9071391149637 · LM Arena
- DeepSeek-V3.2-Exp LM Arena: 1422.8363254848086 · LM Arena
- ERNIE 5.1 LM Arena: 1467.7904149069632 · LM Arena
- Gemini 1.0 LM Arena: 1222.68733982766 · LM Arena
- Gemini 1.5 Flash LM Arena: 1309.244439979854 · LM Arena
- Gemini 1.5 Pro Humanity's Last Exam: 4.6 · Epoch AI
- Gemini 1.5 Pro LM Arena: 1351.1329569340478 · LM Arena
- Gemini 2.0 Flash Humanity's Last Exam: 6.6 · Epoch AI
- Gemini 2.0 Flash LM Arena: 1360.3046483849644 · LM Arena
- Gemini 2.5 Flash Humanity's Last Exam: 11 · Epoch AI
- Gemini 2.5 Flash LM Arena: 1410.2644337020415 · LM Arena
- Gemini 2.5 Pro Humanity's Last Exam: 17.8 · Epoch AI
- Gemini 2.5 Pro LM Arena: 1445.6087137261543 · LM Arena
- Gemini 3 Pro Coding: 61.47 · BenchLM.ai
- Gemini 3 Pro Agentic: 58.19 · BenchLM.ai
- Gemini 3 Pro Knowledge: 69.3 · BenchLM.ai
- Gemini 3 Pro MultimodalGrounded: 74.2 · BenchLM.ai
- Gemini 3 Pro Humanity's Last Exam: 37.5 · Epoch AI
- Gemini 3 Pro LM Arena: 1485.647178425958 · LM Arena
- Gemini 3.1 Pro Knowledge: 66.8 · BenchLM.ai
- Gemini 3.1 Pro MultimodalGrounded: 81.9 · BenchLM.ai
- Gemini 3.1 Pro GDP.pdf: 17 · Epoch AI
- Gemini 3.1 Pro Humanity's Last Exam: 46.4 · Epoch AI
- Gemini 3.1 Pro ExploitBench: 26 · Epoch AI
- Gemini 3.1 Pro LM Arena: 1485.9295993473456 · LM Arena
- Gemini 3.5 Flash Coding: 61.15 · BenchLM.ai
- Gemini 3.5 Flash Reasoning: 72.8 · BenchLM.ai
- Gemini 3.5 Flash MultimodalGrounded: 85 · BenchLM.ai
- Gemini 3.5 Flash InstructionFollowing: 82.4 · BenchLM.ai
- Gemini 3.5 Flash GDP.pdf: 14 · Epoch AI
- Gemini 3.5 Flash Knowledge: 62.8 · BenchLM.ai
- GLM-4 LM Arena: 1273.095031329252 · LM Arena
- GLM-4.5 Humanity's Last Exam: 8.1 · Epoch AI
- GLM-4.5 LM Arena: 1372.6787328863488 · LM Arena
- GLM-4.6 SWE-Bench Pro: 9.7 · Hugging Faceself reported
- GLM-4.6 LM Arena: 1425.0278606844945 · LM Arena
- GLM-4.7 Agentic: 51.19 · BenchLM.ai
- GLM-4.7 LM Arena: 1442.1256751771039 · LM Arena
- GLM-5 Coding: 58.28 · BenchLM.ai
- GLM-5 Agentic: 54.16 · BenchLM.ai
- GLM-5 Knowledge: 77.9 · BenchLM.ai
- GLM-5 Math: 57.2 · BenchLM.ai
- GLM-5 Multilingual: 48.7 · BenchLM.ai
- GLM-5 InstructionFollowing: 86.5 · BenchLM.ai
- GLM-5 LM Arena: 1456.759425034792 · LM Arena
- GLM-5.1 Coding: 55.69 · BenchLM.ai
- GLM-5.1 Math: 64.6 · BenchLM.ai
- GLM-5.1 ExploitBench: 18 · Epoch AI
- GLM-5.1 SWE-Bench Pro: 58.4 · Hugging Faceself reported
- GLM-5.1 LM Arena: 1468.6650039612246 · LM Arena
- GLM-5.1 Agentic: 49.35 · BenchLM.ai
- GLM-5.2 LM Arena: 1469.3943633911508 · LM Arena
- GLM-5.2 SWE-Bench Pro: 62.1 · Hugging Faceself reported
- GLM-5.2 Coding: 64.32 · BenchLM.ai
- GLM-5.2 Agentic: 56.75 · BenchLM.ai
- GLM-5.2 Knowledge: 82.4 · BenchLM.ai
- GPT-3.5 Turbo LM Arena: 1224.518321654994 · LM Arena
- GPT-4 LM Arena: 1275.2782058458238 · LM Arena
- GPT-4 Turbo LM Arena: 1312.4527135176309 · LM Arena
- GPT-4.1 InstructionFollowing: 59.1 · BenchLM.ai
- GPT-4.1 Humanity's Last Exam: 5.4 · Epoch AI
- GPT-4.1 LM Arena: 1413.6973041909473 · LM Arena
- GPT-4.5 Humanity's Last Exam: 5.4 · Epoch AI
- GPT-4.5 LM Arena: 1444.691452721409 · LM Arena
- GPT-4o Humanity's Last Exam: 2.7 · Epoch AI
- GPT-4o LM Arena: 1335.2149779526299 · LM Arena
- GPT-4o mini LM Arena: 1317.6949259731007 · LM Arena
- GPT-5 Coding: 52.46 · BenchLM.ai
- GPT-5 Agentic: 49.13 · BenchLM.ai
- GPT-5 Humanity's Last Exam: 19.4 · Epoch AI
- GPT-5.1 Humanity's Last Exam: 6.8 · Epoch AI
- GPT-5.1 LM Arena: 1438.6708018194945 · LM Arena
- GPT-5.2 Coding: 53.45 · BenchLM.ai
- GPT-5.2 Knowledge: 80.8 · BenchLM.ai
- GPT-5.2 MultimodalGrounded: 70.3 · BenchLM.ai
- GPT-5.2 Humanity's Last Exam: 27.8 · Epoch AI
- GPT-5.2 LM Arena: 1435.3371704241817 · LM Arena
- GPT-5.4 Coding: 58.39 · BenchLM.ai
- GPT-5.4 Agentic: 56.21 · BenchLM.ai
- GPT-5.4 Knowledge: 77.3 · BenchLM.ai
- GPT-5.4 MultimodalGrounded: 68.5 · BenchLM.ai
- GPT-5.4 Humanity's Last Exam: 36.2 · Epoch AI
- GPT-5.4 LM Arena: 1465.2401120092745 · LM Arena
- GPT-5.5 Agentic: 59.54 · BenchLM.ai
- GPT-5.5 GDP.pdf: 25 · Epoch AI
- GPT-5.5 LM Arena: 1475.96389478629 · LM Arena
- GPT-5.5 MultimodalGrounded: 68.8 · BenchLM.ai
- GPT-5.5 Coding: 70.7 · BenchLM.ai
- GPT-5.5 Knowledge: 79.2 · BenchLM.ai
- GPT-5.5 Instant LM Arena: 1473.370020427245 · LM Arena
- GPT-5.6 Luna Coding: 71.98 · BenchLM.ai
- GPT-5.6 Luna Agentic: 58.22 · BenchLM.ai
- GPT-5.6 Luna Knowledge: 80.7 · BenchLM.ai
- GPT-5.6 Luna MultimodalGrounded: 66.6 · BenchLM.ai
- GPT-5.6 Sol Coding: 78.34 · BenchLM.ai
- GPT-5.6 Sol Agentic: 75.67 · BenchLM.ai
- GPT-5.6 Sol Knowledge: 83 · BenchLM.ai
- GPT-5.6 Sol MultimodalGrounded: 85.3 · BenchLM.ai
- GPT-5.6 Terra Coding: 65.19 · BenchLM.ai
- GPT-5.6 Terra Agentic: 73.32 · BenchLM.ai
- GPT-5.6 Terra Knowledge: 81.3 · BenchLM.ai
- GPT-5.6 Terra MultimodalGrounded: 75.9 · BenchLM.ai
- gpt-oss SWE-Bench Pro: 16.2 · Hugging Faceself reported
- gpt-oss LM Arena: 1317.2861367328605 · LM Arena
- gpt-oss Knowledge: 64.6 · BenchLM.ai
- Granite 3 LM Arena: 1182.2807398888713 · LM Arena
- Granite 4.1 LM Arena: 1306.7013805133424 · LM Arena
- Grok 4 LM Arena: 1409.507952924646 · LM Arena
- Grok 4.1 LM Arena: 1459.6547010057566 · LM Arena
- Grok 4.20 MultimodalGrounded: 35.9 · BenchLM.ai
- Grok 4.3 GDP.pdf: 8 · Epoch AI
- Grok 4.3 LM Arena: 1442.7033194276123 · LM Arena
- Grok 4.3 InstructionFollowing: 91.2 · BenchLM.ai
- Grok 4.3 Knowledge: 54.9 · BenchLM.ai
- Grok 4.5 LM Arena: 1467.803995229971 · LM Arena
- Grok 4.5 Coding: 57.46 · BenchLM.ai
- Grok 4.5 Agentic: 60.58 · BenchLM.ai
- Grok 4.5 Knowledge: 69.5 · BenchLM.ai
- Grok 4.5 MultimodalGrounded: 69.3 · BenchLM.ai
- Kimi K2 SWE-Bench Pro: 27.7 · Hugging Faceself reported
- Kimi K2.5 Coding: 52.72 · BenchLM.ai
- Kimi K2.5 Knowledge: 57.4 · BenchLM.ai
- Kimi K2.5 Math: 62.8 · BenchLM.ai
- Kimi K2.5 Multilingual: 38.2 · BenchLM.ai
- Kimi K2.5 InstructionFollowing: 90.3 · BenchLM.ai
- Kimi K2.5 Humanity's Last Exam: 24.4 · Epoch AI
- Kimi K2.5 SWE-Bench Pro: 50.7 · Hugging Faceself reported
- Kimi K2.6 MultimodalGrounded: 68.3 · BenchLM.ai
- Kimi K2.6 GDP.pdf: 12 · Epoch AI
- Kimi K2.6 ExploitBench: 18 · Epoch AI
- Kimi K2.6 SWE-Bench Pro: 58.6 · Hugging Faceself reported
- Kimi K2.6 LM Arena: 1460.6765119188144 · LM Arena
- Kimi K2.6 Math: 72.3 · BenchLM.ai
- Kimi K2.6 Knowledge: 54.8 · BenchLM.ai
- Kimi K2.7 Code Coding: 53.02 · BenchLM.ai
- Llama 3.3 LM Arena: 1318.3077153841132 · LM Arena
- Llama 4 Humanity's Last Exam: 5.7 · Epoch AI
- Llama 4 LM Arena: 1322.80633173333 · LM Arena
- MiniMax M2 LM Arena: 1346.0478266725263 · LM Arena
- MiniMax M2.1 SWE-Bench Pro: 36.8 · Hugging Faceself reported
- MiniMax M2.1 LM Arena: 1384.3274955011411 · LM Arena
- MiniMax M2.5 SWE-Bench Pro: 55.4 · Hugging Faceself reported
- MiniMax M2.5 LM Arena: 1390.0830731786145 · LM Arena
- MiniMax M2.5 Coding: 52.31 · BenchLM.ai
- MiniMax M2.7 ExploitBench: 13 · Epoch AI
- MiniMax M2.7 SWE-Bench Pro: 56.2 · Hugging Faceself reported
- MiniMax M2.7 LM Arena: 1416.8974839597545 · LM Arena
- MiniMax M3 SWE-Bench Pro: 59 · Hugging Faceself reported
- MiniMax M3 LM Arena: 1444.46252425278 · LM Arena
- MiniMax M3 Knowledge: 66 · BenchLM.ai
- MiniMax M3 MultimodalGrounded: 48.1 · BenchLM.ai
- MiniMax-M1 LM Arena: 1363.7732780934862 · LM Arena
- Mistral 7B LM Arena: 1109.4985003163547 · LM Arena
- Mistral Large LM Arena: 1241.9207045099133 · LM Arena
- Mistral Large 2 LM Arena: 1305.3569065710067 · LM Arena
- Mistral Large 3 GDP.pdf: 2 · Epoch AI
- Mistral Large 3 LM Arena: 1415.2558790947796 · LM Arena
- Mistral Medium 3 Humanity's Last Exam: 4.5 · Epoch AI
- Mistral Medium 3 LM Arena: 1386.8512512055313 · LM Arena
- Mixtral 8x22B LM Arena: 1228.9457048765157 · LM Arena
- Mixtral 8x7B LM Arena: 1196.551991841969 · LM Arena
- Muse Spark Humanity's Last Exam: 40.6 · Epoch AI
- Muse Spark LM Arena: 1487.9126501665664 · LM Arena
- Muse Spark Coding: 62.78 · BenchLM.ai
- Muse Spark Agentic: 58.09 · BenchLM.ai
- Muse Spark MultimodalGrounded: 77.3 · BenchLM.ai
- Nemotron 3 Knowledge: 53.1 · BenchLM.ai
- Nemotron 3 Multilingual: 47.4 · BenchLM.ai
- Nemotron 3 InstructionFollowing: 91.9 · BenchLM.ai
- Nemotron 3 GDP.pdf: 2 · Epoch AI
- Nemotron-4 340B LM Arena: 1276.6975677576318 · LM Arena
- North Mini Code SWE-Bench Pro: 40.2 · Hugging Faceself reported
- o1 InstructionFollowing: 85.4 · BenchLM.ai
- o1 Humanity's Last Exam: 8 · Epoch AI
- o1 LM Arena: 1388.4246614962776 · LM Arena
- o3 Humanity's Last Exam: 19.2 · Epoch AI
- o3 LM Arena: 1430.9679593091237 · LM Arena
- o3-mini InstructionFollowing: 90.3 · BenchLM.ai
- o3-mini LM Arena: 1347.72992731445 · LM Arena
- o4-mini Humanity's Last Exam: 14.3 · Epoch AI
- o4-mini LM Arena: 1389.9941335451213 · LM Arena
- Phi-3 LM Arena: 1127.6557944771084 · LM Arena
- Phi-4 LM Arena: 1256.1052717475695 · LM Arena
- Qwen 3 SWE-Bench Pro: 21.4 · Hugging Faceself reported
- Qwen 3 LM Arena: 1374.8177093069005 · LM Arena
- Qwen 3 Multilingual: 1 · BenchLM.ai
- Qwen 3 Knowledge: 71.8 · BenchLM.ai
- Qwen 3.5 Coding: 54.22 · BenchLM.ai
- Qwen 3.5 Knowledge: 56.5 · BenchLM.ai
- Qwen 3.5 MultimodalGrounded: 67.5 · BenchLM.ai
- Qwen 3.5 Multilingual: 21.1 · BenchLM.ai
- Qwen 3.5 InstructionFollowing: 84.5 · BenchLM.ai
- Qwen 3.5 LM Arena: 1442.7146364798377 · LM Arena
- Qwen 3.6 Coding: 52.5 · BenchLM.ai
- Qwen 3.6 Knowledge: 58.3 · BenchLM.ai
- Qwen 3.6 MultimodalGrounded: 53.3 · BenchLM.ai
- Qwen 3.6 Multilingual: 69.7 · BenchLM.ai
- Qwen 3.6 InstructionFollowing: 86.4 · BenchLM.ai
- Qwen 3.6 SWE-Bench Pro: 49.5 · Hugging Faceself reported
- Qwen 3.6 Math: 63 · BenchLM.ai
- Qwen 3.7 Max Coding: 53.97 · BenchLM.ai
- Qwen 3.7 Max Knowledge: 71.7 · BenchLM.ai
- Qwen 3.7 Max Multilingual: 100 · BenchLM.ai
- Qwen 3.7 Max InstructionFollowing: 91 · BenchLM.ai
- Qwen 3.7 Max LM Arena: 1474.6214141218475 · LM Arena
- Qwen3-Coder SWE-Bench Pro: 38.7 · Hugging Faceself reported
- Qwen3-Coder LM Arena: 1387.668793835836 · LM Arena
- Qwen3-Coder-Next SWE-Bench Pro: 44.3 · Hugging Faceself reported
- Qwen3-Max LM Arena: 1434.6834422337051 · LM Arena
- QwQ-32B LM Arena: 1154.6336235928898 · LM Arena