The daily briefing
Meta's 'Watermelon' reportedly matches GPT-5.5 in internal tests, per rumor
Friday, July 3, 2026 · what moved in the AI release cycle in those 24 hours.
One click creates your free account (or signs you into an existing one) and turns on alerts for the Daily Briefing. There's no password to set, and you can unsubscribe any time.
A rumor-heavy day in the release cycle. The most consequential claim comes from a report that Meta's next frontier model, codenamed Watermelon, has caught OpenAI's GPT-5.5 on internal benchmarks while still training. Leakers also point to a GPT-5.6 'Sol' launch as soon as next Thursday, and Anthropic's Claude Fable 5 is said to be headed to subscription plans once capacity allows. Nothing is confirmed today.
An AI summary of the day’s tracked items. It may contain errors; every item below links to its source.
Top stories
- 1
If accurate, Meta matching GPT-5.5 mid-training would signal a serious frontier challenger, though it rests on unverified internal benchmarks.
Llama 5 · @kimmonismus
- 2
GPT-5.6 'Sol' likely launching next week, probably Thursday (leaker)Rumor
A near-term dated launch window for GPT-5.6 'Sol' is the most actionable rumor for readers tracking OpenAI's release cadence.
ChatGPT 5.6 · @kimmonismus
- 3
Claude Fable 5 to join subscription plans once capacity allows (report)Rumor
Claude Fable 5 reportedly reaching subscription plans would broaden access, pending Anthropic capacity.
Claude Fable 5 · @kimmonismus
Picked by AI from the day’s tracked items; every link goes to the source.
Crowd-guess shifts
Where the community’s average release-date guess moved since yesterday.
- Claude Fable 5.1 moved 8 days earlier to 2026-08-07 (3 guesses)
New benchmark readings
- Amazon Nova 2 Pro GDP.pdf: 2 · Epoch AI
- Amazon Nova Humanity's Last Exam: 3.6 · Epoch AI
- Amazon Nova LM Arena: 1289.98 · LM Arena
- Amazon Nova 2 Lite LM Arena: 1337.02 · LM Arena
- Claude 3 Haiku LM Arena: 1260.66 · LM Arena
- Claude 3 Opus LM Arena: 1321.28 · LM Arena
- Claude 3 Sonnet LM Arena: 1280.41 · LM Arena
- Claude 3.5 Haiku LM Arena: 1323.59 · LM Arena
- Claude 3.5 Sonnet MultimodalGrounded: 66.9 · BenchLM.ai
- Claude 3.5 Sonnet Multilingual: 62.5 · BenchLM.ai
- Claude 3.5 Sonnet Humanity's Last Exam: 4.1 · Epoch AI
- Claude 3.5 Sonnet LM Arena: 1342.26 · LM Arena
- Claude 3.7 Sonnet Humanity's Last Exam: 8 · Epoch AI
- Claude 3.7 Sonnet LM Arena: 1371.21 · LM Arena
- Claude Fable 5 LM Arena: 1508.51 · LM Arena
- Claude Fable 5 Coding: 100 · BenchLM.ai
- Claude Fable 5 Agentic: 89.4 · BenchLM.ai
- Claude Fable 5 MultimodalGrounded: 79 · BenchLM.ai
- Claude Fable 5 Multilingual: 100 · BenchLM.ai
- Claude Fable 5 InstructionFollowing: 92.7 · BenchLM.ai
- Claude Fable 5 GDP.pdf: 30 · Epoch AI
- Claude Haiku 4.5 Reasoning: 58.6 · BenchLM.ai
- Claude Haiku 4.5 Math: 55 · BenchLM.ai
- Claude Haiku 4.5 MultimodalGrounded: 73.6 · BenchLM.ai
- Claude Haiku 4.5 Multilingual: 61.4 · BenchLM.ai
- Claude Haiku 4.5 InstructionFollowing: 69.6 · BenchLM.ai
- Claude Haiku 4.5 ExploitBench: 14 · Epoch AI
- Claude Haiku 4.5 LM Arena: 1411.45 · LM Arena
- Claude Mythos 5 Coding: 100 · BenchLM.ai
- Claude Mythos 5 Agentic: 100 · BenchLM.ai
- Claude Mythos 5 MultimodalGrounded: 98.9 · BenchLM.ai
- Claude Mythos 5 Multilingual: 100 · BenchLM.ai
- Claude Mythos 5 InstructionFollowing: 91.4 · BenchLM.ai
- Claude Mythos 5 ExploitBench: 69 · Epoch AI
- Claude Opus 4 Humanity's Last Exam: 6.7 · Epoch AI
- Claude Opus 4 LM Arena: 1412.22 · LM Arena
- Claude Opus 4.1 Reasoning: 55.7 · BenchLM.ai
- Claude Opus 4.1 Math: 52.9 · BenchLM.ai
- Claude Opus 4.1 MultimodalGrounded: 65.7 · BenchLM.ai
- Claude Opus 4.1 Multilingual: 66.2 · BenchLM.ai
- Claude Opus 4.1 InstructionFollowing: 76.9 · BenchLM.ai
- Claude Opus 4.1 Humanity's Last Exam: 7.9 · Epoch AI
- Claude Opus 4.1 LM Arena: 1447.05 · LM Arena
- Claude Opus 4.5 Coding: 74.5 · BenchLM.ai
- Claude Opus 4.5 Agentic: 73.5 · BenchLM.ai
- Claude Opus 4.5 Reasoning: 69.6 · BenchLM.ai
- Claude Opus 4.5 Knowledge: 82.4 · BenchLM.ai
- Claude Opus 4.5 Math: 94.9 · BenchLM.ai
- Claude Opus 4.5 MultimodalGrounded: 61.2 · BenchLM.ai
- Claude Opus 4.5 Multilingual: 81.4 · BenchLM.ai
- Claude Opus 4.5 Humanity's Last Exam: 14.2 · Epoch AI
- Claude Opus 4.5 LM Arena: 1469.28 · LM Arena
- Claude Opus 4.6 LM Arena: 1498.93 · LM Arena
- Claude Opus 4.6 Coding: 84.9 · BenchLM.ai
- Claude Opus 4.6 Agentic: 80.2 · BenchLM.ai
- Claude Opus 4.6 Reasoning: 88.2 · BenchLM.ai
- Claude Opus 4.6 Knowledge: 90.1 · BenchLM.ai
- Claude Opus 4.6 Math: 86.3 · BenchLM.ai
- Claude Opus 4.6 MultimodalGrounded: 76.7 · BenchLM.ai
- Claude Opus 4.6 Multilingual: 100 · BenchLM.ai
- Claude Opus 4.6 InstructionFollowing: 95.3 · BenchLM.ai
- Claude Opus 4.6 Humanity's Last Exam: 19 · Epoch AI
- Claude Opus 4.7 LM Arena: 1494.05 · LM Arena
- Claude Opus 4.7 Coding: 92.5 · BenchLM.ai
- Claude Opus 4.7 Agentic: 84.4 · BenchLM.ai
- Claude Opus 4.7 Knowledge: 96.4 · BenchLM.ai
- Claude Opus 4.7 Humanity's Last Exam: 36.2 · Epoch AI
- Claude Opus 4.7 FrontierCode Diamond: 5.2 · Epoch AI
- Claude Opus 4.7 ExploitBench: 28 · Epoch AI
- Claude Opus 4.7 GDP.pdf: 21 · Epoch AI
- Claude Opus 4.8 LM Arena: 1476.51 · LM Arena
- Claude Opus 4.8 Coding: 97 · BenchLM.ai
- Claude Opus 4.8 Agentic: 95.5 · BenchLM.ai
- Claude Opus 4.8 Knowledge: 98.5 · BenchLM.ai
- Claude Opus 4.8 MultimodalGrounded: 66.4 · BenchLM.ai
- Claude Opus 4.8 FrontierCode Diamond: 13.4 · Epoch AI
- Claude Opus 4.8 GDP.pdf: 23 · Epoch AI
- Claude Sonnet 4 Reasoning: 54.7 · BenchLM.ai
- Claude Sonnet 4 Math: 61.1 · BenchLM.ai
- Claude Sonnet 4 MultimodalGrounded: 75.5 · BenchLM.ai
- Claude Sonnet 4 Multilingual: 67 · BenchLM.ai
- Claude Sonnet 4 Humanity's Last Exam: 5.5 · Epoch AI
- Claude Sonnet 4 LM Arena: 1388.94 · LM Arena
- Claude Sonnet 4.5 Coding: 77.7 · BenchLM.ai
- Claude Sonnet 4.5 Agentic: 53.7 · BenchLM.ai
- Claude Sonnet 4.5 Reasoning: 62 · BenchLM.ai
- Claude Sonnet 4.5 Knowledge: 74 · BenchLM.ai
- Claude Sonnet 4.5 Math: 87.7 · BenchLM.ai
- Claude Sonnet 4.5 MultimodalGrounded: 94.8 · BenchLM.ai
- Claude Sonnet 4.5 Multilingual: 84.8 · BenchLM.ai
- Claude Sonnet 4.5 InstructionFollowing: 84.2 · BenchLM.ai
- Claude Sonnet 4.5 Humanity's Last Exam: 7.5 · Epoch AI
- Claude Sonnet 4.5 LM Arena: 1455.15 · LM Arena
- Claude Sonnet 4.6 LM Arena: 1472.16 · LM Arena
- Claude Sonnet 4.6 Coding: 77.6 · BenchLM.ai
- Claude Sonnet 4.6 Agentic: 72.3 · BenchLM.ai
- Claude Sonnet 4.6 Reasoning: 82 · BenchLM.ai
- Claude Sonnet 4.6 Knowledge: 81.6 · BenchLM.ai
- Claude Sonnet 4.6 Math: 76.5 · BenchLM.ai
- Claude Sonnet 4.6 MultimodalGrounded: 86.2 · BenchLM.ai
- Claude Sonnet 4.6 Multilingual: 88.4 · BenchLM.ai
- Claude Sonnet 4.6 InstructionFollowing: 81.2 · BenchLM.ai
- Claude Sonnet 4.6 FrontierCode Diamond: 3.5 · Epoch AI
- Claude Sonnet 4.6 ExploitBench: 24 · Epoch AI
- Claude Sonnet 5 LM Arena: 1464.3 · LM Arena
- Command A LM Arena: 1353.95 · LM Arena
- Command R LM Arena: 1225.95 · LM Arena
- Command R+ LM Arena: 1260.97 · LM Arena
- DeepSeek LLM LM Arena: 1183.72 · LM Arena
- DeepSeek V4 Flash Coding: 61.3 · BenchLM.ai
- DeepSeek V4 Flash Knowledge: 61.8 · BenchLM.ai
- DeepSeek V4 Flash LM Arena: 1435.74 · LM Arena
- DeepSeek V4 Pro Coding: 67.5 · BenchLM.ai
- DeepSeek V4 Pro Knowledge: 70.4 · BenchLM.ai
- DeepSeek V4 Pro SWE-Bench Pro: 55.4 · Hugging Faceself reported
- DeepSeek V4 Pro LM Arena: 1457.08 · LM Arena
- DeepSeek-R1 LM Arena: 1398.08 · LM Arena
- DeepSeek-V2 Agentic: 48.7 · BenchLM.ai
- DeepSeek-V2 Reasoning: 58.4 · BenchLM.ai
- DeepSeek-V2 Math: 70.8 · BenchLM.ai
- DeepSeek-V2.5 LM Arena: 1307.05 · LM Arena
- DeepSeek-V3 LM Arena: 1358.47 · LM Arena
- DeepSeek-V3.1 LM Arena: 1417.41 · LM Arena
- DeepSeek-V3.2-Exp Agentic: 49.7 · BenchLM.ai
- DeepSeek-V3.2-Exp Knowledge: 61.8 · BenchLM.ai
- DeepSeek-V3.2-Exp Math: 51.6 · BenchLM.ai
- DeepSeek-V3.2-Exp Multilingual: 63.4 · BenchLM.ai
- DeepSeek-V3.2-Exp Reasoning: 55 · BenchLM.ai
- DeepSeek-V3.2-Exp LM Arena: 1422.96 · LM Arena
- ERNIE 5.1 LM Arena: 1467.54 · LM Arena
- Gemini 1.0 LM Arena: 1222.19 · LM Arena
- Gemini 1.5 Flash LM Arena: 1309.18 · LM Arena
- Gemini 1.5 Pro Reasoning: 52.8 · BenchLM.ai
- Gemini 1.5 Pro MultimodalGrounded: 65.5 · BenchLM.ai
- Gemini 1.5 Pro Humanity's Last Exam: 4.6 · Epoch AI
- Gemini 1.5 Pro LM Arena: 1351 · LM Arena
- Gemini 2.0 Flash Humanity's Last Exam: 6.6 · Epoch AI
- Gemini 2.0 Flash LM Arena: 1360.25 · LM Arena
- Gemini 2.5 Flash Humanity's Last Exam: 11 · Epoch AI
- Gemini 2.5 Flash LM Arena: 1410.35 · LM Arena
- Gemini 2.5 Pro Agentic: 57.1 · BenchLM.ai
- Gemini 2.5 Pro Reasoning: 58.7 · BenchLM.ai
- Gemini 2.5 Pro Knowledge: 66.3 · BenchLM.ai
- Gemini 2.5 Pro Math: 73.2 · BenchLM.ai
- Gemini 2.5 Pro MultimodalGrounded: 85.2 · BenchLM.ai
- Gemini 2.5 Pro Multilingual: 68.9 · BenchLM.ai
- Gemini 2.5 Pro Humanity's Last Exam: 17.8 · Epoch AI
- Gemini 2.5 Pro LM Arena: 1445.66 · LM Arena
- Gemini 3 Pro Coding: 71.6 · BenchLM.ai
- Gemini 3 Pro Agentic: 70.6 · BenchLM.ai
- Gemini 3 Pro Reasoning: 82.7 · BenchLM.ai
- Gemini 3 Pro Knowledge: 82.8 · BenchLM.ai
- Gemini 3 Pro Math: 80.4 · BenchLM.ai
- Gemini 3 Pro MultimodalGrounded: 81.2 · BenchLM.ai
- Gemini 3 Pro Multilingual: 79.2 · BenchLM.ai
- Gemini 3 Pro InstructionFollowing: 79.5 · BenchLM.ai
- Gemini 3 Pro Humanity's Last Exam: 37.5 · Epoch AI
- Gemini 3 Pro LM Arena: 1485.77 · LM Arena
- Gemini 3.1 Pro Coding: 93.2 · BenchLM.ai
- Gemini 3.1 Pro Agentic: 66.9 · BenchLM.ai
- Gemini 3.1 Pro Reasoning: 96.4 · BenchLM.ai
- Gemini 3.1 Pro Knowledge: 93.3 · BenchLM.ai
- Gemini 3.1 Pro Math: 67 · BenchLM.ai
- Gemini 3.1 Pro MultimodalGrounded: 84 · BenchLM.ai
- Gemini 3.1 Pro Multilingual: 100 · BenchLM.ai
- Gemini 3.1 Pro InstructionFollowing: 93.2 · BenchLM.ai
- Gemini 3.1 Pro GDP.pdf: 17 · Epoch AI
- Gemini 3.1 Pro FrontierCode Diamond: 4.7 · Epoch AI
- Gemini 3.1 Pro Humanity's Last Exam: 46.4 · Epoch AI
- Gemini 3.1 Pro ExploitBench: 26 · Epoch AI
- Gemini 3.5 Flash LM Arena: 1479.46 · LM Arena
- Gemini 3.5 Flash Coding: 76.7 · BenchLM.ai
- Gemini 3.5 Flash Agentic: 94 · BenchLM.ai
- Gemini 3.5 Flash Reasoning: 79.4 · BenchLM.ai
- Gemini 3.5 Flash MultimodalGrounded: 80 · BenchLM.ai
- Gemini 3.5 Flash InstructionFollowing: 78 · BenchLM.ai
- Gemini 3.5 Flash GDP.pdf: 14 · Epoch AI
- GLM-4 LM Arena: 1272.88 · LM Arena
- GLM-4.5 Humanity's Last Exam: 8.1 · Epoch AI
- GLM-4.5 LM Arena: 1373.04 · LM Arena
- GLM-4.6 SWE-Bench Pro: 9.7 · Hugging Faceself reported
- GLM-4.6 LM Arena: 1425.35 · LM Arena
- GLM-4.7 Coding: 71.9 · BenchLM.ai
- GLM-4.7 Agentic: 54.3 · BenchLM.ai
- GLM-4.7 Reasoning: 72.9 · BenchLM.ai
- GLM-4.7 Knowledge: 66.5 · BenchLM.ai
- GLM-4.7 Math: 78.3 · BenchLM.ai
- GLM-4.7 Multilingual: 71.3 · BenchLM.ai
- GLM-4.7 InstructionFollowing: 73.1 · BenchLM.ai
- GLM-4.7 LM Arena: 1442.38 · LM Arena
- GLM-5 Coding: 68.4 · BenchLM.ai
- GLM-5 Agentic: 47.7 · BenchLM.ai
- GLM-5 Reasoning: 60.5 · BenchLM.ai
- GLM-5 Knowledge: 81.7 · BenchLM.ai
- GLM-5 Math: 91.3 · BenchLM.ai
- GLM-5 Multilingual: 70.9 · BenchLM.ai
- GLM-5 InstructionFollowing: 81.2 · BenchLM.ai
- GLM-5 MultimodalGrounded: 72.6 · BenchLM.ai
- GLM-5 LM Arena: 1456.98 · LM Arena
- GLM-5.1 Coding: 80.6 · BenchLM.ai
- GLM-5.1 Reasoning: 60.5 · BenchLM.ai
- GLM-5.1 Knowledge: 82.5 · BenchLM.ai
- GLM-5.1 Math: 91.3 · BenchLM.ai
- GLM-5.1 InstructionFollowing: 93.8 · BenchLM.ai
- GLM-5.1 ExploitBench: 18 · Epoch AI
- GLM-5.1 SWE-Bench Pro: 58.4 · Hugging Faceself reported
- GLM-5.1 LM Arena: 1472.21 · LM Arena
- GLM-5.2 LM Arena: 1468.66 · LM Arena
- GLM-5.2 SWE-Bench Pro: 62.1 · Hugging Faceself reported
- GPT-3.5 Turbo LM Arena: 1223.97 · LM Arena
- GPT-4 LM Arena: 1274.79 · LM Arena
- GPT-4 Turbo LM Arena: 1312.21 · LM Arena
- GPT-4.1 Agentic: 55.1 · BenchLM.ai
- GPT-4.1 Reasoning: 67.4 · BenchLM.ai
- GPT-4.1 MultimodalGrounded: 63.9 · BenchLM.ai
- GPT-4.1 InstructionFollowing: 74.7 · BenchLM.ai
- GPT-4.1 Humanity's Last Exam: 5.4 · Epoch AI
- GPT-4.1 LM Arena: 1413.68 · LM Arena
- GPT-4.5 Humanity's Last Exam: 5.4 · Epoch AI
- GPT-4o Math: 52 · BenchLM.ai
- GPT-4o MultimodalGrounded: 62.2 · BenchLM.ai
- GPT-4o Humanity's Last Exam: 2.7 · Epoch AI
- GPT-4o LM Arena: 1334.98 · LM Arena
- GPT-4o mini LM Arena: 1317.66 · LM Arena
- GPT-5 Coding: 68.9 · BenchLM.ai
- GPT-5 Agentic: 67.5 · BenchLM.ai
- GPT-5 Reasoning: 74.1 · BenchLM.ai
- GPT-5 Knowledge: 73.9 · BenchLM.ai
- GPT-5 Math: 70.1 · BenchLM.ai
- GPT-5 MultimodalGrounded: 90.6 · BenchLM.ai
- GPT-5 Multilingual: 79.2 · BenchLM.ai
- GPT-5 InstructionFollowing: 76.9 · BenchLM.ai
- GPT-5 Humanity's Last Exam: 19.4 · Epoch AI
- GPT-5.1 Coding: 75.5 · BenchLM.ai
- GPT-5.1 Agentic: 73.7 · BenchLM.ai
- GPT-5.1 Reasoning: 66.7 · BenchLM.ai
- GPT-5.1 Knowledge: 81.9 · BenchLM.ai
- GPT-5.1 Math: 68.1 · BenchLM.ai
- GPT-5.1 MultimodalGrounded: 96.3 · BenchLM.ai
- GPT-5.1 Multilingual: 82.8 · BenchLM.ai
- GPT-5.1 InstructionFollowing: 75.8 · BenchLM.ai
- GPT-5.1 Humanity's Last Exam: 6.8 · Epoch AI
- GPT-5.1 LM Arena: 1438.78 · LM Arena
- GPT-5.2 Coding: 78.1 · BenchLM.ai
- GPT-5.2 Agentic: 59.7 · BenchLM.ai
- GPT-5.2 Reasoning: 83.5 · BenchLM.ai
- GPT-5.2 Knowledge: 90.5 · BenchLM.ai
- GPT-5.2 Math: 80.8 · BenchLM.ai
- GPT-5.2 MultimodalGrounded: 81.5 · BenchLM.ai
- GPT-5.2 Multilingual: 95.9 · BenchLM.ai
- GPT-5.2 InstructionFollowing: 84.9 · BenchLM.ai
- GPT-5.2 Humanity's Last Exam: 27.8 · Epoch AI
- GPT-5.2 LM Arena: 1434.98 · LM Arena
- GPT-5.4 Coding: 86.7 · BenchLM.ai
- GPT-5.4 Agentic: 83 · BenchLM.ai
- GPT-5.4 Reasoning: 95.6 · BenchLM.ai
- GPT-5.4 Knowledge: 97.4 · BenchLM.ai
- GPT-5.4 Math: 94.4 · BenchLM.ai
- GPT-5.4 MultimodalGrounded: 59.6 · BenchLM.ai
- GPT-5.4 Multilingual: 100 · BenchLM.ai
- GPT-5.4 InstructionFollowing: 93.7 · BenchLM.ai
- GPT-5.4 Humanity's Last Exam: 36.2 · Epoch AI
- GPT-5.4 LM Arena: 1467.22 · LM Arena
- GPT-5.5 Agentic: 96.6 · BenchLM.ai
- GPT-5.5 FrontierCode Diamond: 6.3 · Epoch AI
- GPT-5.5 GDP.pdf: 25 · Epoch AI
- GPT-5.5 LM Arena: 1474.62 · LM Arena
- GPT-5.5 Instant LM Arena: 1472.71 · LM Arena
- gpt-oss SWE-Bench Pro: 16.2 · Hugging Faceself reported
- gpt-oss LM Arena: 1317.43 · LM Arena
- Granite 3 LM Arena: 1181.82 · LM Arena
- Granite 4.1 LM Arena: 1306.8 · LM Arena
- Grok 4 Coding: 75.1 · BenchLM.ai
- Grok 4 Agentic: 52.8 · BenchLM.ai
- Grok 4 Reasoning: 55.2 · BenchLM.ai
- Grok 4 Knowledge: 66.5 · BenchLM.ai
- Grok 4 Math: 80 · BenchLM.ai
- Grok 4 MultimodalGrounded: 73 · BenchLM.ai
- Grok 4 Multilingual: 63.4 · BenchLM.ai
- Grok 4 LM Arena: 1409.76 · LM Arena
- Grok 4.1 Coding: 58.9 · BenchLM.ai
- Grok 4.1 Agentic: 60.8 · BenchLM.ai
- Grok 4.1 Reasoning: 87.9 · BenchLM.ai
- Grok 4.1 Knowledge: 75.8 · BenchLM.ai
- Grok 4.1 Math: 93.7 · BenchLM.ai
- Grok 4.1 MultimodalGrounded: 89.7 · BenchLM.ai
- Grok 4.1 Multilingual: 74.6 · BenchLM.ai
- Grok 4.1 InstructionFollowing: 79.7 · BenchLM.ai
- Grok 4.1 LM Arena: 1459.35 · LM Arena
- Grok 4.20 InstructionFollowing: 95.4 · BenchLM.ai
- Grok 4.3 GDP.pdf: 8 · Epoch AI
- Grok 4.3 LM Arena: 1443.88 · LM Arena
- Kimi K2 Math: 51.3 · BenchLM.ai
- Kimi K2 InstructionFollowing: 83.5 · BenchLM.ai
- Kimi K2 SWE-Bench Pro: 27.7 · Hugging Faceself reported
- Kimi K2.5 Coding: 80.5 · BenchLM.ai
- Kimi K2.5 Reasoning: 54.6 · BenchLM.ai
- Kimi K2.5 Knowledge: 70.3 · BenchLM.ai
- Kimi K2.5 Math: 56.8 · BenchLM.ai
- Kimi K2.5 MultimodalGrounded: 63.1 · BenchLM.ai
- Kimi K2.5 Multilingual: 68.4 · BenchLM.ai
- Kimi K2.5 InstructionFollowing: 84.5 · BenchLM.ai
- Kimi K2.5 Agentic: 62.5 · BenchLM.ai
- Kimi K2.5 Humanity's Last Exam: 24.4 · Epoch AI
- Kimi K2.5 FrontierCode Diamond: 1 · Epoch AI
- Kimi K2.5 SWE-Bench Pro: 50.7 · Hugging Faceself reported
- Kimi K2.6 Coding: 88.9 · BenchLM.ai
- Kimi K2.6 Agentic: 81 · BenchLM.ai
- Kimi K2.6 MultimodalGrounded: 71.3 · BenchLM.ai
- Kimi K2.6 GDP.pdf: 12 · Epoch AI
- Kimi K2.6 FrontierCode Diamond: 3.8 · Epoch AI
- Kimi K2.6 ExploitBench: 18 · Epoch AI
- Kimi K2.6 SWE-Bench Pro: 58.6 · Hugging Faceself reported
- Kimi K2.6 LM Arena: 1461.37 · LM Arena
- Llama 3.1 Math: 58 · BenchLM.ai
- Llama 3.1 Multilingual: 61.6 · BenchLM.ai
- Llama 3.1 InstructionFollowing: 69.6 · BenchLM.ai
- Llama 3.3 LM Arena: 1318.14 · LM Arena
- Llama 4 Humanity's Last Exam: 5.7 · Epoch AI
- Llama 4 LM Arena: 1322.64 · LM Arena
- MiniMax M2 LM Arena: 1345.98 · LM Arena
- MiniMax M2.1 SWE-Bench Pro: 36.8 · Hugging Faceself reported
- MiniMax M2.5 FrontierCode Diamond: 1.1 · Epoch AI
- MiniMax M2.5 SWE-Bench Pro: 55.4 · Hugging Faceself reported
- MiniMax M2.5 LM Arena: 1390.58 · LM Arena
- MiniMax M2.7 InstructionFollowing: 76.3 · BenchLM.ai
- MiniMax M2.7 FrontierCode Diamond: 2.4 · Epoch AI
- MiniMax M2.7 ExploitBench: 13 · Epoch AI
- MiniMax M2.7 SWE-Bench Pro: 56.2 · Hugging Faceself reported
- MiniMax M2.7 LM Arena: 1416.82 · LM Arena
- MiniMax M3 Agentic: 84.5 · BenchLM.ai
- MiniMax M3 SWE-Bench Pro: 59 · Hugging Faceself reported
- MiniMax M3 LM Arena: 1446.54 · LM Arena
- MiniMax-M1 LM Arena: 1363.63 · LM Arena
- Mistral Large LM Arena: 1241.57 · LM Arena
- Mistral Large 2 LM Arena: 1305.2 · LM Arena
- Mistral Large 3 Math: 64.2 · BenchLM.ai
- Mistral Large 3 MultimodalGrounded: 67.7 · BenchLM.ai
- Mistral Large 3 GDP.pdf: 2 · Epoch AI
- Mistral Large 3 LM Arena: 1415.66 · LM Arena
- Mistral Medium 3 Humanity's Last Exam: 4.5 · Epoch AI
- Mistral Medium 3 LM Arena: 1386.85 · LM Arena
- Muse Spark Humanity's Last Exam: 40.6 · Epoch AI
- Muse Spark LM Arena: 1487.4 · LM Arena
- Nemotron 3 Coding: 79.7 · BenchLM.ai
- Nemotron 3 Reasoning: 57 · BenchLM.ai
- Nemotron 3 Knowledge: 73.5 · BenchLM.ai
- Nemotron 3 Math: 52.5 · BenchLM.ai
- Nemotron 3 Multilingual: 72.8 · BenchLM.ai
- Nemotron 3 InstructionFollowing: 96 · BenchLM.ai
- Nemotron 3 GDP.pdf: 2 · Epoch AI
- Nemotron-4 340B LM Arena: 1276.43 · LM Arena
- North Mini Code SWE-Bench Pro: 40.2 · Hugging Faceself reported
- o1 Coding: 77.8 · BenchLM.ai
- o1 Agentic: 55.8 · BenchLM.ai
- o1 Reasoning: 75 · BenchLM.ai
- o1 Knowledge: 80.5 · BenchLM.ai
- o1 Math: 94.1 · BenchLM.ai
- o1 MultimodalGrounded: 67.5 · BenchLM.ai
- o1 Multilingual: 82 · BenchLM.ai
- o1 InstructionFollowing: 76.9 · BenchLM.ai
- o1 Humanity's Last Exam: 8 · Epoch AI
- o1 LM Arena: 1388.29 · LM Arena
- o3 Coding: 64.1 · BenchLM.ai
- o3 Agentic: 55.8 · BenchLM.ai
- o3 Reasoning: 55.2 · BenchLM.ai
- o3 Knowledge: 66.8 · BenchLM.ai
- o3 Math: 83.4 · BenchLM.ai
- o3 MultimodalGrounded: 61.7 · BenchLM.ai
- o3 Multilingual: 64.2 · BenchLM.ai
- o3 Humanity's Last Exam: 19.2 · Epoch AI
- o3 LM Arena: 1430.98 · LM Arena
- o3-mini Agentic: 60.6 · BenchLM.ai
- o3-mini Reasoning: 68 · BenchLM.ai
- o3-mini MultimodalGrounded: 65.6 · BenchLM.ai
- o3-mini InstructionFollowing: 85.3 · BenchLM.ai
- o3-mini LM Arena: 1347.66 · LM Arena
- o4-mini Knowledge: 59.5 · BenchLM.ai
- o4-mini Math: 54.3 · BenchLM.ai
- o4-mini Multilingual: 66.1 · BenchLM.ai
- o4-mini Humanity's Last Exam: 14.3 · Epoch AI
- o4-mini LM Arena: 1389.84 · LM Arena
- Phi-3 LM Arena: 1127.39 · LM Arena
- Phi-4 LM Arena: 1255.95 · LM Arena
- Qwen 2.5 Agentic: 45.8 · BenchLM.ai
- Qwen 2.5 Reasoning: 60.1 · BenchLM.ai
- Qwen 2.5 Math: 76.2 · BenchLM.ai
- Qwen 2.5 Multilingual: 62.3 · BenchLM.ai
- Qwen 3 InstructionFollowing: 76.2 · BenchLM.ai
- Qwen 3 SWE-Bench Pro: 21.4 · Hugging Faceself reported
- Qwen 3 LM Arena: 1374.77 · LM Arena
- Qwen 3.5 Coding: 58.7 · BenchLM.ai
- Qwen 3.5 Agentic: 45.3 · BenchLM.ai
- Qwen 3.5 Reasoning: 58.4 · BenchLM.ai
- Qwen 3.5 Knowledge: 71.1 · BenchLM.ai
- Qwen 3.5 Math: 73.3 · BenchLM.ai
- Qwen 3.5 MultimodalGrounded: 63.3 · BenchLM.ai
- Qwen 3.5 Multilingual: 67.2 · BenchLM.ai
- Qwen 3.5 InstructionFollowing: 80.6 · BenchLM.ai
- Qwen 3.5 LM Arena: 1442.97 · LM Arena
- Qwen 3.6 Coding: 71.3 · BenchLM.ai
- Qwen 3.6 Knowledge: 65.7 · BenchLM.ai
- Qwen 3.6 MultimodalGrounded: 64 · BenchLM.ai
- Qwen 3.6 Agentic: 54.8 · BenchLM.ai
- Qwen 3.6 Multilingual: 77.6 · BenchLM.ai
- Qwen 3.6 InstructionFollowing: 91.8 · BenchLM.ai
- Qwen 3.6 SWE-Bench Pro: 49.5 · Hugging Faceself reported
- Qwen 3.7 Max Coding: 91.1 · BenchLM.ai
- Qwen 3.7 Max Knowledge: 84.8 · BenchLM.ai
- Qwen 3.7 Max Multilingual: 84 · BenchLM.ai
- Qwen 3.7 Max InstructionFollowing: 93.4 · BenchLM.ai
- Qwen3-Coder SWE-Bench Pro: 38.7 · Hugging Faceself reported
- Qwen3-Coder-Next SWE-Bench Pro: 44.3 · Hugging Faceself reported
- QwQ-32B LM Arena: 1336.16 · LM Arena
News & rumors added