AI Models & LLM News: Releases, Benchmarks, Comparisons
New models, benchmarks and our tests
deepseek v4 flash tops 8 of 11 coding languages on openrouter
fable 5 scored 0.97 similarity to kimi – and the proof got deleted
fable 5 flash: we tested 5 prompts, got zero usable outputs
four models, three canvas tasks: sonnet 5 does more with less
meituan's stealth model exposed: longcat vs qwen in 3 coding tasks
350m vs 685b: liquid ai's tiny phone model takes on deepseek v3
baidu unlimited-ocr meets claude opus 4.8: 1998 scan, clean table
we tested sakana fugu: 4 builds, zero retries, one prompt each
4 versions of glm, same 3 prompts – each one beat the last
liquid ai ships two tiny search models beating rivals twice their size