state-m

Tag

Cards List
#state-m

@VictorKaiWang1: 95.3% on Terminal Bench 2.1 Deepseek V4 Flash + StateM, 88.8% on TB2.1

X AI KOLs Timeline · 7h ago Cached

Researchers achieve 95.3% accuracy on Terminal-Bench 2.1 using DeepSeek V4 Flash and StateM, matching GPT-5.6 Sol Max performance and exploring agent improvement beyond model scaling.

0 favorites 0 likes
← Back to home

Submit Feedback