Study: Extra Test-Time Reasoning Doesn't Improve LLM Stock Trading
Researchers at NJIT tested whether spending more inference compute on reasoning pays off in equity trading. Across 241 trading days in 2024 and over 800,000 predictions on 100 U.S. stocks, extra reasoning in DeepSeek, GPT and Gemini models produced no reliable gain in net returns and sometimes hurt performance.
- 241 trading days in 2024, 100 liquid U.S. equities, 800,000+ predictions
- All nine annual comparisons: 95% confidence intervals crossed zero
- DeepSeek's maximum reasoning lagged its zero-reasoning baseline
- On masked filings, reasoning cut returns by 9.0 basis points per day
Read next
Security