InnerExpert flags AI hallucinations via disagreement among MoE experts
Researchers propose InnerExpert, a method that uses router uncertainty and disagreement between internal experts in Mixture-of-Experts models as an early warning for hallucinations. Tested on five datasets and two MoE architectures, it reached up to 0.91 answer-level AUROC and 0.76 token-level AUROC without extra model passes.
- Method uses router uncertainty and expert disagreement in MoE models as a warning signal
- Best result: 0.91 answer-level AUROC and 0.76 token-level AUROC
- Evaluated on five datasets and two MoE architectures
- Detector needs no second model pass or extra generations
Read next
AI