Visual TL;DR. LRM Output Degradation problem Existing Steering Methods. Existing Steering Methods flaw Detection vs Prediction. Detection vs Prediction solution Activation Probes. Activation Probes demonstrates Predicting Future Behavior. Activation Probes enables FPCG Method. FPCG Method achieves Minimal Quality Degradation.
- LRM Output Degradation: deployed large reasoning models often exhibit unpredictable behaviors
- Existing Steering Methods: rely on internal features detecting already generated text
- Detection vs Prediction: distinguishing features that signal existing vs future behavior
- Activation Probes: trained to forecast future behavior likelihoods from intermediate steps
- Predicting Future Behavior: probes demonstrate significant accuracy from 64% to 91%
- FPCG Method: future probe controlled generation enables precise steering
- Minimal Quality Degradation: enables precise large reasoning model steering with minimal output quality degradation
Visual TL;DR