Visual TL;DR. Traditional Distillation vs Strong-to-Weak Scaffolding. Strong-to-Weak Scaffolding involves Builder Model Creates. Builder Model Creates then Guides Target Model. Guides Target Model leads to Performance Nearly Doubled. Strong-to-Weak Scaffolding shown by Test-Time Capability Transfer. Builder Model Creates via Harness Refinement. Harness Refinement improves Guides Target Model. Strong-to-Weak Scaffolding achieved by Bypasses Parameter Updates.
- Traditional Distillation: transfers capabilities by updating a smaller model's parameters during training
- Strong-to-Weak Scaffolding: stronger model guides weaker one at inference time, no parameter updates
- Builder Model Creates: stronger 'builder' model creates inference-time 'harnesses' to guide
- Guides Target Model: harnesses guide a weaker 'target' model to solve tasks more reliably
- Test-Time Capability Transfer: demonstrated using four Theory-of-Mind benchmarks for evaluation
- Harness Refinement: builder model iteratively refined its harness over several rounds
- Performance Nearly Doubled: average target-model performance jumped from 0.49 to 0.91
- Bypasses Parameter Updates: method entirely bypasses parameter updates, focusing on inference guidance
Visual TL;DR
