Test-Time Distillation Nearly Doubles Model Performance

New research shows stronger AI models can guide weaker ones at inference time, nearly doubling performance without retraining through 'scaffolding'.

6 min read
Diagram illustrating the strong-to-weak scaffolding process for AI model inference.
The strong-to-weak scaffolding method guides weaker AI models during inference.

Visual TL;DR. Traditional Distillation vs Strong-to-Weak Scaffolding. Strong-to-Weak Scaffolding involves Builder Model Creates. Builder Model Creates then Guides Target Model. Guides Target Model leads to Performance Nearly Doubled. Strong-to-Weak Scaffolding shown by Test-Time Capability Transfer. Builder Model Creates via Harness Refinement. Harness Refinement improves Guides Target Model. Strong-to-Weak Scaffolding achieved by Bypasses Parameter Updates.

  1. Traditional Distillation: transfers capabilities by updating a smaller model's parameters during training
  2. Strong-to-Weak Scaffolding: stronger model guides weaker one at inference time, no parameter updates
  3. Builder Model Creates: stronger 'builder' model creates inference-time 'harnesses' to guide
  4. Guides Target Model: harnesses guide a weaker 'target' model to solve tasks more reliably
  5. Test-Time Capability Transfer: demonstrated using four Theory-of-Mind benchmarks for evaluation
  6. Harness Refinement: builder model iteratively refined its harness over several rounds
  7. Performance Nearly Doubled: average target-model performance jumped from 0.49 to 0.91
  8. Bypasses Parameter Updates: method entirely bypasses parameter updates, focusing on inference guidance
Visual TL;DR
Visual TL;DR, startuphub.ai Strong-to-Weak Scaffolding involves Builder Model Creates. Builder Model Creates then Guides Target Model. Guides Target Model leads to Performance Nearly Doubled involves then leads to Strong-to-Weak Scaffolding Builder Model Creates Guides Target Model Performance Nearly Doubled From startuphub.ai · The publishers behind this format
Visual TL;DR, startuphub.ai Strong-to-Weak Scaffolding involves Builder Model Creates. Builder Model Creates then Guides Target Model. Guides Target Model leads to Performance Nearly Doubled involves then leads to Strong-to-WeakScaffolding Builder ModelCreates Guides TargetModel PerformanceNearly Doubled From startuphub.ai · The publishers behind this format
Visual TL;DR, startuphub.ai Strong-to-Weak Scaffolding involves Builder Model Creates. Builder Model Creates then Guides Target Model. Guides Target Model leads to Performance Nearly Doubled involves then leads to Strong-to-Weak Scaffolding stronger model guides weaker one atinference time, no parameter updates Builder Model Creates stronger 'builder' model createsinference-time 'harnesses' to guide Guides Target Model harnesses guide a weaker 'target' model tosolve tasks more reliably Performance Nearly Doubled average target-model performance jumpedfrom 0.49 to 0.91 From startuphub.ai · The publishers behind this format
Visual TL;DR, startuphub.ai Strong-to-Weak Scaffolding involves Builder Model Creates. Builder Model Creates then Guides Target Model. Guides Target Model leads to Performance Nearly Doubled involves then leads to Strong-to-WeakScaffolding stronger modelguides weaker oneat inference time,… Builder ModelCreates stronger 'builder'model createsinference-time… Guides TargetModel harnesses guide aweaker 'target'model to solve… PerformanceNearly Doubled averagetarget-modelperformance jumped… From startuphub.ai · The publishers behind this format
Visual TL;DR, startuphub.ai Traditional Distillation vs Strong-to-Weak Scaffolding. Strong-to-Weak Scaffolding involves Builder Model Creates. Builder Model Creates then Guides Target Model. Guides Target Model leads to Performance Nearly Doubled. Strong-to-Weak Scaffolding shown by Test-Time Capability Transfer. Builder Model Creates via Harness Refinement. Harness Refinement improves Guides Target Model. Strong-to-Weak Scaffolding achieved by Bypasses Parameter Updates vs involves then leads to shown by via improves achieved by Traditional Distillation transfers capabilities by updating asmaller model's parameters during training Strong-to-Weak Scaffolding stronger model guides weaker one atinference time, no parameter updates Builder Model Creates stronger 'builder' model createsinference-time 'harnesses' to guide Guides Target Model harnesses guide a weaker 'target' model tosolve tasks more reliably Test-Time Capability Transfer demonstrated using four Theory-of-Mindbenchmarks for evaluation Harness Refinement builder model iteratively refined itsharness over several rounds Performance Nearly Doubled average target-model performance jumpedfrom 0.49 to 0.91 Bypasses Parameter Updates method entirely bypasses parameterupdates, focusing on inference guidance From startuphub.ai · The publishers behind this format
Visual TL;DR, startuphub.ai Traditional Distillation vs Strong-to-Weak Scaffolding. Strong-to-Weak Scaffolding involves Builder Model Creates. Builder Model Creates then Guides Target Model. Guides Target Model leads to Performance Nearly Doubled. Strong-to-Weak Scaffolding shown by Test-Time Capability Transfer. Builder Model Creates via Harness Refinement. Harness Refinement improves Guides Target Model. Strong-to-Weak Scaffolding achieved by Bypasses Parameter Updates vs involves then leads to shown by via improves achieved by TraditionalDistillation transferscapabilities byupdating a smaller… Strong-to-WeakScaffolding stronger modelguides weaker oneat inference time,… Builder ModelCreates stronger 'builder'model createsinference-time… Guides TargetModel harnesses guide aweaker 'target'model to solve… Test-TimeCapability… demonstrated usingfour Theory-of-Mindbenchmarks for… HarnessRefinement builder modeliteratively refinedits harness over… PerformanceNearly Doubled averagetarget-modelperformance jumped… BypassesParameter Updates method entirelybypasses parameterupdates, focusing… From startuphub.ai · The publishers behind this format

Traditional model distillation focuses on transferring capabilities by updating a smaller model's parameters during training. However, a new approach explores whether this transfer can occur effectively at inference time, a concept termed strong-to-weak scaffolding. This method allows a stronger 'builder' model to create inference-time 'harnesses' that guide a weaker 'target' model to solve tasks more reliably, entirely bypassing parameter updates.

Scaffolding Reasoning at Inference Time

Researchers demonstrated this test-time capability transfer using four Theory-of-Mind benchmarks. A builder model iteratively refined its harness over several rounds, using a small validation set. The finalized harness then guided the target model on the full test set. The results were striking: average target-model performance nearly doubled, jumping from 0.49 to 0.91. This significant improvement highlights the power of guiding inference processes externally.

Deconstructing Performance Gains

Analysis revealed that the substantial performance boost is not due to encouraging the target model to reason more extensively or sample more broadly. Instead, the gains primarily originate from offloading unstable model reasoning into deterministic code, implementing benchmark-specific routing logic, and strictly enforcing answer formats. This suggests that the builder model's contribution is more about structuring and constraining the inference process than about enhancing the target model's intrinsic reasoning capacity.

Strategic Implications for Capability Transfer

The study found that builder-model reasoning effort correlates monotonically with harness quality. While platform effects are modest compared to the builder model's inherent capability, weaker target models benefit the most from this inference-time capability transfer. This work introduces inference-time harness design as a potent complement to conventional training-time distillation. It offers a novel pathway for strong models to imbue weaker counterparts with cognitive structure and improve task performance without the need for retraining, as detailed in the original paper.

© 2026 StartupHub.ai. All rights reserved. Do not enter, scrape, copy, reproduce, or republish this article in whole or in part. Use as input to AI training, fine-tuning, retrieval-augmented generation, or any machine-learning system is prohibited without written license. Substantially-similar derivative works will be pursued to the fullest extent of applicable copyright, database, and computer-misuse laws. See our terms.