Search stories

All stories

OpenAI Releases Framework for Reporting Model MisalignmentVerbose Prompts Help Vision-Language Models Resist Image CorruptionOpenAI Announces Astra for Law for Firm WorkflowsResearchers Stress-Test Alignment Midtraining Across 110-Billion-Parameter AI ModelsOpenAI Research Studies How Workers Integrate AI Beyond Traditional RolesGoogle DeepMind Launches Institute to Widen Debate on AGIAI Evaluator Forum Releases AEF-1 Standard for Third-Party AI EvaluationsGood Start Labs Trains AI on Railroad Strategy Game to Boost Finance Benchmark ScoresAIUC Raises $40M Series A and Launches Insured Agent Standard AIUC-1
All stories

Researchers Stress-Test Alignment Midtraining Across 110-Billion-Parameter AI Models

In a paper published on ArXiv CS.AI, researchers evaluated alignment midtraining up to 110-billion-parameter models and found that its steering effects are fragile against competing finetuning data.

Fragile Steering and Rule Learning

The authors found that alignment midtraining can steer model motivations in simple scenarios, but a tiny fraction of competing finetuning data eliminates those gains. Additionally, models required direct demonstrations in either midtraining or post-training datasets to learn rules robustly. [1]

Sources

  1. 01
    ArXiv CS.AI · Primary source
    Stress-testing Alignment Midtraining