Topic · 29 episodes across 11 reviews
Inside the Model: Sycophancy, Emotion, and Bias
Three papers looked beneath model behavior — finding a sycophancy circuit that survives alignment, emotion vectors that causally drive misbehavior, and political-bias audits that may be measuring the wrong thing entirely.
Covered in these reviews
- AI Papers Week in Review: July 7–13, 2026
- AI Papers Week in Review: June 29–July 5, 2026
- AI Papers Month in Review: June 2026
- AI Papers Week in Review: June 22–28, 2026
- AI Papers Week in Review: June 15–21, 2026
- AI Papers Week in Review: May 25–31, 2026
- AI Papers Month in Review: May 2026
- AI Papers Week in Review: May 18–24, 2026
- AI Papers Week in Review: May 11–17, 2026
- AI Papers Week in Review: May 4–10, 2026
- AI Papers Week in Review: April 27–May 3, 2026