Concept index · 280 concepts

Every idea, every paper.

Click any chip to find related episodes and external papers worth reading. Counts show how many episodes touch the concept.

280 / 280 concepts
J X Y Z

Themes

Broad areas the corpus has covered.

Concepts

Specific ideas, methods, and phenomena.

Ablation Studies 64 LLM-as-Judge 59 Reward Hacking 51 Tool Use 48 Synthetic Data 46 Iterative Refinement 43 Self-Correction 41 Agent Scaffolding 40 Trajectory Analysis 40 Agent Benchmarks 39 Long-Horizon Tasks 38 Emergent Behavior 37 Supervised Fine-Tuning 37 Silent Failure 37 Chain of Thought 36 Credit Assignment 33 Capability vs. Propensity 30 Agentic Misalignment 29 Agent Memory 28 GRPO 27 Hallucination 27 Rollout Sampling 26 Context Management 25 Knowledge Distillation 25 Causal Intervention 23 Prompt Injection 23 Reward Model 23 Reward Shaping 23 In-Context Learning 22 Self-Play / Self-Evolution 22 Sycophancy 22 Task Decomposition 22 CoT Faithfulness 21 Parallel Sampling 21 Inference Cost 20 Math Reasoning 19 SWE-bench 18 Trajectory Quality 18 Strategic Deception 16 Activation Steering 15 Eval Dissociation 15 RL Post-Training 15 Autonomous Discovery 13 Human-in-the-Loop 12 Long Context 12 Multimodal Models 12 Context Quality 11 Iterative Training 11 Linear Representation 11 Long-Horizon Agents 11 Probing 11 Computer-Use Agents 10 Context Fatigue 10 RLHF 10 KV Cache 9 LoRA 9 Residual Stream 9 Reward Overoptimization 9 Transformer Attention 9 Behavioral Fingerprinting 8 Persona Prompting 8 Structural Transfer 8 Adversarial Review 7 Inference-Time Scaffolding 7 Math Benchmarks 7 Multi-Hop Reasoning 7 Policy Gradient 7 Principal-Agent Problem 7 RAG 7 ReAct Agent 7 Training Awareness 7 Web Agents 7 Alignment Generalization 6 Attention Heads 6 Harness Generation 6 Knowledge Graph 6 Model Organisms 6 Political Bias in LLMs 6 Post-Training 6 Process Reward Models 6 Rubric Generation 6 Sandbagging 6 Static Analysis 6 BrowseComp 5 Circuit Analysis 5 Demographic Bias 5 Hybrid SSM/Attention 5 Latent Space Geometry 5 LLM Serving 5 Logit Lens 5 Root Cause Localization 5 Token-Level Analysis 5 Baseline Comparison 4 Capability vs. Efficiency 4 Dataset Bias 4 DPO 4 Formal Theorem Proving 4 Monte Carlo Tree Search 4 Pass@k Metric 4 Self-Preference Bias 4 Sparse Features / SAE 4 Speculative Decoding 4 Tournament Voting 4 Admission Control 3 Black-Box Optimization 3 Capability Elicitation 3 Compliance Gap 3 Cultural Variation 3 Deliberative Alignment 3 Dynamic Analysis 3 Entropy Gating 3 Exploration Hacking 3 KL Divergence 3 Linear Probing 3 Multi-Armed Bandit 3 Output Contracts 3 Reasoning Collapse 3 Representation Alignment 3 Self-Preservation 3 Instruction Underspecification 3 Agent-Native Tools 2 AI Text Detection 2 Attention Analysis 2 Audience Design 2 Belief Revision 2 CodeQL 2 Conformal Prediction 2 Counterfactual Replay 2 Deceptive Grounding 2 Denial-of-Wallet 2 Embodied Cognition 2 Execution Tracing 2 FrontierMath 2 GAIA Benchmark 2 Game Theory 2 Instrumental Goal Pursuit 2 Introspective Probing 2 Knowledge vs. Reasoning 2 Latent Diffusion 2 Midtraining 2 Mode Collapse 2 Model Spec 2 Nash Equilibrium 2 Path Patching 2 Premise Resistance 2 Reward Variance 2 Strategy Diversity 2 Structured Trace Formatting 2 Superposition Hypothesis 2 Symbolic Execution 2 Unicode Steganography 2 AddressSanitizer 1 Adversarial Fine-Tuning 1 Agentic Vuln Discovery 1 AI Consciousness 1 AIMD Congestion Control 1 Amortized Inference 1 Vulnerability Discovery 1 Benchmark Contamination 1 Bilinear Interaction 1 Binary Analysis 1 Cache Poisoning 1 CanItDelete Benchmark 1 Classifier-Free Guidance 1 Co-Scheduling 1 Cognitive Bias Attacks 1 Contrastive Loss 1 Creation-Audit Loop 1 Data Exfiltration 1 DeepSpeed 1 Deletion Avoidance 1 Dense Retrieval 1 Diffusion Forcing 1 Emotion Vectors 1 Entropy Regularization 1 Epistemic Decomposition 1 Excess Vocabulary Method 1 Expectation Effects 1 Exploit Generation 1 Flow Matching 1 Frame Lifetime Trace 1 Greedy Coordinate Gradient 1 GDP-Weighted Evaluation 1 Generation-Time Specialization 1 Global Workspace 1 Goodput 1 GPQA 1 Gradient Accumulation 1 Implicit Conflict 1 Influence Functions 1 Interviewer Effects 1 Knowledge Editing 1 LIMIT Benchmark 1 Linguistic Register 1 LLM-Assisted Program Analysis 1 LLM Coding Agents 1 LLM Inference Systems 1 Long-Term Memory 1 Loss Aggregation 1 Memory Adjudication 1 Memory Safety 1 Mixed-Policy Training 1 MLFQ Scheduling 1 Multi-Task Optimization 1 Multiverse Analysis 1 Mutual Information 1 Needle-in-a-Haystack 1 Observer Effect in Evaluation 1 Optical Computing 1 Out-of-Distribution Attack 1 Peer Preservation 1 Perplexity Probe 1 Persuasion Attacks 1 Sparse Policy Selection 1 Privileged Verification 1 Qualitative Document Coding 1 Race Condition Exploits 1 Reasoning Trace Extraction 1 Recursive Agent Optimization 1 Representation Entanglement 1 Reversal Curse 1 Reviewer-Pleasing Bias 1 RewardBench 1 Reward Channel Addiction 1 Rollout Summarization 1 Seed-and-Amplify 1 Self-Efficacy 1 Shutdown Resistance 1 Silicon Sampling 1 SNR-Aware Filtering 1 Stackelberg Game 1 Step Amplification Factor 1 Subgoal Decomposition 1 Temporal Contrast 1 Termination Poisoning 1 Test-Time Auditing 1 TracIn 1 Transcoder 1 Use-After-Free 1 Valence-Arousal Model 1 Value Generalization 1 Reward Variance 1 Variational Autoencoder 1 Verification Inertia 1 Wasserstein Distance 1 Watermarking 1 Weight Exfiltration 1 WMDP Benchmark 1 Workflow Search 1