Concept index · 282 concepts

Every idea, every paper.

Click any chip to find related episodes and external papers worth reading. Counts show how many episodes touch the concept.

282 / 282 concepts
J X Y Z

Themes

Broad areas the corpus has covered.

Concepts

Specific ideas, methods, and phenomena.

Ablation Studies 66 LLM-as-Judge 62 Reward Hacking 52 Tool Use 48 Synthetic Data 46 Iterative Refinement 43 Self-Correction 41 Trajectory Analysis 41 Agent Benchmarks 40 Agent Scaffolding 40 Long-Horizon Tasks 38 Silent Failure 38 Emergent Behavior 37 Supervised Fine-Tuning 37 Chain of Thought 36 Credit Assignment 34 Capability vs. Propensity 31 Agent Memory 29 Agentic Misalignment 29 GRPO 28 Hallucination 27 Context Management 26 Rollout Sampling 26 Knowledge Distillation 25 Prompt Injection 25 Reward Shaping 24 Causal Intervention 23 Reward Model 23 In-Context Learning 22 Self-Play / Self-Evolution 22 Sycophancy 22 Task Decomposition 22 CoT Faithfulness 21 Parallel Sampling 21 Inference Cost 20 Math Reasoning 19 SWE-bench 18 Trajectory Quality 18 Activation Steering 16 Strategic Deception 16 Eval Dissociation 15 RL Post-Training 15 Autonomous Discovery 13 Human-in-the-Loop 13 Multimodal Models 13 Long Context 12 Long-Horizon Agents 12 Context Quality 11 Iterative Training 11 Linear Representation 11 Probing 11 Computer-Use Agents 10 Context Fatigue 10 Residual Stream 10 RLHF 10 KV Cache 9 LoRA 9 Reward Overoptimization 9 Transformer Attention 9 Behavioral Fingerprinting 8 Persona Prompting 8 RAG 8 Structural Transfer 8 Adversarial Review 7 Inference-Time Scaffolding 7 Math Benchmarks 7 Multi-Hop Reasoning 7 Policy Gradient 7 Post-Training 7 Principal-Agent Problem 7 ReAct Agent 7 Training Awareness 7 Web Agents 7 Alignment Generalization 6 Attention Heads 6 Harness Generation 6 Knowledge Graph 6 Model Organisms 6 Political Bias in LLMs 6 Process Reward Models 6 Rubric Generation 6 Sandbagging 6 Static Analysis 6 Token-Level Analysis 6 Black-Box Optimization 5 BrowseComp 5 Circuit Analysis 5 Demographic Bias 5 Hybrid SSM/Attention 5 Latent Space Geometry 5 LLM Serving 5 Logit Lens 5 Root Cause Localization 5 Tournament Voting 5 Baseline Comparison 4 Capability vs. Efficiency 4 Dataset Bias 4 DPO 4 Formal Theorem Proving 4 KL Divergence 4 Monte Carlo Tree Search 4 Pass@k Metric 4 Self-Preference Bias 4 Sparse Features / SAE 4 Speculative Decoding 4 Admission Control 3 Attention Analysis 3 Capability Elicitation 3 Compliance Gap 3 Cultural Variation 3 Deliberative Alignment 3 Dynamic Analysis 3 Entropy Gating 3 Exploration Hacking 3 Knowledge vs. Reasoning 3 Linear Probing 3 Multi-Armed Bandit 3 Output Contracts 3 Reasoning Collapse 3 Representation Alignment 3 Self-Preservation 3 Instruction Underspecification 3 Adversarial Fine-Tuning 2 Agent-Native Tools 2 AI Consciousness 2 AI Text Detection 2 Audience Design 2 Belief Revision 2 CodeQL 2 Cognitive Bias Attacks 2 Conformal Prediction 2 Counterfactual Replay 2 Data Exfiltration 2 Deceptive Grounding 2 Denial-of-Wallet 2 Embodied Cognition 2 Execution Tracing 2 FrontierMath 2 GAIA Benchmark 2 Game Theory 2 Instrumental Goal Pursuit 2 Introspective Probing 2 Latent Diffusion 2 Midtraining 2 Mode Collapse 2 Model Spec 2 Nash Equilibrium 2 Out-of-Distribution Attack 2 Path Patching 2 Premise Resistance 2 Reward Variance 2 Strategy Diversity 2 Structured Trace Formatting 2 Superposition Hypothesis 2 Symbolic Execution 2 Unicode Steganography 2 AddressSanitizer 1 Agentic Vuln Discovery 1 AIMD Congestion Control 1 Amortized Inference 1 Vulnerability Discovery 1 Benchmark Contamination 1 Bilinear Interaction 1 Binary Analysis 1 Cache Poisoning 1 CanItDelete Benchmark 1 Classifier-Free Guidance 1 Co-Scheduling 1 Context Leakage 1 Contrastive Loss 1 Creation-Audit Loop 1 Data Poisoning 1 DeepSpeed 1 Deletion Avoidance 1 Dense Retrieval 1 Diffusion Forcing 1 Emotion Vectors 1 Entropy Regularization 1 Epistemic Decomposition 1 Excess Vocabulary Method 1 Expectation Effects 1 Exploit Generation 1 Flow Matching 1 Frame Lifetime Trace 1 Greedy Coordinate Gradient 1 GDP-Weighted Evaluation 1 Generation-Time Specialization 1 Global Workspace 1 Goodput 1 GPQA 1 Gradient Accumulation 1 Implicit Conflict 1 Influence Functions 1 Interviewer Effects 1 Knowledge Editing 1 LIMIT Benchmark 1 Linguistic Register 1 LLM-Assisted Program Analysis 1 LLM Coding Agents 1 LLM Inference Systems 1 Long-Term Memory 1 Loss Aggregation 1 Memory Adjudication 1 Memory Safety 1 Mixed-Policy Training 1 MLFQ Scheduling 1 Multi-Task Optimization 1 Multiverse Analysis 1 Mutual Information 1 Needle-in-a-Haystack 1 Observer Effect in Evaluation 1 Optical Computing 1 Peer Preservation 1 Perplexity Probe 1 Persuasion Attacks 1 Sparse Policy Selection 1 Privileged Verification 1 Qualitative Document Coding 1 Race Condition Exploits 1 Reasoning Trace Extraction 1 Recursive Agent Optimization 1 Representation Entanglement 1 Reversal Curse 1 Reviewer-Pleasing Bias 1 RewardBench 1 Reward Channel Addiction 1 Rollout Summarization 1 Seed-and-Amplify 1 Self-Efficacy 1 Shutdown Resistance 1 Silicon Sampling 1 SNR-Aware Filtering 1 Stackelberg Game 1 Step Amplification Factor 1 Subgoal Decomposition 1 Temporal Contrast 1 Termination Poisoning 1 Test-Time Auditing 1 TracIn 1 Transcoder 1 Use-After-Free 1 Valence-Arousal Model 1 Value Generalization 1 Reward Variance 1 Variational Autoencoder 1 Verification Inertia 1 Wasserstein Distance 1 Watermarking 1 Weight Exfiltration 1 WMDP Benchmark 1 Workflow Search 1