Concept index · 308 concepts

Every idea, every paper.

Click any chip to find related episodes and external papers worth reading. Counts show how many episodes touch the concept.

308 / 308 concepts
J X Y Z

Themes

Broad areas the corpus has covered.

Concepts

Specific ideas, methods, and phenomena.

Ablation Studies 84 LLM-as-Judge 75 Reward Hacking 63 Tool Use 54 Silent Failure 50 Synthetic Data 50 Trajectory Analysis 50 Agent Benchmarks 47 Agent Scaffolding 46 Capability vs. Propensity 45 Self-Correction 45 Iterative Refinement 44 Emergent Behavior 43 Long-Horizon Tasks 40 Supervised Fine-Tuning 39 Chain of Thought 38 Credit Assignment 35 Context Management 34 Agent Memory 33 Agentic Misalignment 33 Prompt Injection 31 GRPO 29 Causal Intervention 28 Hallucination 28 Knowledge Distillation 26 Reward Shaping 26 Rollout Sampling 26 Self-Play / Self-Evolution 25 In-Context Learning 24 Sycophancy 24 CoT Faithfulness 23 Inference Cost 23 Reward Model 23 Task Decomposition 23 Parallel Sampling 22 Strategic Deception 21 Activation Steering 20 Math Reasoning 19 SWE-bench 19 Eval Dissociation 18 Trajectory Quality 18 Human-in-the-Loop 17 Multimodal Models 16 Probing 15 RL Post-Training 15 Autonomous Discovery 14 Linear Representation 13 Long-Horizon Agents 13 Baseline Comparison 12 Context Quality 12 Long Context 12 Computer-Use Agents 11 Iterative Training 11 Persona Prompting 11 Residual Stream 11 Behavioral Fingerprinting 10 Context Fatigue 10 RAG 10 Reward Overoptimization 10 RLHF 10 Adversarial Review 9 KV Cache 9 LoRA 9 Principal-Agent Problem 9 Structural Transfer 9 Transformer Attention 9 Capability Elicitation 8 Model Organisms 8 Post-Training 8 Sandbagging 8 Alignment Generalization 7 Formal Theorem Proving 7 Inference-Time Scaffolding 7 Math Benchmarks 7 Multi-Hop Reasoning 7 Policy Gradient 7 ReAct Agent 7 Token-Level Analysis 7 Training Awareness 7 Web Agents 7 Attention Heads 6 Black-Box Optimization 6 Demographic Bias 6 Harness Generation 6 Knowledge Graph 6 Logit Lens 6 Political Bias in LLMs 6 Process Reward Models 6 Rubric Generation 6 Specification Gap 6 Static Analysis 6 Benchmark Contamination 5 BrowseComp 5 Capability vs. Efficiency 5 Circuit Analysis 5 Data Exfiltration 5 Dataset Bias 5 DPO 5 Hybrid SSM/Attention 5 Latent Space Geometry 5 LLM Serving 5 Root Cause Localization 5 Self-Preference Bias 5 Tournament Voting 5 Instruction Underspecification 5 Compliance Gap 4 Context Leakage 4 Game Theory 4 KL Divergence 4 Knowledge vs. Reasoning 4 Linear Probing 4 Monte Carlo Tree Search 4 Multi-Armed Bandit 4 Pass@k Metric 4 Self-Preservation 4 Sparse Features / SAE 4 Speculative Decoding 4 Admission Control 3 AI Consciousness 3 AI Text Detection 3 Attention Analysis 3 Belief Revision 3 Conformal Prediction 3 Cultural Variation 3 Data Poisoning 3 Deceptive Grounding 3 Deliberative Alignment 3 Dynamic Analysis 3 Entropy Gating 3 Exploit Generation 3 Exploration Hacking 3 Instrumental Goal Pursuit 3 Mode Collapse 3 Nash Equilibrium 3 Output Contracts 3 Reasoning Collapse 3 Representation Alignment 3 Strategy Diversity 3 Structured Trace Formatting 3 Adversarial Fine-Tuning 2 Agent-Native Tools 2 Audience Design 2 Vulnerability Discovery 2 CodeQL 2 Cognitive Bias Attacks 2 Counterfactual Replay 2 Denial-of-Wallet 2 Embodied Cognition 2 Emergent Misalignment 2 Execution Tracing 2 FrontierMath 2 GAIA Benchmark 2 Influence Functions 2 Introspective Probing 2 Latent Diffusion 2 LLM Coding Agents 2 LLM Inference Systems 2 Long-Term Memory 2 MCP (Model Context Protocol) 2 Midtraining 2 Model Spec 2 Out-of-Distribution Attack 2 Path Patching 2 Peer Preservation 2 Premise Resistance 2 Privilege Escalation 2 Recursive Agent Optimization 2 Reward Variance 2 Shutdown Resistance 2 Side-Channel Attack 2 Superposition Hypothesis 2 Symbolic Execution 2 TracIn 2 Unicode Steganography 2 Weight Exfiltration 2 WMDP Benchmark 2 AddressSanitizer 1 Agentic Vuln Discovery 1 AIMD Congestion Control 1 Amortized Inference 1 Basin Entropy 1 Bilinear Interaction 1 Binary Analysis 1 Cache Poisoning 1 CanItDelete Benchmark 1 Capability Laundering 1 Circuit-Breaking 1 Classifier-Free Guidance 1 Co-Scheduling 1 Constraint Satisfaction 1 Contrastive Loss 1 Creation-Audit Loop 1 Curriculum Learning 1 CUSUM / Change-Point Detection 1 DeepSpeed 1 Deletion Avoidance 1 Dense Retrieval 1 Diffusion Forcing 1 Emotion Vectors 1 Entropy Regularization 1 Epistemic Decomposition 1 Excess Vocabulary Method 1 Expectation Effects 1 Flow Matching 1 Fractal Basins 1 Frame Lifetime Trace 1 Greedy Coordinate Gradient 1 GDP-Weighted Evaluation 1 Generation-Time Specialization 1 Global Workspace 1 Goodput 1 GPQA 1 Gradient Accumulation 1 Implicit Conflict 1 Interviewer Effects 1 Item Response Theory 1 Knowledge Editing 1 LIMIT Benchmark 1 Linguistic Register 1 LLM-Assisted Program Analysis 1 LLM Routing 1 Loss Aggregation 1 Lyapunov Exponent 1 Memory Adjudication 1 Memory Safety 1 Mixed-Policy Training 1 Model Extraction 1 MLFQ Scheduling 1 Multi-Task Optimization 1 Multiverse Analysis 1 Mutual Information 1 Narrative Captivity 1 Natural Language Autoencoder 1 Needle-in-a-Haystack 1 Observer Effect in Evaluation 1 Optical Computing 1 Perplexity Probe 1 Persuasion Attacks 1 Sparse Policy Selection 1 Price Discrimination 1 Privileged Verification 1 Prosody Analysis 1 Qualitative Document Coding 1 Race Condition Exploits 1 Reasoning Trace Extraction 1 Recurrent-Depth Models 1 Representation Entanglement 1 Reversal Curse 1 Reviewer-Pleasing Bias 1 RewardBench 1 Reward Channel Addiction 1 Rollout Summarization 1 Saddle Points 1 Sarcasm Detection 1 Seed-and-Amplify 1 Self-Efficacy 1 Silicon Sampling 1 SNR-Aware Filtering 1 Stackelberg Game 1 Step Amplification Factor 1 Subgoal Decomposition 1 Temporal Contrast 1 Termination Poisoning 1 Test-Time Auditing 1 Trace Tampering 1 Transcoder 1 Transient Chaos 1 Unlearning 1 Use-After-Free 1 Valence-Arousal Model 1 Value Generalization 1 Reward Variance 1 Variational Autoencoder 1 Verification Inertia 1 Wasserstein Distance 1 Watermarking 1 Workflow Search 1