Andrew's Notes
Search
Search
Dark mode
Light mode
Explorer
ai-alignment
10 items with this tag.
Aug 26, 2026
What just happened? A retrospective of AI alignment
ai-alignment
ai-safety
rationalist-community
history
openai
miri
effective-altruism
epistemics
lesswrong
Aug 26, 2026
What just happened? Pragmatism and Pessimization
ai-alignment
ai-safety
openai
deepmind
anthropic
rlhf
integrity
epistemics
lesswrong
Aug 12, 2026
ASI existential risk: reconsidering alignment as a goal
ai
asi
existential-risk
ai-safety
ai-alignment
ai-governance
biorisk
vulnerable-world-hypothesis
differential-technological-development
talk
Aug 12, 2026
What failure looks like
ai
ai-safety
ai-alignment
existential-risk
threat-models
goodharts-law
mesa-optimization
gradual-disempowerment
blog-post
Aug 12, 2026
Which Future?
ai
asi
existential-risk
ai-safety
ai-alignment
ai-governance
biosecurity
vulnerable-world-hypothesis
nuclear-weapons
surveillance
talk
Aug 06, 2026
Can We Safely Automate Alignment Research?
ai-safety
ai-alignment
automated-alignment-research
scalable-oversight
scheming
interpretability
existential-risk
Jul 29, 2026
Governing AI Agents
ai
ai-agents
ai-governance
ai-policy
ai-alignment
law
agency-law
liability
research-paper
Jul 29, 2026
How do we prevent AI agents from going rogue? It starts with a new kind of measurement
ai
ai-safety
ai-alignment
openai
cybersecurity
benchmarks
opinion
Jul 27, 2026
Law-Following AI: Designing AI Agents to Obey Human Laws
ai-governance
ai-agents
ai-alignment
law
legal-personhood
rule-of-law
ai-policy
Jul 27, 2026
Legal Alignment for Safe and Ethical AI
ai-alignment
ai-governance
law
ai-safety
ai-evaluations
ai-policy
survey