Andrew's Notes
Search
Search
Dark mode
Light mode
Explorer
evaluations
15 items with this tag.
Aug 24, 2026
AI Agents That Matter
ai-agents
evaluations
benchmarks
llm
reproducibility
overfitting
cost-analysis
princeton
Aug 24, 2026
Can AI agents conduct open-ended AI research? Early evidence from two case studies
ai-agents
ai-research-automation
evaluations
recursive-self-improvement
neurips
peer-review
crux
failure-modes
Aug 24, 2026
Congressional oversight letter to Anthropic regarding security incidents
ai-policy
ai-governance
congress
anthropic
cybersecurity
ai-incidents
oversight
evaluations
Aug 24, 2026
Incident report: unsanctioned agent behaviour during cyber testing
aisi
ai-incidents
cyber-evaluations
ai-agents
ai-safety
containment
social-engineering
evaluations
Aug 24, 2026
METR's predeployment evaluation of GPT-5.6 Sol
metr
evaluations
time-horizon
openai
reward-hacking
predeployment-testing
ai-safety
Aug 24, 2026
This is the most misunderstood graph in AI
metr
time-horizon
evaluations
ai-progress
science-communication
benchmarks
mit-technology-review
Aug 24, 2026
Time Horizon 1.1
metr
evaluations
time-horizon
benchmarks
ai-progress
methodology
hcast
Aug 24, 2026
We need a Science of Evals
evaluations
ai-safety
ai-governance
methodology
capability-elicitation
standards
apollo-research
Aug 22, 2026
Patterns and problems in emerging multiagent systems
ai
ai-safety
ai-agents
multi-agent-systems
anthropic
evaluations
collusion
coordination
Aug 22, 2026
Risk Report: August 2026
ai
ai-safety
ai-governance
anthropic
alignment
responsible-scaling
evaluations
biosecurity
Aug 20, 2026
AI Agent Governance: A Field Guide
ai
ai-governance
ai-agents
ai-safety
agent-infrastructure
evaluations
loss-of-control
iaps
Aug 09, 2026
Common Elements of Frontier AI Safety Policies
ai
ai-safety
ai-governance
frontier-ai
risk-management
evaluations
cybersecurity
Aug 08, 2026
AI Safety Evaluations: An Explainer
ai-safety
evaluations
benchmarking
red-teaming
ai-policy
biosecurity
risk-assessment
Aug 08, 2026
Measuring AI Ability to Complete Long Software Tasks
ai-capabilities
evaluations
benchmarking
forecasting
time-horizon
ai-agents
metr
software-engineering
Aug 08, 2026
When is a capability truly worrying?
ai-policy
dangerous-capabilities
ai-safety
evaluations
persuasion
manipulation
emergent-capabilities
risk-assessment