
Stanford University +1
Professor of Computer Science
Field
50 researchers working in Interpretability.

Stanford University +1
Professor of Computer Science

Technische Universität Berlin
Full Professor and Chair

Anthropic
Co-founder
OpenAI
Research Scientist

Brown University
Postdoctoral Researcher
OpenAI
Member of Technical Staff
Alignment Research Center
VP of Research
Duke University
Professor

Apical Intelligence +1
Distinguished Scientist
Google DeepMind
Senior Staff Research Scientist
Brown University +1
Assistant Professor
Google DeepMind
Senior Software Engineer

Google DeepMind
Senior Research Scientist

Cohere
Co-founder

Anthropic
Member of Technical Staff

Thinking Machines Lab
Member of Technical Staff
Anthropic
Research Scientist
Anthropic
Interpretability Team Manager
Anthropic
Researcher, Alignment

MIT CSAIL
Associate Professor

Independent
Boston University
Assistant Professor of Computer Science
Anthropic
Black Forest Labs
Researcher

Redwood Research
Member of Technical Staff
Anthropic
Member of Technical Staff, Alignment Science
Apollo Research
Co-founder and CEO

Google DeepMind
Research Engineer
NVIDIA
Principal Research Scientist
Meta
AI Safety Research Engineer
Goodfire
Co-founder and Chief Scientist
Resolution
Co-founder
EleutherAI
Head of Interpretability

BlueDot Impact
Program Lead

METR
Member of Technical Staff
OpenAI
Member of Technical Staff
Alignment Research Center
Researcher
Goodfire
Co-founder and CEO
Anthropic
Member of Technical Staff
Anthropic +1
Member of Technical Staff
MIT
Associate Professor
Anthropic
Research Engineer
Alignment Research Center
Researcher
MIT
Associate Professor
Anthropic
Member of Technical Staff
University of Zurich
Associate Professor
Anthropic
Member of Technical Staff
University of Toronto +2
Associate Professor and Schwartz Reisman Chair in Technology and Society
Thinking Machines Lab
Researcher
AISLE
Founder and Chief Scientist