Anthropic¶
AI 安全和研究公司。 Claude 的创造者。
核心特征¶
- 由前 OpenAI 员工 Dario Amodei 和 Daniela Amodei 于 2021 年创立
- 专注 AI 安全 和 可解释性(interpretability)
- 有自己的可解释性研究团队(transformer-circuits.pub)
- 产品:Claude 系列模型(Haiku/Sonnet/Opus)
- 训练理念:Constitutional AI(宪法 AI)
关键可解释性研究成果¶
- 2024 — Scaling Monosemanticity(稀疏自编码器)
- 2025 — Circuit Tracing(电路追踪)、On the Biology of a Large Language Model
- 2026 — Global Workspace(J-space/Jacobian Lens)、Natural Language Autoencoders