Skip to content

Anthropic

AI 安全和研究公司。 Claude 的创造者。

核心特征

  • 由前 OpenAI 员工 Dario Amodei 和 Daniela Amodei 于 2021 年创立
  • 专注 AI 安全可解释性(interpretability)
  • 有自己的可解释性研究团队(transformer-circuits.pub)
  • 产品:Claude 系列模型(Haiku/Sonnet/Opus)
  • 训练理念:Constitutional AI(宪法 AI)

关键可解释性研究成果

  • 2024 — Scaling Monosemanticity(稀疏自编码器)
  • 2025 — Circuit Tracing(电路追踪)、On the Biology of a Large Language Model
  • 2026 — Global Workspace(J-space/Jacobian Lens)、Natural Language Autoencoders