
Anthropic 开源“思维追踪”工具,可视化揭秘 AI 内部逻辑

CircuitTracer已在GitHub平台以开源库形式发布,研究者可通过由DecodeResearch运营的Neuronpedia平台,使用交互式前端查看“归因图”。
用户使用该工具,不仅能生成自定义的归因图,追踪支持模型的内部逻辑,还能对图形进行标注、分享,甚至通过调整特征值观察模型输出的变化,从而验证研究假设。Anthropic表示,当前对AI内部结构的理解远远落后于其功能进步。开源这些工具将助力更广泛的社区深入探究语言模型的内部运作,理解模型行为,并为工具的改进和扩展提供可能。
附上参考地址