模型可解释性

科技人工智能

Base Labs与Hugging Face、Goodfire AI启动开源AI模型安全合作

Baseten旗下研究部门Base Labs与Hugging Face和Goodfire AI达成合作,共同建立开权重AI模型的安全基础设施标准。该伙伴关系旨在开发针对开权重模型的安全评估和监测方法,以应对日益严重的模型安全威胁。根据统计,Hugging Face平台目前托管着超过6000个被移除安全防护的模型。

科技人工智能

从雅可比空间提取转向向量

研究者探索了从概念词元在雅可比空间(J space)中反演通用激活转向向量的方法。J space被定义为激活层L到非嵌入矩阵之间的线性映射。在Qwen3-1.7B模型上的实验中,研究人员采用了一套系统化的算法流程:收集20至30个相关词元、随机抽取其中5个词元用于计算激活向量、重复此过程后对结果取平均,最终得到转向向…

科技人工智能

OpenAI发布Astra模型,因不透明设计引发争议

OpenAI周四推出最新AI模型Astra,称其为公司迄今最强大且对齐度最高的模型。该模型将首先向Daybreak网络安全项目用户开放,随后一周内扩展至OpenAI的Pro、Plus、Enterprise、Business付费计划以及API调用服务。在代码相关基准测试中,Astra的表现超越了OpenAI自有模型So…