CHEN YUEH HAN

科技人工智能

Anthropic公布自动化AI对齐研究进展 展示自我改进系统潜力

Anthropic日前发布研究论文,展示了一套自动化系统在可靠改进AI对齐性能方面的进展。这项由Anthropic fellow陈悦涵领导的研究,以《自动化研究人员可靠缓解对齐失效》为题,在周五公开发布。该系统在全部10个对齐基准测试中均实现了性能提升,同时不存在整体性能下降的情况。