Benzi是一款代码智能工具,在SWE-bench Verified基准测试中展示了其性能表现。该工具在500个真实GitHub问题的测试中解决了78.2%,单个问题的处理成本低于10美分。测试涵盖了24个GitHub issues和10种编程语言,对标对象包括Claude Code和CodeGraph等代码智能方案。
Poolside发布了Laguna S 2.1模型,这是一个118B总参数的混合专家模型,其中8B参数在推理时处于激活状态,支持100万token的上下文窗口 。该模型从训练开始到发布仅耗时不到9周 。