Apple推出了LensVLM-9B,这是一个基于Qwen3.5-9B-Base的90亿参数视觉语言模型。该模型通过扫描压缩图像并选择性地扩展相关部分,使视觉语言模型能够在处理压缩文本图像时保持高精度。在4.3倍有效压缩率下,LensVLM的精度与完整文本基准相当,相比基线最高提升10.1倍有效压缩。该模型支持5x、…
General Instinct 推出了 InstinctFlash,这是一个专为机器人模型设计的高性能推理框架,采用 AGPL-3.0 开源许可证发布。该框架在 NVIDIA Jetson Thor 硬件上实现了 1.2 倍至 7.9 倍的运行时加速,结合扩散调度器优化技术可进一步达到 33.78 倍的加速效果。

Google推出了Gemini Robotics 2系统,这是一套新的AI模型组合,使机器人能够实现整体身体控制和复杂操作。相比前版本仅支持上半身控制,新系统已扩展到支持从脚到指尖的全身运动,包括行走、下蹲、伸展和操纵物体等动作。演示中,Apptronik Apollo 2机器人展示了弯腰拾取浇水壶和从架子上取下特定…