Folia
← 返回头版

Cactus Needle 3:8-29MB超小模型性能媲美DeepSeek V4 Flash

Cactus团队发布了Needle 3自动化模型,这是一款参数量在25至121百万之间、经2-bit量化后仅8-29MB的超小型语言模型1。该模型采用了Monarch Hadamard MLP等创新架构设计,支持工具调用和结构化JSON输出功能1。在Mobile Actions基准测试中,20层模型达到86.0分的性能表现1。

Needle 3展现出了出色的边缘设备适配能力1。在Raspberry Pi 5上,该模型的解码速度最高可达4k tokens/sec,预填充速度达到10k tokens/sec1。模型支持英语、法语、西班牙语、德语、荷兰语、意大利语和波兰语等7种语言1,并兼容包括macOS、Linux(x86-64、ARM64、ARMv7、RISC-V、MIPS32)、Windows、Android、iOS、watchOS、tvOS、浏览器WebAssembly和WASI组件在内的多个平台部署1。


评论