Folia
← 返回头版

TypeSafe AI的Jev模型概率校准能力有限

研究人员对TypeSafe AI推出的分类器模型Jev的概率校准准确性进行了系统评估1。该研究通过涵盖10种物理分布、采用5个提示模板、每个模板包含20种变化的1000个测试用例来衡量模型性能1。评估结果显示,Jev的总变差(TV)评分为0.518,仅略优于完全随机猜测的0.546,而在均匀分布上的表现尤为糟糕,TV评分达到0.77,远高于随机基准的0.391。

尽管Jev能以极高准确率识别正确的分布类型,但在概率分配的精细度上存在明显缺陷1。该模型倾向于过度集中概率质量(mode-seeking行为),同时在尾部区间不合理地分配非零权重1。此外,Jev在多步算术运算上表现明显下降,但在单步计算(如平方根)上相对较好,反映出其缺乏链式思维能力1。在Gamma分布的识别上,Jev出现误分类,将其识别为指数分布1。


评论