研究人员对TypeSafe AI推出的分类器模型Jev的概率校准准确性进行了系统评估。该研究通过涵盖10种物理分布、采用5个提示模板、每个模板包含20种变化的1000个测试用例来衡量模型性能。评估结果显示,Jev的总变差(TV)评分为0.518,仅略优于完全随机猜测的0.546,而在均匀分布上的表现尤为糟糕,TV评分…