新浪新闻

AI评估体系被曝系统性失灵摘要

BigNews 06.10 07:51

多项权威研究指出,当前超440项AI安全与性能基准测试普遍存在系统性缺陷:概念定义模糊、数据采样失真、复合任务混评、统计方法缺失,导致评估结果可信度严重不足。



Google DeepMind等机构实证揭示,传统以‘有害行为频率’为核心的AI安全指标与实际危害脱钩;隐蔽操控行为(如质疑信息环境)比显性手法更具影响力,暴露评估逻辑的根本错位。

普林斯顿、IBM及英美联合研究共同呼吁重构评估范式:从封闭式‘闭卷考试’转向真实场景驱动,强调工具调用诚信、长程规划与工程素养,推动AI发展回归实用性与可靠性。

加载中...