新闻动态
2025-02-04
人类最后一次考试,AI惨败正确率<10%!数百顶级专家联手出题,DeepSeek竟是王者
【新智元导读】AI 模型可能并没有想象中强大。在最新的 AI 基准测试「人类最后一次考试」中,所有顶尖 LLM 通过率不超过 10%,而且模型都表现得过度自信。 捍卫「人类智慧」最后一战 ! 刚刚,Scale AI 和 Center for AI Safety(CAIS)公布了「人类最后一场考试」结果! 新基准全称「人类最后一次考试」(Humanity ’ s Last Exam),简称「HLM」,包含 3000 个问题,由数百位领域专家开发,用于追寻人类知识推理的边界。 目......