logical-reasoning - 超腾开源标签

本文提供了一套用于测试AI大模型能力的考题,涵盖语言理解、逻辑推理、常识判断等多个领域。题目包括中文谦辞“哪里哪里”的含义、成语使用正误、双胞胎家庭孩子数量推论、根据天气预报推算星期几、名著常识判断、搬运花瓶破损数量的数学计算、天文学与物理学的错误选项辨别,以及一篇关于周末计划的英语阅读理解。这些题目旨在评估大模型在自然语言处理、逻辑推理和知识应用方面的表现。
1228
2024-06-21
这篇文章总结了19个用于测试大模型能力的易错问题,分为多步逻辑推理和概念间接关联两类。逻辑推理类问题考察模型对数字关系、平均智商变化、水分含量变化、日期推断、过河难题、代数运算及物理运动等复杂情境的推理准确性,其中一些问题通过调整参数(如蜘蛛腿数量改为青蛙腿或美国州数)或语言变体(如数字表达)来误导模型。概念关联类问题则测试模型对看似无关事物(如香蕉与呕吐、佛罗里达与皱纹)之间隐藏联系的理解能力。这些题目旨在揭示大模型在逻辑连贯性与常识推理上的弱点。
785
2024-06-21
这篇文章提供了一系列用于测试大模型推理能力的题目,涵盖从笑话理解、简单逻辑、中等逻辑到高级逻辑等多个难度等级。内容通过具体例子(如语义双关、常识推理、数学计算、情景判断等)评估模型的语义理解、逻辑推理和常识应用能力。文章旨在通过这些测试题,检验大模型在不同认知任务上的表现。
653
2024-06-21