人工智能 - 超腾开源博客 - 第6页 | AI技术、开发实战与软件资源

本文提供了三道用于测试大模型数学能力的题目,涉及几何、代数及单位换算。题目一为弹跳距离问题,要求根据三次弹跳的比例关系和总距离求首次弹跳的距离;题目二为水果等值换算,通过苹果、梨、橙子、香蕉的兑换关系,计算56个香蕉相当于多少个苹果;题目三为几何表面积计算,已知三棱柱上下底为等腰直角三角形,棱柱高等于斜边,求其表面积。
794
0
发布于2026年5月16日
这篇文章介绍了判断大语言模型水平高低的多种实用方法。首先,可以通过跨语言提问测试其多语言理解和信息一致性。其次,围绕同一主题连续提问可检验模型的上下文理解与逻辑自洽。此外,包含类比和推理的问题能评估其逻辑推断能力,而代码生成与理解任务则考察其对问题的解读。多模态输入测试跨媒体理解,创作类问题检验创造力,情感识别则体现情感理解能力。另一方面,故意制造陷阱可测试错误辨识能力,推理题评估“智商”,选择题检验公平性,润色文字测试表达能力,专业问题则考察垂直领域知识。综合运用这些方法,可以全面评估模型的综合水平。
847
0
发布于2026年5月16日
这篇文章总结了19个用于测试大模型能力的易错问题,分为多步逻辑推理和概念间接关联两类。逻辑推理类问题考察模型对数字关系、平均智商变化、水分含量变化、日期推断、过河难题、代数运算及物理运动等复杂情境的推理准确性,其中一些问题通过调整参数(如蜘蛛腿数量改为青蛙腿或美国州数)或语言变体(如数字表达)来误导模型。概念关联类问题则测试模型对看似无关事物(如香蕉与呕吐、佛罗里达与皱纹)之间隐藏联系的理解能力。这些题目旨在揭示大模型在逻辑连贯性与常识推理上的弱点。
903
0
发布于2026年5月16日
本文提供了一套用于测试AI大模型能力的考题,涵盖语言理解、逻辑推理、常识判断等多个领域。题目包括中文谦辞“哪里哪里”的含义、成语使用正误、双胞胎家庭孩子数量推论、根据天气预报推算星期几、名著常识判断、搬运花瓶破损数量的数学计算、天文学与物理学的错误选项辨别,以及一篇关于周末计划的英语阅读理解。这些题目旨在评估大模型在自然语言处理、逻辑推理和知识应用方面的表现。
1357
0
发布于2026年5月16日
本文提供了一套用于测试大模型能力的实用技巧与题库。测试技巧部分介绍了从跨语言理解、上下文连贯性、逻辑推理、代码生成、多模态输入、创造力、情感识别、陷阱辨识到专业知识的六个维度八种评估方法。题库包含多组测试题:如九个涉及语言理解与常识的考题、十九个易错的逻辑推理与概念关联题、三道数学题(弹跳距离、水果换算、三棱柱表面积),以及三十道涵盖笑话理解到高级逻辑的推理题。这些内容旨在全面评估大模型在自然语言处理、逻辑推理和知识应用上的表现。
2769
0
发布于2026年5月16日
Anthropic公司最新推出的AI编程模型Claude Mythos Preview在SWE-Bench Verified和SWE-Bench Pro两大权威编程基准测试中均位列第一,展现出卓越性能。在SWE-Bench Verified榜单中,它以0.939分领先于第二名Claude Opus 4.7的0.876分;在更复杂的SWE-Bench Pro榜单中,也以0.778分大幅领先。文章同时列举了包括MiniMax、Kimi、Qwen、小米、智谱AI等在内的多个国内主流模型的表现及排名。值得注意的是,Claude Mythos Preview在全部16个涵盖数学、科学、网络安全等多领域的基准测试中均排名第一,但其价格极为昂贵,输出成本是其他领先模型的数十倍。作者指出,虽然榜单成绩不能完全代表实际项目表现,但此类模型的强大能力也同时意味着网络安全风险的门槛可能随之降低。
696
0
发布于2026年4月21日
本文介绍了AI编程中提升效率的关键在于合理使用提示词,并从新项目开发、旧项目维护和实用技巧三方面展开。新项目开发中,通过提示词可一键生成数据库建表脚本、Java三层架构代码、单元测试、前端API及Vue页面等,大幅减少重复劳动。旧项目维护部分涵盖为混乱代码添加注释、框架迁移(如SpringBoot 2升级到3)及快速开发新需求。实用技巧包括数据库语法转换、AI自举定制规则、主动提问澄清需求、生成SVG图标、服务器运维脚本、Figma设计稿转代码及Playwright自动化测试。文章强调AI的核心价值在于将开发者从繁琐编码中解放,聚焦创造性工作。
568
1
发布于2026年3月11日
2026年初,国产AI编程大模型(如GLM-4.5、MiniMax M2.5、Kimi K2.5)在编程能力上已接近国际顶尖模型Claude Opus 4.5,而价格仅为后者的十分之一左右。文章基于SWE-Bench Verified榜单评估了各模型的编程性能,并详细对比了智谱AI、MiniMax、月之暗面、火山引擎、摩尔线程、百度、阿里云、腾讯云等厂商的编程套餐价格、调用限额和可用模型。通过性价比分析,作者建议排除使用受限的Kimi套餐及不支持主流高性能模型(如GLM-5、MiniMax-M2.5)的选项,最终推荐智谱AI、MiniMax、百度智能云、阿里云和腾讯云的套餐,为开发者提供了选择参考。
1713
3
发布于2026年2月13日
本文通过一个复杂的外卖配送调度优化项目,实测了2025年底发布的六款国产大模型(Kimi-K2-0905、DeepSeek-V3.1-Terminus、Doubao-Seed-Code、DeepSeek-V3.2、GLM-4.7、MiniMax-M2.1)的AI编程能力。测试在Trae和CodeBuddy IDE两种环境下进行,使用统一的提示词要求构建包含地图、随机位置生成、路径优化算法及动画演示的完整应用。 测试结果表明,AI编程能力主要取决于大模型本身。GLM-4.7表现最为出色,生成的程序界面美观、动画流畅;MiniMax M2.1和DeepSeek-V3.1-Terminus次之,基本能实现核心功能;DeepSeek-V3.2和Doubao-Seed-Code存在部分缺陷;而Kimi-K2-0905则无法完成有效开发。文章总结认为,国产大模型在复杂编程任务上已具备替代国际顶级模型的潜力,并推荐开发者尝试相关工具进行验证。
1358
1
发布于2025年12月29日
Kiro IDE是亚马逊开发的AI编程工具,基于VSCode二次开发,支持Claude系列等多款大模型,国内用户无需魔法即可使用。但2026年5月后仅支持国内大模型,能力不足,作者不再推荐。相比Cursor,Kiro不支持拖拽文件到对话框,而是通过右键选择文件或复制路径到上下文,会将文件全部内容发送给AI,容易浪费上下文。Kiro支持Vibe和Spec模式、MCP工具、Power功能、Hooks和Steering。企业版积分消耗快,用Claude Opus 4.6三天可耗光1000额度。价格与Cursor相近,免费试用一个月500额度。作者建议优先选Cursor,但对国内用户,Kiro的免魔法登录仍是优势。
4012
1
发布于2025年12月19日