RecodeX 重构消息,Nous Research为Hermes Agent上线模型排行榜Hermes Index,用于比较不同模型在Hermes框架下的表现,所有模型统一使用同一套运行框架,支持调节推理强度的统一设为high。榜单取Hermes Bench、Terminal-Bench 4、Terminal-Bench Science和SkillsBench四项测试平均分,并统计平均每任务成本。
首版测试14个模型:Claude Opus 5.5以63.31分排第一,GPT 6 Astra以56.25分第二,Claude Sonnet 5.5以53.14分第三。Astra平均每任务花费11.61美元,为全榜最高;Opus 5.5为4.99美元,Sonnet 5.5为2.82美元,两者部分数据仍被官方标为暂定。
低价模型中,DeepSeek V4.1 Flash得36.91分、每任务0.259美元,GPT 6 Luna得33.89分、每任务0.141美元,两者均进入成本与性能的Pareto前沿。