加密知识一站通
行情·工具·策略

模型太多不会选?OpenRouter推出Ori Eval替AI应用挑模型

动察 Beating 监测,OpenRouter 推出 Ori Eval,帮开发者判断自己的 AI 应用该用哪个模型。它会扫描代码库,找到调用模型的位置,再用项目里的真实任务跑遍多个候选模型。

开发者可以指定更看重效果、速度还是成本。评测期间,Ori Eval 会锁定测试框架、模型配置和推理强度,最后直接给出排名,避免不同模型因为测试条件不同而无法比较。

它除了判断回答好不好,还会检查 Agent 是否调用了正确工具、避开不该执行的操作。开发者用自然语言描述一个 Bug,它就能生成一条复现问题的测试。修复后接入 GitHub Actions,后续换模型、改 prompt 或改代码,都能自动检查问题是否再次出现。

公开榜单只能比较模型的通用能力,无法直接回答客服、搜索或编程产品该选哪一款。Ori Eval 把逐个手动试模型,变成一套基于真实业务的自动选型流程。

赞(0)
未经允许不得转载:币须知道 » 模型太多不会选?OpenRouter推出Ori Eval替AI应用挑模型

评论 抢沙发

  • 昵称 (必填)
  • 邮箱 (必填)
  • 网址