其模型排名被几乎每次新品报道引用的Artificial Analysis,于8月13日发布了Optima。这是一项自助服务,让你用自己的材料搭建基准测试,而不是去读别人的榜单。你可以提供一个数据集,或从Arize、Braintrust、Langfuse等工具导入真实的智能体调用轨迹,或干脆用大白话描述你的使用场景;系统会让候选模型在其上运行,并采用该公司公开基准所用的同一套成对评判方法打分。每次运行都会在质量分数旁列出单任务成本和单任务耗时,你自己的智能体栈也可以通过HTTP加入同一场比较。定价按用量计费,无需订阅。公司把目标说得很直白:为你的任务找到最好的模型,或者找到一个同样好、成本或耗时约为十分之一的替代品。发布前的测试者把它用于为金融智能体挑选足够便宜的模型、匹配某事务所的法律写作风格、以及整理自定义图像集等场景。