准确率-创奇社

刚刚，OpenAI开源BrowseComp，重塑Agent浏览器评测

今天凌晨2点，OpenAI开源了专门用于智能体浏览器功能的测试基准——BrowseComp。这个测试基准非常有难度，OpenAI自己的模型准确率只有0.6%和0.9%，但最新发布的Agent模型Deep Research准确率达...

AIGC开放社区32天前

0110

AI 研究人员提出睡眠时间计算概念，让模型在用户未提出查询时「思考」，以提高大型语言模型的推理效率和准确性。

机器之心21天前

02211