[Github] ClawWork – AI Agent 经济任务评测框架

Github发现2026-03-05发布 WarpEdit
222 0 0

引言

AI Agent 到底能创造多少价值?光说能力没用,得看它能不能在真实环境里赚到钱。

香港大学开源了一个很有意思的项目 ClawWork,用带有任务报酬和调用成本的实验环境评估 AI Agent。每个 Agent 只有 10 美元启动资金,每次调用 LLM 都要扣费,必须通过完成任务赚钱才能活下去。

这可能是最硬核的 AI 能力测试了。

项目状态(截至 2026-07-13):仓库 HKUDS/ClawWork 当前约有 8,227 Stars、1,055 Forks,默认分支为 main,许可证/授权说明为 MIT,最近一次推送日期为 2026-03-03,仓库未归档。数据会持续变化,使用前请查看 README、Releases、提交记录和 LICENSE 原文。

ClawWork 项目

项目简介

ClawWork 是一个 AI Agent 经济测试框架,核心思路很简单:让 Agent 在预设任务、成本和报酬规则下独立完成工作。

每个 AI 代理只有 10 美元启动资金,每次调用 LLM 都要扣费。如果钱花光了还没赚到更多,那这个 Agent 就”饿死”了。

项目涵盖了 220 个真实职业任务,覆盖 44 个经济领域,包括技术工程、商业金融、医疗社会服务等。支付系统是基于美国劳工统计局的时薪数据算的,单个任务价值从 82 美元到 5000 美元不等。

开源地址: https://github.com/HKUDS/ClawWork

核心特性

真实经济环境

任务定价参考就业市场数据,但这仍是研究评测环境,不代表 Agent 已在公开劳动力市场实际接单或获得同等收入。

项目报告的实验结果

根据测试数据,表现最好的 Agent 可以实现 每小时 1500 美元以上的等效收入。这个数字已经超过一般白领的生产力了。

实时仪表盘

项目自带一个实时 React 仪表盘,可以直观看到余额变化、任务完成情况等数据。运行过程中每一步都清清楚楚。

如何运行

本地运行很简单:

  1. 克隆仓库
  2. 创建 Python 3.10 环境
  3. 运行启动脚本

运行前仍需按 README 配置 Python 环境、模型凭据和相关依赖。

总结

ClawWork 适合以下场景:

  • 评估不同 AI Agent 的实际盈利能力
  • 研究 AI Agent 在真实经济环境中的行为模式
  • 测试和优化你的 AI Agent 策略

它适合研究任务完成质量、调用成本和策略之间的关系,结果应结合评测设置解读。

© 版权声明

相关文章

暂无评论

none
暂无评论...