DeepSeek向巨头发起挑战:发布开源框架Harness及V4 Pro最终版本

中国实验室DeepSeek再次吸引市场关注,同时推出了两款重要产品。这包括发布Harness v0.1——一款开源的AI代理开发环境,以及旗舰模型V4 Pro的最终版本。这一举措显然旨在加强其在竞争中的优势,与OpenAI和Anthropic等行业巨头一较高下。
关键新品是Harness,它被定位为Anthropic热门工具Claude Code的开放替代品。该框架以MIT许可证分发,并已在GitHub上以预览版形式提供给开发者。本质上,Harness是大型语言模型(LLM)之上的一个轻量层,为代理提供了处理代码库、终端和外部服务的全套工具。这不仅仅是代码生成器,而是一个用于自主执行复杂操作序列的完整环境。
与框架同步,DeepSeek还发布了其V4 Pro模型的最终版本。开发者显著增强了其代理能力,并增加了期待已久的OpenAI Responses API支持。该模型现已在网页版、应用程序和API中提供,为用户提供灵活的推理级别设置:低、高和最大。
代理能力与新的基准测试
DeepSeek押注于“模型+代理外壳”的协同效应,而Harness正是用于测试V4 Pro代理能力的工具。结果令人印象深刻:该模型在Terminal Bench 2.1中得分87.9,在DeepSWE中得分62.7,在Toolathlon-Verified中得分74.1。这些数字展示了模型在推理和与外部工具有效交互、执行长操作链方面的显著进步。
定价策略调整
随着V4 Pro的全面发布,DeepSeek也在调整其定价策略。公司引入了动态定价模型,包括高峰和非高峰时段。在非高峰时段,成本将减半——这是明确旨在吸引开发者并优化基础设施负载的举措。新费率将于8月16日生效。
我的专家观点:Harness的发布不仅仅是又一个开源项目。这是一个战略举措,使DeepSeek能够建立自己的生态系统,不依赖竞争对手的开发成果。强大的V4 Pro模型与灵活开放的框架相结合,可能成为寻求昂贵专有解决方案替代品的开发者的有力论据。AI代理市场正进入激烈竞争阶段,而DeepSeek完全有机会在此占据一席之地。