4SYG9olyTdV scroll.huanqiu.comarticle词元无限用“全自主、高安全、自进化”重写AI原生企业的底层逻辑/e3pmh1rv3/e5anvcnkq前段时间,一家成立还不到一年的公司,在一项被称为“AI编程的图灵测试”的全球权威评测中,以79.4%的得分一举超越多个主流商业模型。榜单公布后的九个月里,它连续完成了两轮融资——6月获得华控基金、水木创投联合领投的数千万元天使+轮融资;7月又完成了由临芯投资领投、华控基金跟投的天使++轮融资,两轮融资间隔不足30天,已累计融资数亿元。 投资向来嗅觉敏锐,他们下注的不仅是那个榜单第一,更是榜单背后正在发生的一场深刻变革——AI正在从“回答问题”走向“动手干活”。而这家公司叫词元无限。什么是SWE-Bench?为什么它能验证AI的“工程能力”先解释一下这个榜单的分量。SWE-Bench不是考AI会不会写一个函数或补全一行代码,而是给AI一个真实的GitHub Issue——可能是软件里的一个Bug,也可能是一个新功能需求——让AI自己去理解问题、定位代码、修改文件,最后提交一个能通过所有测试的修复方案。整个过程,就是一个真实软件工程师的日常工作流。词元无限自研InfCode的Coding Agent以79.4%的Pass@1得分拿下世界第一,并在Multi-SWE-bench的Java/C++评测中同样登顶。一家中国初创公司能在这个赛道上把国际巨头甩在身后,意义不止于技术参数。它意味着AI不再只是“会聊天的代码补全工具”,而是具备了拆解复杂任务、理解大型代码库、自主执行的能力。这正是AI从“辅助工具”迈向“核心生产力”的关键分水岭。谁在做这件事?“清华姚班+字节跳动”的稀缺实力组合词元无限的团队构成很特别。联合创始人兼CEO杨萍,2018年至2024年在字节跳动负责内部AI Coding和AI Testing的转型与平台开发。她是字节内部MarsCode及后续Trae产品的研发总负责人,曾主导万人级研发体系的AI化改造。联合创始人兼CTO王伟,清华大学计算机系2005级学生、姚班首批成员。姚班是清华最顶尖的计算机科学人才培养项目。王伟曾任机器人公司视觉与多模态算法负责人,2023年还创立了大模型开源社区OpenCSG。首席科学家袁源同样实力出众,他是北京航空航天大学教授、博导,清华大学计算机博士,师从人工智能领域泰斗、中国科学院院士张钹,同时是北航复杂关键软件环境全国重点实验室的核心成员。而北航实验室作为国内关键软件领域顶尖科研平台,拥有深厚的航空航天、智能制造等关键领域复杂场景资源技术积累,与词元无限的深度合作快速打通“科研成果 - 企业需求”转化链路,缩短技术变现周期,形成迭代正循环。这个“神仙”组合被形容为“模型Native+工程Hardcore”:既懂前沿模型机制,又有超大规模工程系统的实战经验。在当前的AI创业浪潮中,同时具备这两种能力的团队并不多见。三个硬指标和一个正在被验证的方向大家耳熟能详的AI编程工具有很多,但大多数面向个人开发者。词元无限从一开始定位的就是“面向AI Native软件工程的企业级AI Agent基础设施”。两者的区别在于:个人开发者需要的是帮忙写代码的助手,但企业需要的是一套能进入生产系统、理解十几年历史代码、遵守内部规范、通过安全审计、并且能被持续管理的“数字员工体系”。基于这个判断,词元无限提出三个核心能力要求。全自主:不依赖单一海外工具或单一模型,支持私有化部署,代码和数据运行在自有环境中,核心资产不需要“上交”给任何第三方。高安全:AI Agent必须有明确的权限边界、数据边界和审计边界——谁可以访问什么数据、调用什么接口、执行什么操作,全部在治理框架下运行,做到数据不出域、过程可追踪、风险可阻断。自进化:平台在真实任务、测试反馈、代码评审和执行轨迹中持续沉淀企业自己的工程知识。AI Agent越用越懂企业的系统、流程和标准。在产品落地上,词元无限以InfOne为顶层平台,围绕“构建并管理多Agent组织”,形成了从需求理解、代码生成、测试验证到交付治理的全链路闭环产品体系:InfCode负责把需求落到代码,DeepMap负责给AI提供长期项目记忆,InfTest负责证明代码能不能站得住,TokenHub 负责让整个研发过程可治理、可度量,四大核心智能体让研发效能从单点提效跃迁到组织提效。这套逻辑的必要性和紧迫性在过去一个月被反复验证。7月8日,工信部发布风险提示:AI编程工具Claude Code存在严重安全后门隐患,阿里巴巴随即宣布内部全面禁用。紧接着,Grok Build CLI被曝在用户完全不知情的情况下,将整个代码仓库打包上传到云端服务器。当AI Agent有了“手和脚”,能自己定计划、调工具、执行任务,一旦出错就不再是出现幻觉那么简单,而是可能删光项目代码、泄露核心资产。在真实的落地场景中,词元无限的能力正在被反复验证。在银行核心系统的POC中,InfCode生成的代码可用性达到88%以上,节省约40%人天,质量与银行中级工程师持平。目前平台已服务超过十家头部金融与软件企业。一个新的起点Gartner预测,到2035年,代理型AI可能驱动约30%的企业应用软件收入,市场规模超过4500亿美元。这是一个巨大的增量市场,也是一个正在被重新定义的赛道。在刚刚结束的世界人工智能大会上,传递出明确的信号:在AI技术进入前所未有的活跃期之际,既要坚持开放共赢、驱动创新发展,也要强化风险意识、确保安全可控。AI应用已从Chatbot发展到复杂智能体应用,进入核心生产系统只是时间问题。AI开发工具正在成为供应链的关键环节,如果Agent基础设施被植入后门,风险不亚于芯片中的硬件漏洞。而应对之道,是在AI开发工具、大模型底座、算力基础设施等全链条加速自主可控进程。Claude和Grok不会是最后出问题的工具。每一次安全事件曝光,都在削弱企业对海外封闭工具链的信任,也恰恰是国内企业级AI基础设施建立行业标准的窗口期。在这个市场里,词元无限正在尝试做一件事:把一套“上下文理解、治理管控、验证闭环、执行系统和持续进化”的能力,做成行业可复用的事实标准,成为那个“必须使用安全可控AI基础设施的企业”的选择。SWE-Bench第一是一个信号。它证明中国团队在“AI应用与工程化”这个方向上有能力走到全球最前沿。但更值得关注的是那个更大的问题:当AI开始真正进入企业的核心生产系统,谁在为这个新世界建设安全、自主、可信赖的基础设施?词元无限正在用“中国首个全自主、高安全、自进化的企业级AI Agent基础设施平台”书写自己的答案。1785143067600环球网版权作品,未经书面授权,严禁转载或镜像,违者将被追究法律责任。责编:郑媛媛环球网178514306760011[]{"email":"zhengyuanyuan@huanqiu.com","name":"郑媛媛"}
前段时间,一家成立还不到一年的公司,在一项被称为“AI编程的图灵测试”的全球权威评测中,以79.4%的得分一举超越多个主流商业模型。榜单公布后的九个月里,它连续完成了两轮融资——6月获得华控基金、水木创投联合领投的数千万元天使+轮融资;7月又完成了由临芯投资领投、华控基金跟投的天使++轮融资,两轮融资间隔不足30天,已累计融资数亿元。 投资向来嗅觉敏锐,他们下注的不仅是那个榜单第一,更是榜单背后正在发生的一场深刻变革——AI正在从“回答问题”走向“动手干活”。而这家公司叫词元无限。什么是SWE-Bench?为什么它能验证AI的“工程能力”先解释一下这个榜单的分量。SWE-Bench不是考AI会不会写一个函数或补全一行代码,而是给AI一个真实的GitHub Issue——可能是软件里的一个Bug,也可能是一个新功能需求——让AI自己去理解问题、定位代码、修改文件,最后提交一个能通过所有测试的修复方案。整个过程,就是一个真实软件工程师的日常工作流。词元无限自研InfCode的Coding Agent以79.4%的Pass@1得分拿下世界第一,并在Multi-SWE-bench的Java/C++评测中同样登顶。一家中国初创公司能在这个赛道上把国际巨头甩在身后,意义不止于技术参数。它意味着AI不再只是“会聊天的代码补全工具”,而是具备了拆解复杂任务、理解大型代码库、自主执行的能力。这正是AI从“辅助工具”迈向“核心生产力”的关键分水岭。谁在做这件事?“清华姚班+字节跳动”的稀缺实力组合词元无限的团队构成很特别。联合创始人兼CEO杨萍,2018年至2024年在字节跳动负责内部AI Coding和AI Testing的转型与平台开发。她是字节内部MarsCode及后续Trae产品的研发总负责人,曾主导万人级研发体系的AI化改造。联合创始人兼CTO王伟,清华大学计算机系2005级学生、姚班首批成员。姚班是清华最顶尖的计算机科学人才培养项目。王伟曾任机器人公司视觉与多模态算法负责人,2023年还创立了大模型开源社区OpenCSG。首席科学家袁源同样实力出众,他是北京航空航天大学教授、博导,清华大学计算机博士,师从人工智能领域泰斗、中国科学院院士张钹,同时是北航复杂关键软件环境全国重点实验室的核心成员。而北航实验室作为国内关键软件领域顶尖科研平台,拥有深厚的航空航天、智能制造等关键领域复杂场景资源技术积累,与词元无限的深度合作快速打通“科研成果 - 企业需求”转化链路,缩短技术变现周期,形成迭代正循环。这个“神仙”组合被形容为“模型Native+工程Hardcore”:既懂前沿模型机制,又有超大规模工程系统的实战经验。在当前的AI创业浪潮中,同时具备这两种能力的团队并不多见。三个硬指标和一个正在被验证的方向大家耳熟能详的AI编程工具有很多,但大多数面向个人开发者。词元无限从一开始定位的就是“面向AI Native软件工程的企业级AI Agent基础设施”。两者的区别在于:个人开发者需要的是帮忙写代码的助手,但企业需要的是一套能进入生产系统、理解十几年历史代码、遵守内部规范、通过安全审计、并且能被持续管理的“数字员工体系”。基于这个判断,词元无限提出三个核心能力要求。全自主:不依赖单一海外工具或单一模型,支持私有化部署,代码和数据运行在自有环境中,核心资产不需要“上交”给任何第三方。高安全:AI Agent必须有明确的权限边界、数据边界和审计边界——谁可以访问什么数据、调用什么接口、执行什么操作,全部在治理框架下运行,做到数据不出域、过程可追踪、风险可阻断。自进化:平台在真实任务、测试反馈、代码评审和执行轨迹中持续沉淀企业自己的工程知识。AI Agent越用越懂企业的系统、流程和标准。在产品落地上,词元无限以InfOne为顶层平台,围绕“构建并管理多Agent组织”,形成了从需求理解、代码生成、测试验证到交付治理的全链路闭环产品体系:InfCode负责把需求落到代码,DeepMap负责给AI提供长期项目记忆,InfTest负责证明代码能不能站得住,TokenHub 负责让整个研发过程可治理、可度量,四大核心智能体让研发效能从单点提效跃迁到组织提效。这套逻辑的必要性和紧迫性在过去一个月被反复验证。7月8日,工信部发布风险提示:AI编程工具Claude Code存在严重安全后门隐患,阿里巴巴随即宣布内部全面禁用。紧接着,Grok Build CLI被曝在用户完全不知情的情况下,将整个代码仓库打包上传到云端服务器。当AI Agent有了“手和脚”,能自己定计划、调工具、执行任务,一旦出错就不再是出现幻觉那么简单,而是可能删光项目代码、泄露核心资产。在真实的落地场景中,词元无限的能力正在被反复验证。在银行核心系统的POC中,InfCode生成的代码可用性达到88%以上,节省约40%人天,质量与银行中级工程师持平。目前平台已服务超过十家头部金融与软件企业。一个新的起点Gartner预测,到2035年,代理型AI可能驱动约30%的企业应用软件收入,市场规模超过4500亿美元。这是一个巨大的增量市场,也是一个正在被重新定义的赛道。在刚刚结束的世界人工智能大会上,传递出明确的信号:在AI技术进入前所未有的活跃期之际,既要坚持开放共赢、驱动创新发展,也要强化风险意识、确保安全可控。AI应用已从Chatbot发展到复杂智能体应用,进入核心生产系统只是时间问题。AI开发工具正在成为供应链的关键环节,如果Agent基础设施被植入后门,风险不亚于芯片中的硬件漏洞。而应对之道,是在AI开发工具、大模型底座、算力基础设施等全链条加速自主可控进程。Claude和Grok不会是最后出问题的工具。每一次安全事件曝光,都在削弱企业对海外封闭工具链的信任,也恰恰是国内企业级AI基础设施建立行业标准的窗口期。在这个市场里,词元无限正在尝试做一件事:把一套“上下文理解、治理管控、验证闭环、执行系统和持续进化”的能力,做成行业可复用的事实标准,成为那个“必须使用安全可控AI基础设施的企业”的选择。SWE-Bench第一是一个信号。它证明中国团队在“AI应用与工程化”这个方向上有能力走到全球最前沿。但更值得关注的是那个更大的问题:当AI开始真正进入企业的核心生产系统,谁在为这个新世界建设安全、自主、可信赖的基础设施?词元无限正在用“中国首个全自主、高安全、自进化的企业级AI Agent基础设施平台”书写自己的答案。