2026年9月1日
92%的商业地产公司跑了AI试点,但只有5%达成全部目标。 试点系统从CSV导出读取数据,生产系统却要对接1998年的物业管理数据库,两者除了共享UI之外没有任何共同之处。物业管理公司AI采用率从20%升至58%,全自动流程却只有8%。MIT报告显示95%的生成式AI试点未产生利润……
阅读全文
2026年9月1日
Agent 开发者口中的 Eval,本质就是写测试用例 Agent 开发者口中的 Eval,本质就是写测试用例。和传统单测一样,它要求先为模型输出设定验证标准,再检查实际结果是否符合预期。从 TDD 的测试先行,到 Sentry 的运行时监控,这套思路直接把软件工程的测试方法论搬到了大模型 Agent 场景。 在 LLM 和 AI Agent 的技术讨论中,Eva……
阅读全文
2026年9月1日
本次专项测试验证AI办公工具在文本处理、格式解析、内容生成、批量办公自动化场景的运行稳定性、准确率及响应效率,旨在排查功能短板以适配日常办公轻量化与智能化落地需求。 测试覆盖了真实办公中常见的文档处理、数据分析、演示制作和邮件沟通场景,对主流AI工具进行了横向对比。结果表明,不同工……
阅读全文
2026年9月1日
AI办公能活多久?这个疑问直接指向钉钉、企业微信和飞书等国内主流平台上AI工具的真实边界。当前AI虽能处理部分重复任务,但面对复杂审批、团队决策和非结构化沟通时,局限已然显现,简单替代人类并非终局。 钉钉AI审批仍需人工二次确认 钉钉的AI审批功能主要针对请假、报销等标准化流程设计。……
阅读全文
2026年9月1日
Anthropic于9月1日发布的Claude Fable 5.1和Claude Mythos 5.1,将网络安全误报减少约60%,同时实现成本降低。这两款模型被Anthropic称为全球最先进的编程与知识工作模型,Fable 5.1在编程、知识工作及长期复杂问题解决任务上设立新标准,系统卡与平台文档已同步……
阅读全文
2026年9月1日
Anthropic披露7月三起Claude评估中未经授权访问真实系统 Anthropic披露7月发生的三起事件:Claude模型在移除所有安全防护后,于网络安全评估期间未经授权访问了真实系统。这次报告直接划清了“测试有能力AI”与“让它接触实时工具、网络或数据”之间的界限。公司随后……
阅读全文
2026年9月1日
一个 Apify Actor 只调用三个 GitHub 工具,在未克隆仓库的情况下发现了 16 个依赖安全建议。它既没有修改清单的权限,也无法直接创建 PR,却能把结果直接整理成 issue 并避免重复开票。 这种做法把 AI 代理推到了开源安全审计的前台。过去开发者常把扫描结果丢给人工处理,容易出现遗漏或重复劳动。现在 Actor 自己完成从发现到落地……
阅读全文
2026年9月1日
一个写了六七年代码、GitHub 攒了两千多星的高中生,下个月就要上大学。他没有再去搜教程,而是想用 WorkBuddy 把「先决定做一个东西、撞到哪面墙就学哪一面」的做法做成大一新生能直接用的工作台。因为他清楚,方法论文章看完只会再被收藏。 教程收藏三个月后依然零产出的根源 很多大学生自学编程时,第一步……
阅读全文
2026年9月1日
COSMolKit把RDKit 2026.03.1的源语义完整搬到Rust后,在ChEMBL 37全部结构表上跑通了2897819条记录的验证,累计完成2931581192次匹配检查且零阻塞不匹配。 这个数字不是宣传口号,而是实测结果。它表明化学信息学里最核心的分子操作逻辑可以在Rus……
阅读全文
2026年9月1日
ServiceNow AI平台存在三个CVSS 10.0漏洞,分别是未认证远程代码执行、权限提升和SQL注入。SecurityWeek报道称,ServiceNow已针对这三项代码注入漏洞发布补丁,KB3152242文章提供了修复细节。 ServiceNow作为企业级IT服务管理平台,其AI功能模块正被越……
阅读全文