2026年9月2日
OpenAI 的 Astra 模型成为首个达到公司内部“Critical”网络安全能力阈值的 AI,能自主发现并串联软件漏洞。公司计划很快发布,但网络安全相关功能仅限选定合作伙伴提前使用,并在暂停部分开发后增加了失调监控器等额外控制。 这一事实直接表明,AI 在网络安全领域的自主能力已触及公司设定的红线。Op……
阅读全文
2026年9月2日
Deep SWE 74 分登顶,野榜格局瞬间改写 Gemini 3.8 Flash 在 Deep SWE 基准测试中拿到了 74 分,直接超越了 Fable 5.1 的成绩。这一结果让 Deep SWE 这个榜单瞬间失去参考价值,社区直接宣布它已成为野榜。 这个分数意味着 Gemini 3.8 Flash 在特定代码生成和软件工程任务上展现出极强的表现。测试中它在多个子任务里都表现出色,尤其是在需要复杂推理和多步……
阅读全文
2026年9月1日
一位开发者在 Google Antigravity 平台用 Gemini 3.1 Pro 完成首个 POS SaaS 项目时遭遇严重 bug,导致销售输入修复后仪表盘分析功能彻底崩溃。 他随后尝试 GPT 系列模型,却因 token 消耗过快和 API 费用激增而放弃。最终根据 Agent Arena 社区基准测试结果,转向 Gemini 3.7 Flash High Mode。这一实际工作流切换,暴露了当前大模型在 agentic coding 场景下的真实差距,也给国内……
阅读全文
2026年9月1日
OpenAI 被曝囤积几万台 Mac mini,这些设备全部用于 AI 训练。苹果消费级硬件突然成为训练稀缺资源,显示大模型对算力的需求已超出传统 GPU 供应链的承载能力。 OpenAI 选择 Mac mini 而非继续堆英伟达 GPU,核心在于性价比。M 系列芯片采用统一内存架构,内存带宽远高于同价位传统 x86 系统。一台高配 Mac mini 的算力成本显著低于……
阅读全文
2026年9月1日
OpenAI的ChatGPT广告业务上线不足200天,年化收入已突破10亿美元。目前数万家广告主已在40多个国家投放,平台正向印度、欧洲、中东和北非扩展自助服务,广告仅面向免费和Go用户展示。 这一数据直接显示出OpenAI在生成式AI商业化路径上的快速突破。过去依赖订阅和企业AP……
阅读全文
2026年9月1日
OpenAI周二宣布,Astra模型成为首个超越其“关键”网络安全能力阈值的产品。该模型能发现此前未知的安全漏洞,并在无需人类逐步指导的情况下加以利用,直接进入公司“准备框架”中最先进的类别。公司仍计划很快推出Astra,但对其网络安全能力的访问将设置更严格限制。 Astra首次跨……
阅读全文
2026年9月1日
Gemini 3.5 Flash 提出的漏洞分诊决策,有 65% 被另一个模型直接挑战。这个比例最初被当成 bug,后来才发现它暴露了单一模型的系统性偏见。作者用五天构建的自主系统,本意是解决安全程序六周修复周期里最难的追责环节,却意外让模型互评成了发现隐藏偏差的工具。 65% 分歧率来自模型对同一 triage 决策的直接对抗 作者花五天……
阅读全文
2026年9月1日
DeepSeek 8 月 31 日上线的 DeepSeek-V4-Flash-Vision-Exp 是 305B 参数的 V4 家族首款多模态模型,却明确不是用来做图像描述的。这款实验模型在原有语言底座上接入视觉编码器和 Aligner 后获得图像理解能力,其对多模态的定义与主流做法形成直接反差。 DeepSeek-V4-Flash-Vision-Exp 的出现让多模态这个概念在中文开源社区里有了新含义。过去几年,多数多模态大模型把重点放在描述图像……
阅读全文
2026年9月1日
OpenAI 正在让 ChatGPT 直接与电子健康记录实现互操作。在支持的部署中,ChatGPT 可访问健康系统数据源,临床团队无需再在独立 AI 工具和患者病历间切换。这一调整把 AI 辅助工作嵌入日常临床流程,而非作为额外步骤。 这一举措标志着生成式 AI 从独立聊天界面走向真正嵌入医疗系统。过去医生需要复制病历内容到 ChatGPT 再……
阅读全文
2026年9月1日
Astra 首次满足 Critical 网络安全能力阈值 Astra 是 OpenAI 首个达到 Preparedness Framework Critical 网络安全能力阈值的模型。这一事实直接表明 OpenAI 在网络安全相关的前沿能力上已经跨越了预设的关键节点。 Preparedness Framework 将模型能力分为不同等级,Critical 代表其中最高的风险级别,一旦模型在网络安全任务上表现出达到该级别的表现,就意味着它具备了可能被……
阅读全文