Google宣布Gemini 4 Argon,输出上限达100万Token
Google宣布Gemini 4 Argon,面向复杂任务。该模型正通过Fairwind计划向受信任的网络安全防御人员逐步开放。
输出上限从此前的6.4万提升至100万Token,旨在支持复杂、长流程任务中的深入推理。
按原始来源发布日期汇总本周重要动态。每条都附有详细报道和原始来源。
Google宣布Gemini 4 Argon,面向复杂任务。该模型正通过Fairwind计划向受信任的网络安全防御人员逐步开放。
输出上限从此前的6.4万提升至100万Token,旨在支持复杂、长流程任务中的深入推理。
Cohere 推出了 Embed 5 系列模型,支持 12.8 万 token 上下文窗口,并提供共享嵌入空间以优化检索流程。
通过共享嵌入空间,企业可以结合高性能的 Pro 版本和低延迟的 Fast 版本来优化检索管道。
Quine 是微软研究院的研究项目,将生物学世界模型与科学工具连接;目前仅向 Fellows 项目及部分研究合作开放。
Quine 旨在用计算预测帮助研究人员确定假设和实验的优先级,而不是取代实验室验证。
OpenAI 推出的 GPT-6.1 Sol 在保持专业编程与逻辑推理能力的同时,大幅降低了 API 调用成本。
该模型为开发者和企业提供了一种极具性价比的解决方案,支持大规模部署复杂的 AI 代理和软件工程应用。
Anthropic 的研究记录了 GLM-5.3 在漏洞利用任务中的表现,以及安全限制可能被绕过的方式。
研究中的测试结果说明,防御团队需要重新评估自动化漏洞发现和利用带来的风险。具体能力与成功率应结合 Anthropic 的测试条件理解。
Anthropic 推出 Claude Sonnet 5.5,聚焦日常办公效能。本文剖析其性能指标及对自动化任务的实际应用价值。
性能与成本的双重优化直接决定了 AI 自动化的投入产出比。鉴于性能数据由厂商提供,建议团队在全量切换前,先行基于自身业务负载进行对比评测,以确保符合预期。
GitHub Copilot 现已在 macOS 和 Windows 上开启桌面应用控制功能的公开预览,支持直接操作应用程序。
此功能实现了对无 API 支持或仅限图形界面的传统软件进行自动化操作,显著扩展了 AI 辅助工具的覆盖范围。
NVIDIA 推出 VSS 3.3 版本,新增 vss-build-vision-ai 功能,支持通过自然语言提示词构建视频分析代理。
该功能通过自然语言交互简化了视频分析应用的构建流程,使工程师能够更高效地生成并部署 AI 代理。
OpenAI 推出 Dots 智能体,支持连接 4000 多款应用程序,并能在后台进行主动研究以协助用户处理复杂任务。
Dots 的推出标志着人工智能从对话式助手向自主型智能体的转型。通过将繁琐的跨平台任务委托给可自主运行的智能体,用户可以显著降低手动操作的工作负载,提升办公效率。
Salesforce介绍企业使用AI代理的案例,包括Canada Goose报告的自动处理比例,以及AT&T如何为门店顾问提供客户背景信息。
这些案例显示,客服自动化也可能涉及员工准备和模型行为控制。结果由企业自行报告,材料未提供方法或基线数据,也没有独立核实这些结果。
巴克莱正在扩大Claude在银行业务中的应用。Anthropic介绍了员工助手和邮件处理流程;巴克莱预计,到2027年,大多数软件工程师将使用Claude Code。
这项扩展展示了Claude在银行软件开发和内部运营中的应用。员工助手和邮件处理数据由Anthropic提供;Claude Code相关数字是巴克莱的预期,并非已经实现的结果。
机器学习系统评估美国本土 66,935 个变电站的空间天气风险,并可在潜在影响出现前 30 至 60 分钟生成定位估算。
经过与公用事业部门合作及运营数据的进一步验证后,这些估算或可帮助运营方确定工程审查的优先顺序,并考虑有针对性的保护措施。
Whitbread 完成 Microsoft Copilot 试点项目并将其推广至 1,650 名员工,旨在提升运营效率。
通过扩大 AI 工具的应用,Whitbread 旨在提升生产力,并让员工将精力投入到更重要的决策任务上。
Salesforce 推出了基于 NVIDIA Nemotron 3 架构的 Koa 模型,并发布了 Enterprise AI Harness 框架以加强企业级 AI 的治理与部署。
该方案为企业提供了可治理、可信赖的 AI 工具链,使企业能够安全地集成专用模型并控制人工智能在业务流程中的执行逻辑。
Meta 为 Muse AI 代理引入了新技能和连接器,助力小企业主自动化管理日常业务。
通过将散乱的行政与营销任务整合至单一的 AI 代理中,Meta 旨在帮助资源有限的小企业提高运营效率,减少繁琐的手动处理工作。
会计AI公司Basis通过内部测试,对比了GPT-6 Astra与GPT-5.6 Sol在处理50个标签页税务工作簿时的性能表现。
这个案例说明,长流程会计任务可以按步骤调整模型的推理强度,并单独检查输出质量。速度和评分均来自 Basis 自身的测试。
Copilot Pro、Pro+、Max、Business和Enterprise用户可通过受支持的REST和GraphQL API请求代码审查,并可选择为每次请求设置审查力度。
这些套餐的团队可以通过受支持的API,从自己的脚本、工作流和内部工具中请求代码审查。团队可以逐次设置审查力度;Balanced默认值不会覆盖明确选择的Lite设置。
调整涉及所有Copilot功能。GitHub列出三款替代模型;Copilot Enterprise管理员可能需要通过模型策略启用相应访问权限。
此次调整会影响所有Copilot功能中的模型选择。用户应检查工作流和集成;Enterprise管理员可能需要在设置中确认替代模型的访问权限。
GitHub Copilot 在 CLI、App 及 SDK 中引入动态工作流,支持多步骤任务自动化。
此更新旨在帮助开发人员直接在 Copilot 环境中定义和执行可重复的自动化工作流,以处理复杂任务。
Microsoft Foundry现已提供支持60种语言的流式转写和两款语音合成模型;微软也公布了价格,并列出计划接入的平台。
开发者可将能在数百毫秒内返回首批部分转写的流式识别,与两款语音合成模型搭配使用。按音频小时和每百万字符计价的价格已经公布,可用于估算成本。微软公布的性能数据尚未在此得到独立验证。
Google Cloud 的 Data Agent Kit 现已正式发布,支持通过 Model Context Protocol 将编码代理连接至云端数据服务。
此工具包旨在简化开发流程,让编码代理能够直接操作分析与运营数据库,从而提升数据交互效率。
CoreWeave 为云端早期客户提供 NVIDIA Vera Rubin NVL72 系统及 Spectrum-X 网络技术,助力 AI 代理开发。
此次更新为 AI 开发团队提供了更强的硬件支持与统一的软件工具,有助于量化性能提升并优化代理智能应用的开发成本。
Hugging Face 的 Open TTS Leaderboard 用 WER/CER、RTFx、TTFA 和说话人相似度比较开源 TTS 模型。客观分数补充而非取代人类偏好排名。
对开发者来说,这是一种比持续数周收集投票更快、更易复现的模型比较方式。但 WER 和说话人相似度只是代理指标,不能衡量自然度、表现力或听者偏好,榜单也不取代人类排名。
开发人员现可构建能够导航网站并在托管环境中与浏览器交互的 AI 智能体。
此功能为自动化网页任务(如信息收集和界面测试)提供了支持,同时通过强制授权机制帮助开发人员控制访问权限。
OpenAI称Ultrafast是其API中速度最快的服务档位。所有API用户均可将其用于GPT-6 Astra,但速率限制较低;GPT-5.6 Sol提供预览访问。
开发者可以为GPT-6 Astra选择OpenAI API中速度最快的服务档位,同时权衡较高成本、较低速率限制和区域处理约束。
GPT-6.1 Sol API 文档明确了上下文及输出上限、推理档位、令牌价格,以及欧盟数据驻留的限制。
这些规格有助于开发者估算 API 成本并判断部署限制。模型发布本身已由另一篇文章介绍。
Amazon Bedrock 现已提供 GPT-6.1 Sol 模型,开发者可利用其更高效地执行任务并降低运营成本。
此次发布为开发者提供了成本更低且推理能力更强的工具,有助于优化复杂的软件工程及自动化业务任务。
AWS 宣布将 Grok 4.7 引入 Amazon Bedrock 平台,提供 50 万 token 的上下文窗口及可调节的推理深度。
通过提供高度灵活的推理配置和大规模上下文处理能力,该模型能够有效提升企业在复杂任务中的自动化执行效率。
AWS 宣布在 Amazon Bedrock 中提供 Claude Sonnet 5.5,旨在通过更高的处理效率降低编程与文档处理任务的成本。
引入更高性价比的模型有助于企业降低云端 AI 应用的运营开销。对于需要执行代码生成与自动化分析的开发者而言,此举能够提升工作流程的经济性。
Anthropic 的 Claude Sonnet 5.5 现已集成至 GitHub Copilot。符合条件的专业版及企业版用户可通过按量计费模式使用该模型。
此集成使开发者能够直接在 GitHub 开发环境中调用 Claude Sonnet 5.5,提升代码编写与分析的灵活性。
NVIDIA宣布推出开放软件平台及参考系统设计,旨在从测试到部署加强对AI智能体的治理与控制。
该平台将治理与控制扩展到模型和智能体运行框架之外,包括基础设施层,帮助组织为自主智能体设定并执行行为边界。