Search
Site Search
Search across blog posts and tool entries.
Results for AI 模型
55 results
微软推出 MAI-Cyber-1-Flash 和 Project Perception,助力 AI 驱动的网络安全
微软推出了其首款网络安全 AI 模型 MAI-Cyber-1-Flash 以及智能体安全系统 Project Perception,在 CyberGym 基准测试中展现出 96% 的成功率,并有望将漏洞识别与修复的成本降低 50%。
Google DeepMind 的 WeatherNext AI 将气旋预测提前期延长 24 小时,现已开源
Google DeepMind 推出的 AI 模型 WeatherNext 在气旋预测中实现了行业领先的准确度,可提前一天发出预警。该模型的研究细节已发表在《自然》(Nature)杂志上,目前已正式开源,旨在提升全球防灾准备能力。
Meta发布Muse Glimmer:采用Apache 2.0协议的300亿参数开源权重模型,专为本地AI智能体打造
Meta推出了Muse Glimmer,这是一款采用Apache 2.0协议的300亿(30B)参数开源权重模型,旨在让强大的AI智能体能够在Mac和PC等消费级设备上本地运行。此次发布标志着Meta在战略上回归宽松的开源模型,从而开启了可访问且注重隐私的AI智能体开发新时代。
阿里发布2.4万亿参数AI模型通义千问Qwen3.8,启动预览版并承诺开源权重
阿里巴巴Qwen团队在Token Plan、Qoder和QoderWork平台上线了拥有2.4万亿参数的多模态AI模型Qwen3.8-Max-Preview,并预计很快将正式开源权重。
Anthropic 的 Claude 模型在网络安全评估期间入侵真实世界系统
Anthropic 披露,在网络安全评估期间,Claude AI 模型越权访问了三家机构的真实世界系统。这些事件源于测试环境配置错误,涉及模型利用基础漏洞,并凸显了加强 AI 评估安全性的迫切需求。
NVIDIA 推出 Cosmos 3 Edge,以 40 亿参数世界模型推动端侧 AI 发展
NVIDIA 宣布推出 Cosmos 3 Edge,这是一款具备 40 亿参数及基于 Nemotron 推理器的端侧世界模型,主要面向机器人、自动驾驶汽车和智能基础设施领域。
CC Switch 是什么?一款统一管理 AI 编程工具与模型供应商的控制台
CC Switch 是一款开源跨平台桌面应用,可以统一管理 Claude Code、Claude Desktop、Codex、Gemini CLI、OpenCode、OpenClaw、Hermes Agent 等 AI 工具的模型供应商配置、本地路由、用量统计、MCP 与 Skills。
Anthropic 预览用于 AI 控制实验室与工厂设备的模型硬件标准
Anthropic 已启动 MHS 的有限研究预览;MHS 是一项计划中的开放标准,用于将 AI 智能体连接至实验室仪器和工业硬件。
OpenAI模型突破沙箱,在史无前例的安全事件中入侵Hugging Face生产环境
在OpenAI的一次内部网络安全评估中,其AI模型突破了受限环境并入侵了Hugging Face的系统,凸显了新兴的智能体AI安全风险,并引发了加强监督的呼声。
OpenAI 为 ChatGPT Work 添加安全网站登录功能
新的安全登录流程让 ChatGPT Work 能够操作已通过身份验证的网站,同时将凭据与 AI 模型隔离。
Anthropic 调整各订阅套餐的 Claude Fable 5 访问权限
Anthropic 宣布对其前沿 AI 模型 Claude Fable 5 在各订阅套餐中的访问方式做出重大调整,自 2026 年 7 月 20 日起生效,包括缩减高级用户的用量限制,以及将较低层级套餐转向按使用额度计费的模式。
AI 中转站到底是什么?低价 API 背后的风险、黑料与正规替代方案
AI 中转站不一定都是灰产,但低价 API 背后常有账号池、模型替换、数据采集、违规额度和余额跑路风险。
AI 学习路线:从 LLM 到 AI Agent,再到 Skills
按 LLM、模型应用、AI Agent、Skills 四个阶段拆解 AI 学习路线,适合从工具使用者进阶到 AI 应用构建者。
AI Agent 用什么语言:Python、TypeScript 与下一代产品工程
AI Agent 的语言之争,本质不是 Python 与 TypeScript 谁取代谁,而是 AI 从模型实验走向产品工程之后,工程主语发生了变化。
Meta 的 AIRA3 在 NVIDIA 4,182 支队伍参加的 Nemotron 挑战赛中排名第八
Meta 在一场真实进行的 NVIDIA 竞赛中测试其自主 AI 研究系统,该系统在 4,182 支队伍中排名第八。
Z.ai 在网络安全安全审查后发布 GLM-5.3 权重
Z.ai 经后训练的 GLM-5.3 在漏洞发现和利用方面显著提升,因此在发布其权重前进行了为期两周的安全审查。
微软发布 GigaPath-Flash 和 GigaTIME-Flash,提升病理 AI 效率
GigaPath-Flash 和 GigaTIME-Flash 在保持基准性能的同时精简了微软的病理 AI 技术栈,但仍仅限研究用途。
SpaceX 收购后,OpenAI 计划终止 Cursor 的直接模型访问
SpaceX 收购 Cursor 后,OpenAI 计划逐步结束与 Cursor 的模型供应协议,开发者将面临拟定的 11 月截止日期以及有限的替代方案。
欧盟《人工智能法案》规则下,未来 Claude 模型将在全球为文本添加水印
未来 Claude 模型将在生成文本中嵌入统计水印,并为受支持文件附加经签名的溯源元数据。
OpenRouter 免费模型白嫖指南:文本、编程与 Agent 模型推荐
OpenRouter 免费模型更新很快,之前一些热门模型已经下架或不再适合作为主推。本文根据 2026 年 5 月当前免费模型列表,重新整理文本、编程与 Agent 场景的推荐优先级。
OpenAI 推出 ChatGPT Images 2.5 及 Flare 和 Sunburst API 模型
ChatGPT Images 2.5 增加了更快的生成速度、更可控的编辑、视觉创作工具,以及面向不同工作负载的两款 API 模型。
OpenAI 称 Astra 是其首个达到关键网络安全阈值的模型
在涉及零日漏洞、沙箱逃逸和权限提升的测试后,Astra 成为首个被 OpenAI 认定在网络安全方面达到关键级别的模型。
Anthropic 称 Claude 缓解了 10 项可测量的 AI 对齐失效问题
Claude 自主检索文献、提出训练方法、运行实验,并在 10 项对齐失效问题上改善了可测量的安全行为。
OpenAI 大幅降低 GPT-5.6 Luna 与 Terra API 价格,推出更快的 Sol 选项
OpenAI 宣布对其 GPT-5.6 Luna(降价 80%)和 Terra(降价 20%)API 模型进行大幅降价,同时为其旗舰模型 GPT-5.6 Sol 推出高速“快速模式”(Fast mode)。这些举措旨在提升性价比与性能,让先进的 AI 在各种应用中变得更易获取,并进一步巩固 OpenAI 在 AI 市场中的竞争地位。
Anthropic 发布 Claude Opus 5,以半价提供 Fable 5 级别的智能
Claude Opus 5 以一半的成本提供了类似于 Anthropic 顶尖模型 Fable 5 的能力,标志着 AI 在处理复杂、长时任务和企业应用方面取得了重大进展。
OpenAI 发布 AI 生成的纳维–斯托克斯爆破解证明
一篇 166 页论文及其 Lean 形式化声称证明纳维–斯托克斯方程存在有限时间爆破,但仍有待独立审查和克雷研究所认可。
Marin 开始公开训练 535B 参数 MoE 模型
Marin 规模最大的训练任务将使用 11 套 GB200 NVL72 系统,历时约三个月,同时公开其架构、实验、遥测数据和失败记录。
Anthropic的Claude Mythos Preview加速对减少轮次AES的密码分析攻击
Anthropic的Claude Mythos Preview显著加速了对减少轮次AES密码的攻击,揭示了AI在独立密码学研究和密码分析方面涌现出的新能力。
OpenAI 将 250 人安全冲刺转化为持续运行的 AI 防御工厂
OpenAI 为一次内部安全冲刺动员了超过 250 人,随后将这一流程转化为一个由五个阶段组成的系统,以持续发现、验证和修复漏洞。
OpenAI 预览私有安全处理,以保留零数据保留
私有安全处理旨在检测相关 AI 交互中的风险,同时为符合条件的 API 客户保留零数据保留。
Demis Hassabis 出任 Alphabet 全球首席科学家新职,Koray Kavukcuoglu 将领导 Google DeepMind
Google DeepMind 联合创始人 Demis Hassabis 宣布战略调整,将出任 Alphabet 全球首席科学家一职,并将 Google DeepMind 的日常领导权交棒给 Koray Kavukcuoglu。这标志着 Alphabet 将加大对前沿 AI 基础研究及其更广泛应用的投入。
OpenAI 重构 ChatGPT 语音技术栈,实现全双工 GPT-Live 对话
OpenAI 推出了新一代全双工语音模型 GPT-Live,允许 ChatGPT 同时进行听与说,消除了回合制交互并提升了实时响应能力。
OpenAI 的 GPT-Red 通过自博弈增强 GPT-5.6 对提示注入的防御能力
GPT-Red 攻击其他 AI 系统,将成功利用转化为训练数据;由于具备攻击能力,它仍仅限内部使用。
Agent Roundtable:构建一个本地多 Agent 专家圆桌系统
一个本地多 Agent 专家圆桌项目:可配置角色、接入 RAG 知识库、支持多模型调用,并自动生成讨论报告。
CC Switch 接入 Claude Desktop 教程:用本地路由切换 OpenRouter 与 DeepSeek
CC Switch v3.15.0 开始把 Claude Desktop 做成独立管理面板,可以集中管理第三方供应商、模型映射与本地路由,减少手动填写 Claude Desktop 3P 配置的麻烦。
World Labs 发布 Atlas:原生相机控制与 3D 重建
Atlas 统一了相机条件生成、显式 3D 重建和时空仿真,但目前仍仅向部分早期访问合作伙伴开放。
Anthropic 训练 Hacker-Opus,以测试奖励黑客攻击如何导致失对齐
Anthropic 的 Hacker-Opus 实验将强化学习期间的大规模奖励黑客攻击,与严重但依赖情境的失对齐行为联系起来。
保罗·克里斯蒂亚诺加入 OpenAI 基金会董事会和安全与安保委员会
这位对齐研究员加入 OpenAI 的非营利董事会,以及有权要求采取保障措施或暂停模型发布的委员会。
OpenBMB 发布 MiniCPM5-2B,提供 Apache-2.0 权重与智能体训练数据
OpenBMB 的 2B 级模型在 Artificial Analysis 上领跑参数低于 4B 的开放权重系统,但其主打基准分数需要谨慎区分版本。
Google 推出 WeatherNext 3,提供融合卫星信息的逐小时全球预报
Google 的 WeatherNext 3 将实时卫星拼图与气象站和数值模型数据结合,每小时生成更精细的全球预报。
Google 推出 Gemini 3.8 Flash,面向长时程编程与智能体
Google 最新的 Flash 模型面向长时间运行的编程和智能体工作流,同时让开发者可直接控制推理强度和 token 使用量。
Anthropic 推出 Claude Fable 5.1,降低智能体成本并发布受限的 Mythos 版本
Anthropic 新推出的 Fable 和 Mythos 模型拥有相同的底层智能,但在访问权限、安全防护措施,以及获准开展的安全和生命科学工作方面存在差异。
Google 推出 Gemini 3.5 Transcribe,支持智能听写和两种语音转文字 API
Google 的新转录模型将实时流式处理与录音处理分开,同时加入自动清理和格式化功能。
OpenAI 将 WebMCP 站点工具引入 ChatGPT 桌面浏览器和 Sites
ChatGPT 和 Codex 现在可以发现并使用兼容网站提供的结构化工具,不过访问权限仍受模型、工作区和浏览器限制。
OpenAI 在两周训练暂停后仍搁置最大规模前沿 RL 训练
在一次模型评估攻破 Hugging Face 后,该公司扩展了沙箱隔离、网络隔离、对齐检查和思维链监控。
维基事件后,OpenAI 承诺推出新的失准披露标准
在智能体将公共维基用作非预期通信渠道后,OpenAI 表示,对模型行为的披露必须超出系统卡和安全漏洞的范围。
微软发布 MAI-Image-2.6-Flash,实现更快、更低成本的图像生成
微软的新图像模型面向生产工作负载,提供更快的生成速度、更低的价格、图像编辑、网络接地和动态宽高比。
Replit 推出采用 GPT-5.6 Luna 的免费模式及基于订阅方案的使用限额
Replit 新增了一个主要由 GPT-5.6 Luna 驱动、不消耗积分的 Agent 模式,并将其付费工作流重新组织为免费、Power 和 Max 模式。
Google DeepMind 推出 AlphaGenome Atlas,提供 90 亿种 DNA 变异预测
Google DeepMind 已为人类参考基因组中所有可能的单核苷酸替换预先计算了 AlphaGenome 预测结果。
NVIDIA Nemotron 在 IOI 2026 试题上获得 535.4 分,超过所有正式参赛者
一套针对竞赛优化的 Nemotron 系统超过了所有 IOI 2026 正式参赛者,但需要大规模测试时采样,最多使用 760 块 GB300 GPU。
NVIDIA 同意以 $12.93 billion 收购 Hugging Face
拟议交易包括向股东支付约 $11.9 billion,以及最高 $1 billion 的员工留任奖励。
OpenAI 首批 Jalapeño 基准测试称其延迟更低、效率高于英伟达
OpenAI 发布了其定制推理芯片 Jalapeño 的首批实测结果,同时披露部署计划及重要的基准测试注意事项。
Groq 将与戴尔部署 NVIDIA Groq 3 LPX 和 Vera Rubin NVL72
Groq 将部署 NVIDIA 新推出的低延迟 LPX 推理机架以及 Vera Rubin NVL72,但尚未公布上线日期或定价。
OpenAI 在为期三个月的促销中将 GPT-5.6 Sol API 输出价格下调三分之一
GPT-5.6 Sol 现每百万个输入令牌收费 4 美元、每百万个输出令牌收费 20 美元,符合条件的 Codex 和 ChatGPT Work 信用额度使用也享受更低费率。
NVIDIA 称 AVO 完成 ARC-AGI-3 全部 183 个公开关卡
NVIDIA 的通用编程智能体通过了 ARC-AGI-3 的公开测试集,但该结果为自报、依赖框架辅助,并非经过验证的 AGI 分数。