拓冰建站拓冰建站
首页 / 资讯中心 / 正文

决策模型接口趋同、缓存按字节计价,AI 技术栈的两处底层改写| 2026年10月04日

今天技术栈出现两处底层改写。模型侧一类只返回选项、评分与概率的决策模型在三周内从单一产品变成多家竞逐且几乎都主动兼容 TypeSafe AI 的 Jev 接口[① MarkTechPost][② TLDR][③ TLDR AI]AWS Strands Labs 的 Strands Decider 2B 甚至用一个小型指针头取代了解码循环[① MarkTechPost]。算力侧DeepSeek-V4.1-Flash 把整个输入缓存压到每 token 890 字节缓存占用被直接写进计价表[④ The Batch DeepLearning.AI]而英伟达的 Shield TV Pro 因元器件成本上涨即刻提价 100 美元[⑤ Ars Technica]。本文按技术主题拆解这四条线。主题节 1决策模型——输出概率而非文本接口兼容成为扩散通道决策模型与生成式模型的分工是明确的它读取一个输入状态与一组类型化问题为每个允许的答案返回概率不产生自由文本。TypeSafe AI 的 Jev 支持三种原语——Choice从最多 255 个选项中选一个、Score按有序等级评分、Noul某陈述为真的 0 到 1 概率每个问题都针对同一状态并行且独立评估增加问题几乎不改变响应时间。其训练方法是校准决策强化学习RLCDRLHF 优化人类偏好RLCD 优化的是校准概率即更高的置信度应意味着更高的准确率。公开定价为每百万输入 token 0.042 美元、输出免费端到端响应时间 70 至 500 毫秒[① MarkTechPost]。开源实现的工程细节值得开发者注意。AWS Strands Labs 的 Strands Decider 2B 以 Qwen3.5-2B-Base 为起点丢弃语言建模头替换为一个约 100 万参数的小型指针头该头将 answer 位置的隐藏状态与每个选项最后一个 token 的隐藏状态比较一次前向传播即得结果无需解码循环主体采用 rank-16 LoRA头部以 fp32 运行标签集来自请求因此选项数量不受限制。其内置服务器绑定 127.0.0.1 且无认证生产环境需自建鉴权层[① MarkTechPost]。Cloudflare 的 Clef 与 Clef-flash 完全兼容 Jev API已运行在 Workers AI 上、权重发布于 Hugging Face 供自托管[② TLDR]Kev 覆盖 0.8B 至 27B 四个规模但 27B 模型的完整训练语料与部分评测数据未公开[③ TLDR AI]。# 以下为根据公开摘要信息对决策模型公开参数的理解示意 # 具体实现请查阅 TypeSafe AI 与 AWS Strands Labs 官方技术文档 decider_public_spec { question_types: (choice, noul, score), # Jev 三种原语 options_max: 255, # Choice 选项上限 output_type: typed_probabilities, # 不生成自由文本 weights_license: (MIT, Apache-2.0), # 小米 MIT / Strands Apache-2.0 checkpoint: v19, # Strands Decider 发布检查点 params_billion: 1.9, # Strands Decider 2B 参数量 latency_ms_range: (70, 500), # Jev 端到端响应时间 server_bind: 127.0.0.1, # 内置服务器绑定地址无认证 }⚠️ 以上伪代码为根据公开信息对该技术逻辑的初步理解示意具体实现请以官方文档为准。主题节 2算力与成本——缓存按字节计价开放权重登顶与硬件涨价并存成本治理的第一战场已经从每 token 价格转到每 token 缓存占用。DeepSeek-V4.1-Flash 的架构是编码器-解码器混合专家 Transformer5520 亿主干参数外加 1960 亿记忆模块参数读取输入时每 token 激活 80 亿、生成输出时激活 160 亿其解码器从编码器末层派生键值、并跨层共享缓存40 层中只有 4 层需要计算完整输入缓存从而把整个输入缓存压缩到每 token 890 字节——约为 DeepSeek-V4-Flash 的四分之一、DeepSeek-V1 的 1/437。输入从 4000 token 增长到 100 万 token 时生成每个输出 token 所需的计算仅上升 25%[④ The Batch DeepLearning.AI]。# 以下为根据公开摘要信息对 DeepSeek-V4.1-Flash 公开架构参数的理解示意 # 具体实现请查阅 DeepSeek 官方技术文档 deepseek_v41_flash_spec { backbone_params: 5520亿, # 主干参数 memory_module_params: 1960亿, # 记忆模块参数 active_params_read: 80亿, # 读取输入时每 token 激活 active_params_write: 160亿, # 生成输出时每 token 激活 full_input_cache_layers: 4/40, # 仅 4 层需完整输入缓存 cache_bytes_per_token: 890, # 输入缓存压缩结果 compute_growth_4000_to_1M: 25%, # 输入增长时的每输出 token 计算增幅 api_price_per_million: {peak: (0.30, 0.006, 1.20)}, # 输入/缓存/输出 }⚠️ 以上伪代码为根据公开信息对该技术逻辑的初步理解示意具体实现请以官方文档为准。供给侧的格局也在变化。开放权重模型本周在权威榜单上登顶登顶者是小米MiMo-V2.6-Pro-RL 在 Artificial Analysis 智能指数上以 46 分位列开放权重模型第一较小的 MiMo-V2.6-Flash 以 59.58% 在 Vals Index 开放权重模型中居首小米还公开了 7000 多个强化学习任务环境及训练代码三个模型均可在 MIT 许可下免费下载用于商业与非商业用途[④ The Batch DeepLearning.AI]。但硬件侧的成本正在上行英伟达以包括内存在内的元器件成本在全行业大幅上涨为由将上市 7 年的 Shield TV Pro 即刻提价 100 美元、新价格 299.99 美元[⑤ Ars Technica]。硬件形态另一侧则出现面向本地智能体的桌面系统英伟达发布 DGX Spark 的 64GB 配置稀疏条件下最高 1 petaFLOP 的 FP4 AI 算力、64GB LPDDR5x 统一内存带宽 273 GB/s其给出的时机理由是智能体的工具调用与长上下文使 token 消耗自 2026 年初以来增长了 14 倍而在自有硬件上没有按 token 计费[① MarkTechPost]。对开发者而言模型能力价格与部署账单正在反向移动。主题节 3智能体工程——无中心协作、逐项自查与训练框架扩展协作规模开始被当作独立的扩展维度来测。微软的 Agensh 取消了中心编排器让多达 1024 个编码智能体自行认领工作、共享发现并围绕同一工作区组织起来团队在 ProgramBench 中最难的五个任务上测试这些任务要求智能体从零重建 FFmpeg、PHP 等程序[⑥ AGI Weekly (VentureBeat)]。这一路线的风险也被同时压力测试研究人员先给最初几个智能体错误信息再让其余智能体阅读它们说的话用以观察智能体蜂群如何把早期错误演变为共识、以及改变对话规则能否阻止这一过程[⑥ AGI Weekly (VentureBeat)]。研究型智能体则在自查上取得进展。北京人工智能研究院BAAI的 AREX 通过反复循环收集证据、反思暂定答案、发起针对性后续检索来打磨成果当暂定答案未能满足全部要求时逐条核查可揭示哪些要求仍未获支持、可用证据在何处相互冲突智能体不必丢弃答案而可保留已确认部分、把未满足的要求作为下一轮研究的问题。在 BrowseComp 上基于微调 Qwen3.5-122B-A10B 的 AREX 系统准确率达 82.5%在 WideSearch-en 上 F1 为 82.0%[④ The Batch DeepLearning.AI]。工具侧谷歌研究人员构建的 AIM 能组织研究想法、筛选有前景的方向、审计实现是否与想法相符并在各搜索分支之间分配实验资源[③ TLDR AI]。# 以下为根据公开摘要信息对 AREX 迭代执行框架的理解示意 # 具体实现请查阅北京人工智能研究院官方技术文档 arex_loop { steps: (collect_evidence, reflect_draft, targeted_followup_search), on_unsupported_requirement: 保留已确认部分将未满足项转为下一轮研究问题, bench: {BrowseComp: 82.5%, WideSearch-en: 82.0%}, # 官方报告口径 finetuned_backbones: (Qwen3.5-4B, Qwen3.5-122B-A10B), }⚠️ 以上伪代码为根据公开信息对该技术逻辑的初步理解示意具体实现请以官方文档为准。主题节 4安全与权限治理——内核隔离、分级准入与平台闸门安全侧的动作同时落在工程与治理两层。工程层Anthropic 指出 GLM-5.3 能够构建复杂的漏洞利用程序且其安全护栏相对容易被绕过其研究显示在消耗相当数量 token 的情况下GLM-5.3 在 ExploitBench 部分任务上的漏洞利用尝试成功率为 12%而闭源权重的 Claude Mythos 为 14%且仅花费 20.40 美元的 GLM-5.3-Flash token 额度就足以发现 Google Chrome 中一个近期披露的漏洞[④ The Batch DeepLearning.AI]。这组数据对防守方的含义很直接发现成本正在下降自查暴露面比等待最强模型更实际。治理层则出现分级释出与平台闸门两条线。谷歌称 Gemini 4 Argon 在编码、网络安全与专业工作相关的多项基准上领先竞争对手但并未按惯例直接公开发布而是先从受信任的网络防御者开始[⑥ AGI Weekly (VentureBeat)]。平台侧苹果在周五的更新中宣布为 macOS 的全盘访问增加新的控制措施要求真正希望授予某应用这种极高访问权限的用户只能通过非常明确的用户操作完成授权[⑦ TechCrunch]。触发点是 Meta 的通用 AI 智能体 Muse专栏作家 Jason Aten 称 Muse 向他推送了一条引用其 Apple Messages 对话线程的未经请求通知而他从未授权Meta 发言人 Andy Stone 则反驳称访问完全由用户主动选择[⑦ TechCrunch][⑧ The Verge AI]。企业场域里NetApp 选择以一致的数据平面加人类与智能体共享的统一控制平面让客户为整个机群设定策略与边界智能体则在这些边界内维持基础设施运行[⑨ SiliconANGLE AI]。响应速度的紧迫性也被量化CrowdStrike 首席 AI 官 Bartley Richardson 称其在 2025 年观测到的最快网络犯罪攻击者突破时间仅为 27 秒由此与 CoreWeave 结合安全数据与训练、推理算力[⑨ SiliconANGLE AI]。主题节 5开源与学术——抽取基准、语音转写与Claude 形状的科学开源基准的不透明问题有了统一标尺。Datalab 发布的 OmniExtractBench 汇集 4 个现有基准中的 620 份文档由同一个确定性评分器统一打分并解释每一次判定每个任务给系统一份 PDF 和一个 JSON schema系统返回 JSON 后再与金标准文件逐值比对。评分器以 omni-extract-bench 之名从 PyPI 安装v0.1.7Python 3.11仅依赖 SciPy代码托管在 GitHub数据在 Hugging Face 上以 CC BY 4.0 发布[① MarkTechPost]。语音工程侧的规格也在补齐。微软发布的 MAI-Transcribe-2-Streaming 可提供 60 种语言的低延迟实时转写并支持自动、连续的语言检测MAI-Voice-2.1 支持 23 种语言与 26 个地区变体[③ TLDR AI]。训练框架方面AI2 的 Olmo-core 3 作为开放训练框架目标是把混合专家模型扩展到万亿参数级[③ TLDR AI]。科学应用则呈现边界Anthropic 称 Claude 为一个数学家数十年未能解决的概率问题给出了证明而Claude 形状的科学问题——即 LLM 能力恰好擅长的任务——虽能快速产出技术性解法要具备实际相关性仍需领域专家修正[④ The Batch DeepLearning.AI][③ TLDR AI]。趋势判断基于今日快讯可归纳出三条跨领域趋势。其一模型输出范式分化决策模型与生成模型分工Jev 用概率回答固定问题集合、Strands Decider 用指针头一次前向出结果与继续逐 token 生成的大模型形成互补开发者可按任务性质选择打分式委派支撑来源①②③[① MarkTechPost][② TLDR][③ TLDR AI]。其二成本治理从单价转向占用且与硬件成本反向移动DeepSeek-V4.1-Flash 把输入缓存压到每 token 890 字节并写进计价表同时小米 MiMo 让开放权重登顶权威榜单、英伟达则因元器件涨价给老设备提价 100 美元支撑来源④⑤[④ The Batch DeepLearning.AI][⑤ Ars Technica]。其三前沿能力准入从发布控制走向分级治理谷歌先从受信任网络防御者放行 Argon、苹果为全盘访问加上非常明确的用户操作前提而开放权重 GLM-5.3 的网络能力已逼近闭源 Mythos支撑来源④⑥⑦[④ The Batch DeepLearning.AI][⑥ AGI Weekly (VentureBeat)][⑦ TechCrunch]。结尾今天的技术信号集中在四处决策模型以概率输出与指针头把判断环节独立出来DeepSeek 把成本标尺挪到每 token 缓存占用智能体协作与自查都出现可量化的工程进展而能力准入则在平台闸门与开放权重逼近之间被重新定义。后续值得关注两点一是决策模型的接口兼容能否沉淀为事实标准二是缓存占用与硬件涨价的双向拉扯会如何改写端侧推理的部署选择。【资讯来源】本文综合整理自 MarkTechPost、TLDR、TLDR AI、The Batch DeepLearning.AI、Ars Technica、AGI Weekly (VentureBeat)、TechCrunch、SiliconANGLE AI、The Verge AI 等公开信息源。 ① MarkTechPost, 2026年10月03日 11:31 北京时间 / 10月02日 20:31 美西时间 ② TLDR, 2026年10月02日 18:55 北京时间 / 2026年10月02日 03:55 美西时间 ③ TLDR AI, 2026年10月02日 21:42 北京时间 / 2026年10月02日 06:42 美西时间 ④ The Batch DeepLearning.AI, 2026年10月02日 14:40 北京时间 / 10月01日 23:40 美西时间 ⑤ Ars Technica, 2026年10月02日 22:52 北京时间 / 2026年10月02日 07:52 美西时间 ⑥ AGI Weekly (VentureBeat), 2026年10月03日 01:30 北京时间 / 10月02日 10:30 美西时间 ⑦ TechCrunch, 2026年10月03日 02:11 北京时间 / 10月02日 11:11 美西时间 ⑧ The Verge AI, 2026年10月02日 20:00 北京时间 / 2026年10月02日 05:00 美西时间 ⑨ SiliconANGLE AI, 2026年10月03日 01:37 北京时间 / 10月02日 10:37 美西时间【免责声明】 本日报为AI行业每日公开信息汇总整理仅供读者快速了解行业动态不构成任何投资建议。所有信息均来源于公开渠道本账号不对其准确性、完整性和时效性作出任何保证。AI行业技术与政策变化迅速内容发布后可能发生更新请以官方最新信息为准。据此作出的任何决策全部风险自担。© 2026 林伽一 · AI科技日报#决策模型 #缓存压缩 #开放权重模型 #智能体治理 #抽取基准
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门