文章
全部文章
按发布时间浏览 AI 科技观察的全部已发布文章。
已发布文章

买得到算力,买不到数据
Google 一个月处理的 token 已是全人类公开文本存量的十倍以上。这个比较说明「数据不够」这四个字被混用了。数据约束分为存量、许可、生产、搬运四层:可训练文本按中位估计 2028 年见顶,但许可层的天花板已经先到;合成数据只在有验证器的地方成立;而在物理层,HDD 产能按日历年售罄,存力开始需要像电力一样提前锁定。

给 Agent 加了记忆,它反而变笨了
记忆几乎总是被当作纯增益功能加上去的,但 2026 年的多份公开测量显示:加了记忆的 Agent 在不少任务上比不加更差。本文拆解稀释、误差累积、陈旧状态三种退化机制,对比 compaction、结构化笔记、子 Agent 隔离三种手段的取舍,并给出写入侧的过滤与遗忘策略和三组可自测的对照实验。

榜单帮不了你选模型:自建评测集的做法
公开榜单会受到题目污染、分数饱和和机制过拟合影响。本文解释这些失灵机制,并给出二十到五十道私有评测集的题目来源、分层、打分和样本量方法。

算力堆到一起之后,瓶颈变成了网络
机柜内每颗 GPU 有 1.8 TB/s 的互联带宽,跨出机柜的单端口速率是 800 Gb/s。从 scale-up、scale-out 到 scale-across,三层网络的落差决定了并行策略承受什么压力、以太网在 UEC 1.0 之后解决什么问题,以及跨数据中心训练能扩展到多远。

为什么 AI 总在长任务里跑偏:多步任务的失败点在哪
长任务失败往往出在重复执行的稳定性:模型需要把同一件简单事连续做几十次,错误会在过程中累积。本文用 ICLR 2026、NeurIPS 2025 的一手实验拆出三个具体失败点:错误的自我强化、多轮目标漂移、验收环节缺位,并给出按步数预算切分任务、回滚清除错误历史、用 pass^k 验收等六个可落地做法。

上下文越长,答案越不准:资料该喂到什么程度
模型的可用上下文远短于标称上下文,退化也会在窗口用满之前逐步出现。五份独立测量揭示了长上下文失效的机制;成本、延迟和资料筛选共同决定一次调用该放多少内容。

AI 幻觉:哪些输出必须核验
幻觉会持续出现,背后有训练与评测规则的激励。文章结合一手研究,解释其成因和可检测程度,并按“错误能否被发现、能否撤回”整理核验清单。

同一个问题问两次 为什么模型会给出不同答案
同一个问题出现不同回答,未必只是“模型随机”。从逐词元生成、会话上下文到版本变动,拆解差异从哪里来,以及哪些差异必须核验。

别把重要工作流押在一个 AI 工具上
从输入、规则、验收、适配层和人工接管出发,说明如何评估单一 AI 工具依赖,并用实测建立可维护的降级路径。

把决定交给推荐之后 选择真的变轻松了吗
从选择过载、排序信号、探索范围和可干预性出发,拆解推荐到底替人省掉了什么,又没有替人做掉什么。

让 AI 替你办事之前,先决定哪些事不能交出去
从代理式系统的外部行动能力出发,提出以后果、权限、数据敏感性和可恢复性划分委托边界的方法,并说明审批、责任红线、最小权限、可追溯记录与演练恢复如何共同约束 AI 的行动。

AI 到底怎样提高工作效率:它省下的是等待、切换和返工
从写作、客服、企业协作与软件开发研究出发,解释 AI 如何缩短直接任务、何时把时间转移到核验与返工,以及团队应怎样衡量净效率。

当 AI 直接给出答案,谁还会点开原网站?
以 Pew 的浏览行为数据和生成式搜索研究为边界,区分答案满足、来源打开、核验和任务完成,并为内容网站提出可证伪的页面责任与测量框架。

当 AI 开始替你工作,改变的是判断、权限与责任边界
从任务自动化与工作流委托的区别出发,分析 AI 连续执行任务后判断位置、行动权限、证据链、责任归属与能力形成机制如何变化,并提出一套可执行的五步治理方案。

欧盟《AI 法案》进入实施阶段:企业合规指南
欧盟《AI 法案》进入实施阶段后,合规正在成为企业进入欧洲市场并持续经营 AI 的基础能力。本文从责任边界、风险控制、供应链证据和日常治理四个层面,说明企业如何把法规要求转化为贯穿产品生命周期的控制体系。

从 128K 到 1M:长文本工作流省下了什么,又增加了什么
把长上下文放回合同审阅、跨版本对照和技术决策这些具体任务中,比较 128K 与 1M 各自解决什么问题,以及检索、引用和版本控制为何仍不可缺。

开放模型会怎样影响用户的控制权、成本与选择
区分开放访问、开放权重与开放源码,比较托管 API、托管开放模型和自托管在数据控制、许可、成本、运维、安全更新与可迁移性方面的真实取舍,并给出八项决策检查。

AI 到底贵在哪里
从正式训练运行一路拆到 HBM、先进封装、网络、折旧、利用率、推理调度和客户总拥有成本,解释 AI 的钱分别花在哪里,以及为什么单位价格下降并不保证总支出下降。

算力扩张背后的电力秩序
从电量与容量的差别出发,追踪发电、输电、并网、冷却与算力调度如何共同决定模型能否持续运行。