# 2026年AI热点趋势报告

> 结合热摸爽AI栏目576条内容与机构报告，讨论AI操作结果是否可靠、不同人群怎样使用AI、视频能否保持连贯，以及模型费用和用电成本。资料截至2026年10月5日，各项数据注明统计范围。

- 作者：热摸爽
- 发布：2026-10-06
- 更新：2026-10-06
- 栏目：热点观察
- 标签：2026、AI趋势、数据观察、智能体
- 原文：https://remoshuang.com/observe/ai-trends-report-2026

**AI能做什么，做出来的结果可靠吗？**

作者：热摸爽｜资料检索截至 2026 年 10 月 5 日

2026 年还没过完，给 AI 写全年总结有点早。但写一份阶段报告，已经能看到几条清楚的线索。

我更关心AI能不能把任务做完。回答问题只是一步：文件有没有改对，订单有没有处理好，生成的视频能不能直接用？这些结果需要逐项检查。

这篇报告参考两类资料：热摸爽当时收录的内容，帮助了解哪些话题有人在讨论；斯坦福、微软、Anthropic等机构的报告，提供能力、使用情况和成本的数据。讨论多不代表用的人多，也不代表产品效果好，后两个问题还要看具体研究。

## 不只聊新模型，也在聊怎么用

10月5日晚，热摸爽AI栏目收录的576条内容里，有57条标题提到了智能体或工作流，36条提到了免费、价格或成本。编程、做视频和本地运行，也都有人在讨论。

我更关心后面这些问题。模型又变强了，当然值得看；但真要拿来干活，还得问：这项任务能不能做？要花多少钱？结果不对，能不能查出哪里出了问题？这些问题，才关系到一个工具能不能留下来。

![热摸爽AI栏目标题关键词命中数：智能体与工作流57、价格与成本36、编程与开发26、视频与图像25、本地与端侧10](https://remoshuang.com/observe-media/2026/10/1d4687f3-d12c-47ca-94b8-f120c92a3ca9.png)

*图 1：热摸爽公开接口单次快照的标题关键词命中数。样本为 576 个不同链接，抓取时间为 2026-10-05 22:20（北京时间）。词组可重叠，标题匹配存在遗漏和误匹配，跨平台不同链接可能讨论同一事件。*这批标题里，除了新模型发布，也有人讨论怎么用、要花多少钱。

## Agent说完成了，还得检查结果

AI可以操作浏览器、文件和业务系统。但它说“完成了”以后，我们还得检查文件和记录有没有按要求修改。

10 月 3 日，微软团队与 Hugging Face 联合发布 ThinkingBox 的介绍。这个评测把 507 个合成业务工作流分别重复运行 20 次，检查最终后台状态和额外副作用。其中一组消融评测覆盖 12 个模型、121,680 次有效尝试，79,853 次没通过可执行检查。在这些失败中，67.24% 仍正常结束且调用了改变状态的工具，也没有报告最终工具错误。[ThinkingBox 原始介绍](https://huggingface.co/blog/microsoft/thinkingbox)

没有报错，也可能把事情做错。

这些是按真实业务模式重建的合成任务，不能直接解释为线上客服的失败率。不过，评测方式很有启发：让 Agent 自己总结成绩，像让考生自己批卷子。至少该看一下订单、工单和文件最后变成了什么样。

我更看重这类评测带来的验收标准。过去演示一次成功，足够让人惊喜。接入业务以后，就要追问换一份输入还行不行，连续跑能不能稳定。失败有没有留下多余修改，也得检查。模型是否理解要求、工具能做什么、出错后能否恢复，都会影响结果。

编程也在经历同样的变化。斯坦福 2026 AI Index 摘要引用了 Terminal-Bench 的数据。相关任务成功率从 2025 年的 20%，提高到报告发布时的 77.3%。这是特定基准上的进展，不能换算为“程序员效率提高了几倍”，也不能推算一个真实项目有多大概率交付。[斯坦福 AI Index 2026 摘要](https://hai.stanford.edu/news/inside-the-ai-index-12-takeaways-from-the-2026-report)

代码生成以后，还要运行、测试，核对需求，并确认后续能维护。选编程工具时，我会看它能否找到错误、修复并重新测试，而不只看一次生成了多少行。

## 讨论AI的人很多，使用情况仍有差异

微软 9 月 21 日公布的报告估计，2026 年 6 月全球劳动年龄人口中有 18.8% 使用过生成式 AI。阿联酋为 73.3%，新加坡为 64.3%；全球北方与全球南方分别为 28.8% 和 16.2%。这些是基于微软匿名汇总遥测、经设备和联网等因素调整的估计，统计对象为 15—64 岁人群。[微软全球 AI 扩散报告说明](https://blogs.microsoft.com/on-the-issues/2026/09/21/the-continued-state-of-global-ai-diffusion-in-2026/)

![微软估计的生成式AI使用比例：全球18.8%、阿联酋73.3%、新加坡64.3%、全球北方28.8%、全球南方16.2%](https://remoshuang.com/observe-media/2026/10/ba04dd68-c275-40b6-a786-6d0771d44193.png)

*图 2：2026 年 6 月、15—64 岁人口中在报告期内使用过生成式 AI 产品的比例。国家与区域汇总并列展示，不是统一层级的排名；这是遥测调整后的估计，并非人口普查。*

如果每天刷 AI 社区，很容易觉得全世界已经人手几个 Agent。把视线移出技术圈，才会发现普及还很不均匀。18.8% 也只说明报告期内用过，没说明每天用多久、是否付费、有没有产生收益。

微软提醒，后续报告扩大新工具的覆盖后，估计值可能上调。中国可能上调得更多。这些估计会受语言、联网条件和统计覆盖影响，适合了解使用情况，不能拿来评价一个国家的人是否更懂AI。

Anthropic还研究了不同用户怎样使用Claude。其 3 月经济指数报告使用了 2 月样本。报告发现，注册至少六个月的用户更常与 Claude 迭代协作。控制任务、模型、用例和国家等因素后，他们的对话成功率约高 4 个百分点。成功由 Claude 评估，报告也承认早期用户特征和幸存者偏差的影响。[Anthropic 2026 年 3 月经济指数](https://www.anthropic.com/research/economic-index-march-2026-report)

这提示，熟悉工具的人可能更容易完成任务。但它不足以证明“练半年必然提高四个百分点”。退出产品的人没出现在活跃样本里，早期用户也可能本来就更懂技术。

对普通读者，我更愿意给一个朴素建议：选一项重复工作，把输入、验收条件和失败案例留下来。写周报就检查关键数字，翻译就核对术语，整理资料就检查出处。积累这些材料，比每天收藏一篇“十个神级提示词”更容易知道自己究竟哪里进步了。

## 做视频要前后连贯，本地运行要看设备

生成一张惊艳的图，和交付一段能用的视频，中间隔着很多工序。人物换个镜头不能换张脸，杯子不能凭空消失，脚本也不能拍着拍着忘了。

Google Research 在 9 月 24 日介绍了长视频生成研究。它在 Gemini、Veo 等模型上增加编排层，追踪角色、场景和物体状态。反馈循环则用来改善跨镜头一致性。研究展示了分钟级视频及十分钟示例。这仍是研究和实验展示，不代表普通用户已经能稳定制作长片。[Google Research 原始介绍](https://research.google/blog/coherent-long-form-video-generation/)

这项研究把脚本、分镜、角色和场景记录、生成与检查结合起来。对创作者来说，真正该记录的是重做了多少次、哪些素材能复用、人工修补花了多久。第一张图好看，还不能说明整段视频能用。

热摸爽样本中的视频图像词组命中 25 条，本地端侧词组命中 10 条。但只看标题会漏掉内容：一篇视觉论文可能没在标题里写“图像”，一个本地模型帖子也可能只写模型名。标题里相关词出现得少，不能说明这个方向的研究或应用少。

考虑在手机或电脑本地运行AI时，我会先问：是否需要离线使用，是否希望减少原始资料外传？再检查设备内存、耗电、安装维护难度，以及效果是否够用。本地部署并不会自动保证隐私，插件、日志和联网功能仍要检查。

机器人还要在真实环境里完成动作。会识别衣服，与能在不同光线、材质和摆放下把衣服叠好，涉及不同要求。世界模型、机器人演示可以作为研究信号，企业级稳定部署则需要另外的证据。看完视频先找任务条件和失败记录，通常比先找购买链接更有用。

## 不同任务，可以选择不同模型

最强模型包办所有事，听上去省心。实际工作还要等响应、算费用，处理重试和复核。

Anthropic 同一份报告还分析了可选择多类模型的付费 [Claude.ai](http://Claude.ai) 用户。在该样本里，计算机与数学相关任务有 55% 使用 Opus，教育相关任务为 45%。这反映其用户在任务之间做选择，不能当作全行业的模型市场份额。[Anthropic 模型选择分析](https://www.anthropic.com/research/economic-index-march-2026-report)

开放权重模型让用户多了一种部署选择。微软 9 月报告说，开放权重模型在其讨论的 API 使用数据中获得了更高的 token 份额。这个观察不等于整个 AI 市场份额，更不保证自部署总比托管服务便宜。[微软报告中的开放权重观察](https://blogs.microsoft.com/on-the-issues/2026/09/21/the-continued-state-of-global-ai-diffusion-in-2026/)

对预算有限的小团队，我会优先按任务分工。规则明确的格式转换先用程序，简单抽取或初稿再测试小模型。需要复杂判断的环节，交给更强的模型。前提是用同一批真实任务验收，发现质量掉了就调整，不能为了账单好看把错误留给客户。

成本也该算完整。可以把“每个验收合格结果的总成本”作为指标，把模型调用、工具服务、失败重试和人工复核一起记进去。分母用合格结果，才不会把生成一堆不能用的内容算成高产。便宜模型如果需要反复重做，节省的调用费可能抵不过人工修改的时间。

热摸爽这批标题中，有36条提到免费、价格或成本，说明有人在讨论使用费用。是否愿意付费，还要看实际使用、购买和任务收益，不能从标题推算。

## 用电要算，操作出错也要算

AI 的算力在服务器里，服务器得插电。

国际能源署 4 月发布的报告估计，全球数据中心 2025 年用电量为 485 TWh。其中心情景预测，到 2030 年约为 950 TWh，接近届时全球电力需求的 3%。这里包括全部数据中心，2030 年数字是预测，不能写成“AI 今年已经耗掉这么多电”。报告还指出，视频生成、推理和 Agent 等任务的单次耗电可以远高于简单文本生成。[IEA《能源与 AI 的关键问题》执行摘要](https://www.iea.org/reports/key-questions-on-energy-and-ai/executive-summary)

效率提高，使用量与任务复杂度也会增长。所以“一次调用便宜了”和“整个系统成本下降了”需要分别验证。对产品团队，这意味着缓存、减少重复工作和限制无效重试，有时比再加一轮推理更值得做。

操作错误也有成本。AI把订单、客户资料或公司文件改错，可能需要人工恢复，甚至影响后续工作。让它操作之前，要明确允许改哪些内容；操作之后，要检查最终结果。

ThinkingBox检查最终记录，长视频研究追踪角色与场景，社区工具保存执行步骤。这几种做法都方便人检查AI做了什么。任务有多个步骤时，还需要知道哪一步出错、能否从那里继续。

## 最后总结

把前面的资料放在一起，可以得出一个不夸张的结论：AI确实更会做事了，但“会做”与“能放心交付”仍是两回事。编程基准和长视频研究说明能力在进步；ThinkingBox则提醒我们，系统没有报错、Agent说任务结束，也可能留下错误结果。全球使用率和用户熟练度的研究也说明，同一个工具换一批用户、任务或设备，实际效果可能差很多。

这些材料还不足以判断哪家公司会赢，也无法预测哪些职业会被替代。它们能说明的是：评价AI，需要同时看模型能力和真实任务中的正确率、稳定性、返工时间。一次成功很适合做演示；连续多次都做对，出了错还能查清并恢复，才适合放进日常工作。

如果要判断某个AI工具值不值得付费，可以拿自己最常做的一项任务测试。先写清楚什么结果算合格，再记录成品能不能用、人工改了多久、失败后能否恢复，以及模型调用、工具服务和重试一共花了多少钱。写周报就核对数字和出处，做翻译就检查术语和漏译，写代码就运行测试并看后续是否容易维护。这样测出来的结果，才和自己的工作有关。

测试通过后，可以先把它用在风险低、容易验收的任务里，再逐步增加权限。若每次都要人从头检查，就让它先做初稿或辅助检索；若输出稳定，人工复核也明显变少，再考虑把更多步骤交给它。

回头看这几年的变化，AI的发展速度确实快得有点离谱。前几年大家还在研究它能不能把话说顺，现在已经要讨论它能不能操作电脑、写完程序、做出几分钟的视频。今天需要专门演示的功能，过几个月可能就成了常用按钮。照这个速度走下去，未来几年会出现什么新能力，我已经不太敢提前下结论了。

我更希望下一阶段的AI不只更聪明，也更可靠：不知道时别硬编，执行过什么要留下记录，做错后能撤回，价格别贵到让人用一次就心疼。等这些问题逐渐解决，AI才会从“偶尔让人惊叹”变成“每天真的好用”。

---

**数据说明与编辑说明**

本文为截至 2026-10-05 的阶段观察。站内样本来自北京时间 22:20 的单次公开接口快照，包含滚动保留内容。它不覆盖 2026 年全部事件，也不代表全网用户。全站返回 4,751 条记录；AI 来源返回 576 条，按移除 URL 片段标识后的链接去重为 576 条。不同链接可能指向同一事件。未按热度加权，未将阅读量、播放量相加。

本次接口返回310个来源，其中按站内分类筛出的AI来源为41个。接口当时标为降级，全站7个来源报错，41个AI来源均标为正常；部分来源仍保留旧条目。每个来源最多返回30条，因此只是当时取到的一批内容，不是全库统计。编程开发词组匹配26条，视频图像25条，本地端侧10条。同一标题可能包含多组关键词，不能把各项相加，也不能据此计算市场份额。[数据入口](https://remoshuang.com/api/hot?limit=30)

标题匹配词组如下：

- 智能体与工作流：agent/agents/agentic、智能体、工作流、workflow/workflows。
- 编程与开发：code/coding、codex、代码、编程、开发、程序员。
- 视频与图像：video、image/images、视频、图像、图文、视觉、生图、换脸。
- 价格与成本：cost/costs、price/pricing、budget、成本、价格、免费、收费、订阅、定价、便宜、会员。
- 本地与端侧：local、on 后加单字符分隔符再接 device（如 on-device）、本地、端侧、手机。

英文词按不区分大小写的词边界匹配，中文按字面匹配。此方法只统计标题信号，存在误匹配与漏检。词组可重叠，结果不作为事件主题占比。

外部数字分别采用其原报告的时间和口径。Anthropic 为 2026 年 2 月使用样本，微软为 2026 年 6 月人口使用估计。AI Index 引述为报告发布时的基准表现。IEA 的 2025 年用电为估计，2030 年用电为情景预测。企业自有产品数据和合成评测均不能直接外推至全行业。文中的产品判断与后续观察方向是作者分析。

## 关于本文数据

- 数据范围：2026-10-05 ～ 2026-10-05
- 数据来源：热摸爽2026-10-05 22:20北京时间公开API快照；Stanford AI Index 2026、Microsoft 2026年9月AI扩散报告、Anthropic 2026年3月经济指数、Microsoft/Hugging Face ThinkingBox、Google Research、IEA。外部资料统计期各异，文中逐项标注。
- 样本数量：576
- 统计方法：站内数据为单次截面，非2026年全量历史。公开接口每来源最多30条，全站310来源返回4751条；AI分类41来源返回576条，移除URL片段标识后按链接去重仍为576。仅标题中英文关键词匹配，不做互斥主题分类；命中数为智能体工作流57、价格成本36、编程开发26、视频图像25、本地端侧10。存在重复事件、误匹配、漏检、保留旧条目与来源选择偏差，词组不可相加，不加总平台热度。外部人口遥测、单产品使用、合成基准与能源预测分别使用原报告口径。

---

本文来自 [热摸爽原创](https://remoshuang.com/observe)。引用时请注明作者与原文链接：https://remoshuang.com/observe/ai-trends-report-2026
