2026年AI热点趋势报告

结合热摸爽AI栏目576条内容与机构报告,讨论AI操作结果是否可靠、不同人群怎样使用AI、视频能否保持连贯,以及模型费用和用电成本。资料截至2026年10月5日,各项数据注明统计范围。

热摸爽11 分钟阅读

机械手交出文件,旁边有服务器和电力连线;2026年AI趋势报告概念插画

AI能做什么,做出来的结果可靠吗?

作者:热摸爽|资料检索截至 2026 年 10 月 5 日

2026 年还没过完,给 AI 写全年总结有点早。但写一份阶段报告,已经能看到几条清楚的线索。

我更关心AI能不能把任务做完。回答问题只是一步:文件有没有改对,订单有没有处理好,生成的视频能不能直接用?这些结果需要逐项检查。

这篇报告参考两类资料:热摸爽当时收录的内容,帮助了解哪些话题有人在讨论;斯坦福、微软、Anthropic等机构的报告,提供能力、使用情况和成本的数据。讨论多不代表用的人多,也不代表产品效果好,后两个问题还要看具体研究。

不只聊新模型,也在聊怎么用

10月5日晚,热摸爽AI栏目收录的576条内容里,有57条标题提到了智能体或工作流,36条提到了免费、价格或成本。编程、做视频和本地运行,也都有人在讨论。

我更关心后面这些问题。模型又变强了,当然值得看;但真要拿来干活,还得问:这项任务能不能做?要花多少钱?结果不对,能不能查出哪里出了问题?这些问题,才关系到一个工具能不能留下来。

热摸爽AI栏目标题关键词命中数:智能体与工作流57、价格与成本36、编程与开发26、视频与图像25、本地与端侧10

图 1:热摸爽公开接口单次快照的标题关键词命中数。样本为 576 个不同链接,抓取时间为 2026-10-05 22:20(北京时间)。词组可重叠,标题匹配存在遗漏和误匹配,跨平台不同链接可能讨论同一事件。这批标题里,除了新模型发布,也有人讨论怎么用、要花多少钱。

Agent说完成了,还得检查结果

AI可以操作浏览器、文件和业务系统。但它说“完成了”以后,我们还得检查文件和记录有没有按要求修改。

10 月 3 日,微软团队与 Hugging Face 联合发布 ThinkingBox 的介绍。这个评测把 507 个合成业务工作流分别重复运行 20 次,检查最终后台状态和额外副作用。其中一组消融评测覆盖 12 个模型、121,680 次有效尝试,79,853 次没通过可执行检查。在这些失败中,67.24% 仍正常结束且调用了改变状态的工具,也没有报告最终工具错误。ThinkingBox 原始介绍

没有报错,也可能把事情做错。

这些是按真实业务模式重建的合成任务,不能直接解释为线上客服的失败率。不过,评测方式很有启发:让 Agent 自己总结成绩,像让考生自己批卷子。至少该看一下订单、工单和文件最后变成了什么样。

我更看重这类评测带来的验收标准。过去演示一次成功,足够让人惊喜。接入业务以后,就要追问换一份输入还行不行,连续跑能不能稳定。失败有没有留下多余修改,也得检查。模型是否理解要求、工具能做什么、出错后能否恢复,都会影响结果。

编程也在经历同样的变化。斯坦福 2026 AI Index 摘要引用了 Terminal-Bench 的数据。相关任务成功率从 2025 年的 20%,提高到报告发布时的 77.3%。这是特定基准上的进展,不能换算为“程序员效率提高了几倍”,也不能推算一个真实项目有多大概率交付。斯坦福 AI Index 2026 摘要

代码生成以后,还要运行、测试,核对需求,并确认后续能维护。选编程工具时,我会看它能否找到错误、修复并重新测试,而不只看一次生成了多少行。

讨论AI的人很多,使用情况仍有差异

微软 9 月 21 日公布的报告估计,2026 年 6 月全球劳动年龄人口中有 18.8% 使用过生成式 AI。阿联酋为 73.3%,新加坡为 64.3%;全球北方与全球南方分别为 28.8% 和 16.2%。这些是基于微软匿名汇总遥测、经设备和联网等因素调整的估计,统计对象为 15—64 岁人群。微软全球 AI 扩散报告说明

微软估计的生成式AI使用比例:全球18.8%、阿联酋73.3%、新加坡64.3%、全球北方28.8%、全球南方16.2%

图 2:2026 年 6 月、15—64 岁人口中在报告期内使用过生成式 AI 产品的比例。国家与区域汇总并列展示,不是统一层级的排名;这是遥测调整后的估计,并非人口普查。

如果每天刷 AI 社区,很容易觉得全世界已经人手几个 Agent。把视线移出技术圈,才会发现普及还很不均匀。18.8% 也只说明报告期内用过,没说明每天用多久、是否付费、有没有产生收益。

微软提醒,后续报告扩大新工具的覆盖后,估计值可能上调。中国可能上调得更多。这些估计会受语言、联网条件和统计覆盖影响,适合了解使用情况,不能拿来评价一个国家的人是否更懂AI。

Anthropic还研究了不同用户怎样使用Claude。其 3 月经济指数报告使用了 2 月样本。报告发现,注册至少六个月的用户更常与 Claude 迭代协作。控制任务、模型、用例和国家等因素后,他们的对话成功率约高 4 个百分点。成功由 Claude 评估,报告也承认早期用户特征和幸存者偏差的影响。Anthropic 2026 年 3 月经济指数

这提示,熟悉工具的人可能更容易完成任务。但它不足以证明“练半年必然提高四个百分点”。退出产品的人没出现在活跃样本里,早期用户也可能本来就更懂技术。

对普通读者,我更愿意给一个朴素建议:选一项重复工作,把输入、验收条件和失败案例留下来。写周报就检查关键数字,翻译就核对术语,整理资料就检查出处。积累这些材料,比每天收藏一篇“十个神级提示词”更容易知道自己究竟哪里进步了。

做视频要前后连贯,本地运行要看设备

生成一张惊艳的图,和交付一段能用的视频,中间隔着很多工序。人物换个镜头不能换张脸,杯子不能凭空消失,脚本也不能拍着拍着忘了。

Google Research 在 9 月 24 日介绍了长视频生成研究。它在 Gemini、Veo 等模型上增加编排层,追踪角色、场景和物体状态。反馈循环则用来改善跨镜头一致性。研究展示了分钟级视频及十分钟示例。这仍是研究和实验展示,不代表普通用户已经能稳定制作长片。Google Research 原始介绍

这项研究把脚本、分镜、角色和场景记录、生成与检查结合起来。对创作者来说,真正该记录的是重做了多少次、哪些素材能复用、人工修补花了多久。第一张图好看,还不能说明整段视频能用。

热摸爽样本中的视频图像词组命中 25 条,本地端侧词组命中 10 条。但只看标题会漏掉内容:一篇视觉论文可能没在标题里写“图像”,一个本地模型帖子也可能只写模型名。标题里相关词出现得少,不能说明这个方向的研究或应用少。

考虑在手机或电脑本地运行AI时,我会先问:是否需要离线使用,是否希望减少原始资料外传?再检查设备内存、耗电、安装维护难度,以及效果是否够用。本地部署并不会自动保证隐私,插件、日志和联网功能仍要检查。

机器人还要在真实环境里完成动作。会识别衣服,与能在不同光线、材质和摆放下把衣服叠好,涉及不同要求。世界模型、机器人演示可以作为研究信号,企业级稳定部署则需要另外的证据。看完视频先找任务条件和失败记录,通常比先找购买链接更有用。

不同任务,可以选择不同模型

最强模型包办所有事,听上去省心。实际工作还要等响应、算费用,处理重试和复核。

Anthropic 同一份报告还分析了可选择多类模型的付费 Claude.ai 用户。在该样本里,计算机与数学相关任务有 55% 使用 Opus,教育相关任务为 45%。这反映其用户在任务之间做选择,不能当作全行业的模型市场份额。Anthropic 模型选择分析

开放权重模型让用户多了一种部署选择。微软 9 月报告说,开放权重模型在其讨论的 API 使用数据中获得了更高的 token 份额。这个观察不等于整个 AI 市场份额,更不保证自部署总比托管服务便宜。微软报告中的开放权重观察

对预算有限的小团队,我会优先按任务分工。规则明确的格式转换先用程序,简单抽取或初稿再测试小模型。需要复杂判断的环节,交给更强的模型。前提是用同一批真实任务验收,发现质量掉了就调整,不能为了账单好看把错误留给客户。

成本也该算完整。可以把“每个验收合格结果的总成本”作为指标,把模型调用、工具服务、失败重试和人工复核一起记进去。分母用合格结果,才不会把生成一堆不能用的内容算成高产。便宜模型如果需要反复重做,节省的调用费可能抵不过人工修改的时间。

热摸爽这批标题中,有36条提到免费、价格或成本,说明有人在讨论使用费用。是否愿意付费,还要看实际使用、购买和任务收益,不能从标题推算。

用电要算,操作出错也要算

AI 的算力在服务器里,服务器得插电。

国际能源署 4 月发布的报告估计,全球数据中心 2025 年用电量为 485 TWh。其中心情景预测,到 2030 年约为 950 TWh,接近届时全球电力需求的 3%。这里包括全部数据中心,2030 年数字是预测,不能写成“AI 今年已经耗掉这么多电”。报告还指出,视频生成、推理和 Agent 等任务的单次耗电可以远高于简单文本生成。IEA《能源与 AI 的关键问题》执行摘要

效率提高,使用量与任务复杂度也会增长。所以“一次调用便宜了”和“整个系统成本下降了”需要分别验证。对产品团队,这意味着缓存、减少重复工作和限制无效重试,有时比再加一轮推理更值得做。

操作错误也有成本。AI把订单、客户资料或公司文件改错,可能需要人工恢复,甚至影响后续工作。让它操作之前,要明确允许改哪些内容;操作之后,要检查最终结果。

ThinkingBox检查最终记录,长视频研究追踪角色与场景,社区工具保存执行步骤。这几种做法都方便人检查AI做了什么。任务有多个步骤时,还需要知道哪一步出错、能否从那里继续。

最后总结

把前面的资料放在一起,可以得出一个不夸张的结论:AI确实更会做事了,但“会做”与“能放心交付”仍是两回事。编程基准和长视频研究说明能力在进步;ThinkingBox则提醒我们,系统没有报错、Agent说任务结束,也可能留下错误结果。全球使用率和用户熟练度的研究也说明,同一个工具换一批用户、任务或设备,实际效果可能差很多。

这些材料还不足以判断哪家公司会赢,也无法预测哪些职业会被替代。它们能说明的是:评价AI,需要同时看模型能力和真实任务中的正确率、稳定性、返工时间。一次成功很适合做演示;连续多次都做对,出了错还能查清并恢复,才适合放进日常工作。

如果要判断某个AI工具值不值得付费,可以拿自己最常做的一项任务测试。先写清楚什么结果算合格,再记录成品能不能用、人工改了多久、失败后能否恢复,以及模型调用、工具服务和重试一共花了多少钱。写周报就核对数字和出处,做翻译就检查术语和漏译,写代码就运行测试并看后续是否容易维护。这样测出来的结果,才和自己的工作有关。

测试通过后,可以先把它用在风险低、容易验收的任务里,再逐步增加权限。若每次都要人从头检查,就让它先做初稿或辅助检索;若输出稳定,人工复核也明显变少,再考虑把更多步骤交给它。

回头看这几年的变化,AI的发展速度确实快得有点离谱。前几年大家还在研究它能不能把话说顺,现在已经要讨论它能不能操作电脑、写完程序、做出几分钟的视频。今天需要专门演示的功能,过几个月可能就成了常用按钮。照这个速度走下去,未来几年会出现什么新能力,我已经不太敢提前下结论了。

我更希望下一阶段的AI不只更聪明,也更可靠:不知道时别硬编,执行过什么要留下记录,做错后能撤回,价格别贵到让人用一次就心疼。等这些问题逐渐解决,AI才会从“偶尔让人惊叹”变成“每天真的好用”。


数据说明与编辑说明

本文为截至 2026-10-05 的阶段观察。站内样本来自北京时间 22:20 的单次公开接口快照,包含滚动保留内容。它不覆盖 2026 年全部事件,也不代表全网用户。全站返回 4,751 条记录;AI 来源返回 576 条,按移除 URL 片段标识后的链接去重为 576 条。不同链接可能指向同一事件。未按热度加权,未将阅读量、播放量相加。

本次接口返回310个来源,其中按站内分类筛出的AI来源为41个。接口当时标为降级,全站7个来源报错,41个AI来源均标为正常;部分来源仍保留旧条目。每个来源最多返回30条,因此只是当时取到的一批内容,不是全库统计。编程开发词组匹配26条,视频图像25条,本地端侧10条。同一标题可能包含多组关键词,不能把各项相加,也不能据此计算市场份额。数据入口

标题匹配词组如下:

  • 智能体与工作流:agent/agents/agentic、智能体、工作流、workflow/workflows。

  • 编程与开发:code/coding、codex、代码、编程、开发、程序员。

  • 视频与图像:video、image/images、视频、图像、图文、视觉、生图、换脸。

  • 价格与成本:cost/costs、price/pricing、budget、成本、价格、免费、收费、订阅、定价、便宜、会员。

  • 本地与端侧:local、on 后加单字符分隔符再接 device(如 on-device)、本地、端侧、手机。

英文词按不区分大小写的词边界匹配,中文按字面匹配。此方法只统计标题信号,存在误匹配与漏检。词组可重叠,结果不作为事件主题占比。

外部数字分别采用其原报告的时间和口径。Anthropic 为 2026 年 2 月使用样本,微软为 2026 年 6 月人口使用估计。AI Index 引述为报告发布时的基准表现。IEA 的 2025 年用电为估计,2030 年用电为情景预测。企业自有产品数据和合成评测均不能直接外推至全行业。文中的产品判断与后续观察方向是作者分析。

关于本文数据

数据范围
2026-10-05 ~ 2026-10-05
数据来源
热摸爽2026-10-05 22:20北京时间公开API快照;Stanford AI Index 2026、Microsoft 2026年9月AI扩散报告、Anthropic 2026年3月经济指数、Microsoft/Hugging Face ThinkingBox、Google Research、IEA。外部资料统计期各异,文中逐项标注。
样本数量
576
统计方法
站内数据为单次截面,非2026年全量历史。公开接口每来源最多30条,全站310来源返回4751条;AI分类41来源返回576条,移除URL片段标识后按链接去重仍为576。仅标题中英文关键词匹配,不做互斥主题分类;命中数为智能体工作流57、价格成本36、编程开发26、视频图像25、本地端侧10。存在重复事件、误匹配、漏检、保留旧条目与来源选择偏差,词组不可相加,不加总平台热度。外部人口遥测、单产品使用、合成基准与能源预测分别使用原报告口径。

了解热摸爽的数据与排序方法