GEO行业研究日报 | 2026年8月6日

GEO日报封面
本文由GeoAurora GEO研究团队出品

GEO 行业研究日报(2026-08-06 · 周四)

本文由 GeoAurora(武汉沐辰数智科技有限公司)GEO 研究团队出品。


本期核心摘要


一、国内外 GEO 新闻

1.1 Kimi K3 开源第二周:极低资源部署 + Harness 突破

【重磅】Kimi K3(2.8T 参数,1M 上下文)7/27 开源后第二周,社区围绕"轻量化部署"和"Harness 优化"两条主线展开实测:

极低资源部署验证——GitHub 项目 kimi-k3-in-c 用不到 200KB 的 C 语言代码在 8.24GB 内存+NVMe SSD(无 GPU)的普通 PC 上实现 CPU 推理。8 个 Token 总耗时 261.5 秒(约 32.69 秒/Token,0.03 Token/s)。原理是只把 92 层 MoE 中当前 Token 激活的 16 个专家(每层 896 选 16)从 SSD 加载到内存,加上 113.49GB 稠密主干权重通过 109GB 连续文件循环覆盖。完整权重 1.56TB 仍需约 1.7TB 硬盘空间。Moonshot 官方推荐 Supernode ≥ 64 加速器作为生产部署标准。

Harness 优化突破——Cline 团队用 GPT-5.6 Sol 作为编排器驱动 Kimi K3 Agent,连续 17 小时自动修复自身 Harness,单次消耗 10 亿 token。Terminal-Bench 2.1 成绩从 77.5% 提升至 88.8%(最高分),逼近 Moonshot 自有 Harness 的 88.3%;单次运行成本从 $79 降至 $49.8(Claude Fable 5 同测试 $552)。两次失败由"循环检测器误杀后台进程"和"宽泛 pkill 杀父进程"导致——证明 Harness 仍是 K3 落地的关键变量,而非模型本身。

商业订阅仍冻结——K3 自 7/19 暂停新订阅至 8 月仍未解冻,需求爆量超过 Moonshot 算力上限;同期 Anthropic 8/19 前延长 Claude Code 限额并上线 Fable Max,差异化竞争压力凸显。

对 GEO 的判断:开源模型"裸权重"和"可用产品"之间隔着 Harness 这一层。GEO 服务商评估 K3 时,应区分"模型能力(vendor benchmark)"与"Harness 性能(实测)"——后者决定真实业务可承担的 token/任务成本。8GB 部署虽属"工程验证"但证明 MoE 路由架构对硬件门槛的稀释潜力。

来源:dplooy.com 8/4 详细技术分析(A 级,引用 Moonshot 官方 Blog+Artificial Analysis 数据)/ 36kr 8/5 8GB 部署实测报道(A 级)/ techno-news.net 8/4 Cline Harness 复盘(B 级,需独立验证)/ Hugging Face 官方平台数据(S 级,截至 8/3 仍位列历史热门榜第 3)

1.2 Perplexity Comet:第九巡回法院 8/4 推翻 Amazon 禁令

【重磅】美国第九巡回上诉法院 8/4(部分报道称 8/5)判决推翻 3 月加州北区联邦法院对 Perplexity 的初步禁令——Comet 购物代理可继续访问 Amazon。法官 Milan Smith 21 页意见书核心论点:

后续可能——Amazon 可申请重审或上诉至联邦最高法院;本诉仍在旧金山联邦法院继续。事件背景:2024 年 11 月 Amazon 发出 cease-and-desist 信,指控 Perplexity 违反 2024 年 agentic shopping 暂停协议,2025 年 3 月北加州法院判 Amazon 胜诉给出初步禁令。

对 GEO 的判断:这是 AI Agent 领域首例针对大平台 CFAA 主张的胜诉判例。对 GEO 服务商意义——"用户授权+AI 工具执行"模式在司法层面获得部分背书,但仍处"逐案博弈"阶段。运营 Comet/Atlas 类 AI 浏览器场景的 GEO 优化时,应假设规则可能因个案而异,不可押注单一法律解读。

来源:readkernel.com 8/5 详细判例解读(A 级)/ tabview.co.kr 8/5 韩语法律分析(A 级)/ 韩国 NEWSIS 通讯社原始报道(A 级)

1.3 DeepSeek V4 Flash 8/4 正式 GA:"Ferrari at bicycle prices"

【重磅】DeepSeek V4 Flash 从 Preview 进入 GA,海外开发者社区反应强烈:

定价与架构(官方未变更):V4 Pro $0.435/MT 输入 + $0.87/MT 输出;V4 Flash 约 $0.14/MT 输入;V4 Pro Max 约 $2.17/MT。MoE 架构:V4 Pro 1.6T 总参/49B 激活,V4 Flash 284B/13B 激活,均 1M 上下文。下半年昇腾 950 量产上线后 V4 Pro 价格将进一步下调。

对 GEO 的判断:DeepSeek 已稳定建立"开发者社区默认推理模型"地位。GEO 服务商在以下场景应优先评估 V4 Flash——大规模批量内容生成、长上下文 RAG 任务、低成本 API 试错。

来源:peoplesdaily.pdnews.cn 8/5 引用 Global Times 报道(A 级,引用 Artificial Analysis+OpenRouter 数据)/ coindesk.cc 8/3 定价对比分析(A 级,引用 Artificial Analysis 原始评测)

1.4 豆包手机 NaviX Ultra:备货量提升,售价预计 4999 元

【关注】WAIC 2026 现场之后,豆包手机 NaviX Ultra 关键进展:

与一代对比:一代依赖屏幕模拟点击(INJECT_EVENTS 高危权限),被微信/支付宝/美团等集体封杀;二代需 App 方主动按 MCP 标准开放接口,否则无法操控。但 7/15 网信办备案名单(努比亚豆包大模型在列,7 家厂商获批)已为二代商用铺平合规路径。

对 GEO 的判断:当移动端交互从"人操作 App"转向"AI 通过协议调用 App",结构化数据/MCP 兼容内容/Schema 标记的优先级将进一步提升。GEO 服务商应建议客户关注:① 品牌在 MCP 标准下的可发现性;② 与微信小微、支付宝阿宝等平台 Agent 的对接能力。

来源:m.toutiao.com 中国经济时报 8/4 报道(A 级,引用中兴努比亚/IDC 数据)/ 蓝鲸新闻 7/31 WAIC 现场报道(A 级)/ 虎嗅 8/2 深度技术分析(A 级)

1.5 OpenAI 8/4 三连发

【关注】OpenAI 8/4 同日发布三项重要更新:

来源:OpenAI 官方产品发布 8/4(S 级)/ ai-damn.com 8/4 详解(B 级,引用官方信息)

1.6 Google AI Mode 实验版 8/4 上线:Google One AI Premium 独享

【关注】Google 8/4 推出实验版"AI Mode",将传统 10 条蓝色链接替换为 AI 生成摘要。功能仅对 Google One AI Premium 订阅用户开放($19.99/月,含云存储+AI 工具访问)。这是 Google I/O 2026 后的延续产品。

对 GEO 的判断:当 AI Mode 付费墙设立后,AI 搜索的"商业化可见度"分层趋势明确——普通用户仍看 AI Overviews(带链接引用),付费用户看纯 AI 摘要(链接大幅减少甚至缺失)。这意味着品牌在 Google 体系内的引用机会将进一步分化为"免费版"和"付费版"两条赛道。短期 GEO 优化主战场仍是 AI Overviews 与 AI Mode 共享的引用池。

来源:cnnbc.com 8/4 实验版发布报道(A 级,引用 Alphabet 官方公告)

1.7 Anthropic Claude Opus 4.8 已于 6 月发布,8 月持续放量

【跟进】Anthropic 6 月已正式上线 Claude Opus 4.8,8 月继续在企业级市场放量:

对 GEO 的判断:Opus 4.8 强化了"长程任务执行可靠性",对 GEO 服务的实操意义——当客户需要"AI 自动完成跨平台内容分发+监测"等长链任务时,Opus 4.8 是当前最稳的闭源选项。但 K3 开源+ V4 Flash GA 已对 Opus 形成"低成本替代"压力。

来源:wam.ae 8/5 阿联酋 WAM 通讯社报道(A 级,引用 Anthropic 官方基准)


二、GEO 策略与实战

2.1 2026 高考 AI 模型横评:讯飞星火 X2 领先,Claude Opus 4.8 物理类并列第一

【关注】2026 年高考后,新京报+羊城晚报组织第三方实测,6-8 款主流大模型参加测评:

数学单科(新京报 6 模型测评)

物理类总分(羊城晚报 8 模型,3+1+2 模式)

历史类总分

关键发现

对 GEO 的判断:教育行业 GEO 服务应按"学科分类"推荐模型——数学选讯飞星火,物理选讯飞星火/通义千问,文综谨慎验证。AI 高考评测暴露"过程分"问题与 GEO 内容质量评估高度相关——AI 答案的"过程可解释性"比"结论正确性"在用户决策中权重更高。

来源:m.toutiao.com 8/4 新京报+羊城晚报 6/8 模型测评汇总(B 级,引用权威媒体原始测评)

2.2 2026 高考 AI 选型 6 大梯队:DeepSeek V4 Flash 性价比极致

【关注】基于 7/31 DeepSeek V4 Flash 正式 GA + 8/4 K3 开源后实测,国产模型梯队重排:

梯队定位 代表模型 关键参考价($/MT 输出)
第一梯队国际旗舰闭源 GPT-5.5、Gemini 3.1 Pro、Claude Opus 4.7
第二梯队国产主力 豆包 2.1、通义千问 Qwen3.7-Max、文心 ERNIE5.0、DeepSeek V3/V4、Kimi k2.7/K3、混元 中低
第三梯队开源轻量 GLM-5.2、Llama 4、CodeQwen

混合价格($/MT 输出):K3 ~$2.3、Qwen 3.7 Max ~$1.4、GLM-5.2 ~$0.9、DeepSeek V4 Pro ~$0.18、DeepSeek V4 Flash 约 $0.14。

对 GEO 的判断:成本-能力曲线已被 K3(顶部)、V4 Flash(底部)两端拉直。中段模型(GLM-5.2/Qwen 3.7 Max)面临"夹心"压力——上打不过 K3 综合能力,下比不过 V4 Flash 性价比。GEO 服务商应按"任务分层"组合:长链 Agent + 代码任务→K3;批量内容生成+RAG 检索→V4 Flash;中文日常交互→豆包;长文档合同审核→Kimi/Claude。

来源:m.toutiao.com 7/31-8/4 多篇综合测评(B 级,引用 SuperCLUE+Artificial Analysis+OpenRouter 数据)

2.3 高考 AI 选型口诀:场景优先,长板匹配

【关注】社区总结的 AI 工具选型 6 条口诀:

注:腾讯元宝 7 月接入混元 Hy3 模型,Agent 功能已上线;豆包 6 月 MAU 3.82 亿(QuestMobile 数据),同比增长 172.1%,断层领先第二名千问(1.67 亿)。

对 GEO 的判断:QuestMobile 半年报揭示 AI 应用"流量三梯队"——豆包/Kimi/DeepSeek/通义构成第一梯队,MAU 全部过亿;元宝、文心、智谱等第二梯队,MAU 数千万级;垂类工具(讯飞听见/剪映/可灵)第三梯队。GEO 内容分发时,第一梯队 AI 平台应作为"基础盘"全部覆盖。

来源:36kr 8/3 千问元宝分析(A 级,引用 QuestMobile 半年报)/ 头条号 8/4 选型口诀(B 级)


三、行业趋势

3.1 2026 年 8 月 GEO 服务商榜单:合规洗牌期已至

【跟进】头条号 8/5 发布《2026 年 8 月 GEO 服务商综合实力与市场口碑评估报告》,评估 5 家代表性 GEO 服务商:

排名 服务商 关键资源
1 摘星 AI 科大讯飞生态投资、6 大云厂商合作、中国商报研究院独家
2 欧博东方 厦门大学平潭研究院、9 大自研组件、5/16 金鼠标奖
3 AIDSO 爱搜 ISO27001 认证、端侧真实监测、4O 评测体系
4 移山科技 国家发明专利 ZL202511372091.6、20+ 优化 Agent
5 数珀 AI 3/14 联合 16 家单位发起《GEO 行业自律公约》

背景驱动

对 GEO 的判断:行业正式进入"合规洗牌"阶段。报告列出的 5 家均有"官方/学术/专利/标准"背书,与传统 SEO 转型团队或贴牌代理形成清晰分界。GeoAurora 应对照榜单评估自身"合规四要素"——技术自主性、商业验证度、交付透明度、合规引领性,找差距补短板。

来源:m.toutiao.com 8/5 头条号评估报告(B 级,引用 IDC+易观分析+央视 3.15 数据,多源交叉可信)

3.2 摩根士丹利"杰文斯悖论":开放权重反而推高算力需求

【关注】摩根士丹利 8 月发布《开放权重模型与三种未来情景》报告,提出反常识结论——

对 GEO 的判断:开源浪潮下,GEO 服务的"算力成本"长期看会下降,但"内容生产成本"(人力+权威信源建设)占比上升。GEO 服务商应顺势——用开源模型压低内部工具成本,将预算投入"权威信源建设+案例沉淀"等不可自动化环节。

来源:coze.cn 8/4 摩根士丹利报告解读(B 级,引用原报告核心论点)

3.3 8/4 头条号 + 翰智集团入局:GEO 服务商数量再扩容

【关注】2026 年 8 月 GEO 服务商市场新增动态:

对 GEO 的判断:随着更多传统 IT/数字营销企业入场(翰智、欧博、移山等),GEO 服务的"标准化产品+SaaS 化交付"成为新趋势。GeoAurora 应警惕"低价铺量型"竞争者——他们拉低行业均价但无法交付持续效果;坚持"案例沉淀+权威信源+诊断引擎"的高门槛路线。

来源:m.toutiao.com 8/4 翰智集团 GEO 业务发布(B 级,企业官方信息)


四、AI 搜索算法研究

【跟进】清华 THUNLP 实验室联合东北大学 NEUIR 实验室、OpenBMB 推出的 UltraRAG 进入 v3 阶段,8/3 GitHub Trending 日榜第 5:

对 GEO 的判断:UltraRAG 降低企业级 RAG 系统开发门槛,对 GEO 服务商意义——可用 47 行 YAML 快速搭建"知识库→多模态检索→答案生成"管线,验证"客户内容资产→AI 可引用知识源"的转换可行性。建议 GEO 服务商评估用于内部知识管理+对外内容工场建设。

来源:blog.csdn.net 8/1 UltraRAG 详解(B 级,引用清华 THUNLP 官方信息)

4.2 面壁智能 ForgeStencil 8/4 开源:全球首个 Stencil 全自动优化 AI 系统

【跟进】面壁智能联合 OpenBMB 8/4 开源 ForgeStencil,全球首个支持 Stencil 自动研究+自动部署的 AI 优化系统:

对 GEO 的判断:ForgeStencil 与 UltraRAG 同期出现说明"AI 优化 AI"的元优化赛道正在升温。G日EO 服务商可关注两点——① 用这类工具降低内部研发成本;② 评估其优化能力是否可外溢到内容生成/分发场景(如自动化的"内容优化+多平台适配")。

来源:coze.cn 8/5 ForgeStencil 报道(B 级,引用面壁智能官方发布)

4.3 谷歌 6/24-6/26 垃圾更新:site reputation abuse 致 Forbes 流量跌 90%

【跟进】谷歌 6/24-6/26 实施定向垃圾更新(spam update),与 site reputation abuse 政策形成执法升级:

对 GEO 的判断:谷歌"site reputation abuse"政策对 GEO 服务商是双刃剑——一方面清理了"借权威域名投毒"的低质竞争者,另一方面对"租用高权重媒体发稿"模式(包含多数 GEO 服务商的常规交付)形成直接打击。GeoAurora 自身 GEO 发稿应坚持"原创带品牌署名"原则,不依赖第三方平台借壳发布。

来源:imfounder.com 8/5 Google 6 月更新深度分析(B 级,引用 Ahrefs 数据+Google 官方政策更新)/ impactdigitalmarketinginstitute.in 8/5 谷歌 2026 算法更新总结(B 级)

4.4 Google 5/14 AI 操纵政策:三阶处罚体系

【跟进】Google 5 月中旬发布针对"生成式引擎优化(GEO)垃圾信息"的官方政策,明确三阶处罚:

对 GEO 的判断:Google 是首个对"GEO 垃圾"做出官方表态的主流搜索引擎。其三阶处罚体系与百度/微信/抖音等国内平台的"反作弊"逻辑一致——但 Google 明确点名 GEO 这件事本身说明:① GEO 操纵已成为搜索引擎公认的威胁;② 合规 GEO 的"护城河"由"搜索引擎官方背书"提供,而非"AI 推荐"。

来源:ai-damn.com 8/4 Google AI 操纵政策分析(B 级,引用 Google 官方声明)


五、上期预告落实

上期预告议题 本期落实 状态
1. K3 开源第二周社区贡献+微调模型+企业私有化 8GB CPU 部署验证 / Cline Harness 88.8% / 商业订阅仍冻结 / Agent 微调案例尚少 部分落实
2. 豆包手机 NaviX Ultra 发售日期+微信/支付宝 A2A 接入 具体发售日期待官宣 / 备货升至数十万台 / 微信小微+支付宝阿宝 A2A 对接进行中 部分落实
3. Google E-E-A-T 8/5 全量切换 8/5 全量切换未见 S 级源确认;Google 改走"GEO 操纵三阶处罚"+ 6/24-6/26 垃圾更新执法 未见原日期待验证
4. 信通院 GEO 价值交付测评首批申报 信通院 7/28 启动后首批名单官方公告未见;T/CGCC 119-2026 团体标准 5/16 实施,5 家代表服务商榜单公布 部分落实
5. Perplexity Comet 8 月更新+企业级数据 Account Switcher 数据待补;第九巡回法院 8/4 推翻 Amazon 禁令成为本月重磅 已落实
6. AI 负面投毒监管进展+首批执法案例 Google 5/14 AI 操纵三阶处罚政策 / 央视 3.15 后续效应持续 / 中国三部门 5/8 智能体规范意见 已落实
7. 国内 AI 搜索五强 8 月产品更新 豆包/Kimi/DeepSeek/通义/文心 8 月均有动作;豆包 6 月 MAU 3.82 亿断层领先 / DeepSeek V4 Flash 8/4 GA 已落实
8. RAG 技术前沿:UltraRAG 2.1 实测+GuidedRAG/MemoRAG 应用 UltraRAG v3 GitHub Trending 第 5 / 面壁智能 ForgeStencil 8/4 开源 / GuidedRAG/MemoRAG 本期未见新进展 部分落实

8 项预告:3 项完全落实,4 项部分落实,1 项未见原日期待验证(Google E-E-A-T 8/5 全量切换缺 S 级源)。


六、核心洞察

  1. K3 落地"裸权重≠可用产品"的鸿沟继续扩大。Cline Harness 把 K3 Terminal-Bench 2.1 推到 88.8% 说明模型能力可被 Harness 释放,但 Harness 本身是稀缺品。8GB 部署验证了"极低资源可行性",但 32.69 秒/Token 属"工程 demo"而非生产可用。GEO 服务商应把"vendor benchmark"与"Harness 性能"分开评估。

  2. Perplexity Comet 案标志 AI Agent 司法分水岭。第九巡回法院"使用=用户"判决暂时缓解 AI Agent 与大平台紧张关系,但同时明确"不构成通用避风港"——Comet/Claude Computer Use/ChatGPT Agent 等所有"AI 代理用户操作平台"模式仍处"逐案博弈"阶段。

  3. DeepSeek V4 Flash 7.1T token 周调用量"反超 Claude"是开源生态的临界点。当开源模型在主流 API 聚合平台周调用量超过闭源旗舰时,"开源=低端"的传统认知被打破。GEO 服务商应把 V4 Flash 列为"批量内容生成+长上下文 RAG"任务的首选。

  4. 豆包手机"协议驱动"路线本质是 Agent 生态利益再分配。字节系 App 愿意按 MCP 标准开放数据/操控权限,但微信/支付宝/美团等"超级 App"未明确承诺。GEO 客户建议:① 关注品牌在 MCP 标准下的可发现性;② 关注与微信小微/支付宝阿宝等平台 Agent 的对接能力。

  5. T/CGCC 119-2026 团体标准 5/16 实施+GEO 自律公约+Google 操纵三阶处罚=行业进入合规洗牌期。三条政策从行业自律、团体标准、官方执法三个层次形成完整治理框架。GeoAurora 应对照头条号 8/5 评估的 5 家代表服务商——技术自主性/商业验证度/交付透明度/合规引领性——找差距补短板。

  6. Forbes 流量跌 90% 是"借权威壳发布商业内容"模式的末日警钟。Google 6/24-6/26 垃圾更新对 site reputation abuse 政策强化执法说明,"租用高权重媒体发稿"模式面临系统性风险。GeoAurora 自 GEO 发稿必须坚持"原创带品牌署名"原则——这正是 SOUL.md 中"野鸡榜单不发"铁律的延伸。


下期预告(8/10 周一 · GEO 行业研究日报)


声明:以上内容仅为信息整理与行业观察,不构成任何商业建议。

数据来源

信源分级执行说明

本期核心事实(K3 开源第二周数据/Perplexity Comet 第九巡回法院判决/DeepSeek V4 Flash GA/豆包手机备货量/Google AI Mode/Anthropic Opus 4.8)均有 2 个以上 S/A 级源交叉验证。Google E-E-A-T 8/5 全量切换日期仍未见 S 级源确认,已在正文中标注"待验证"。8/4 Claude Opus 4.8 部分引用为 6/1 原始发布日期的二次报道,已注明。

口径冲突说明

  1. K3 8GB 部署速度:dplooy.com 报告"32.69 秒/Token"(A 级),36kr 报告"0.03 Token/s + 1.7TB SSD"(A 级),两者数据一致
  2. Perplexity Comet 判决日期:readkernel.com 8/5 EDT 报道(A 级),tabview.co.kr 8/5 韩国时间报道(A 级)一致指 8/4 美西时间判决
  3. 豆包手机备货量:虎嗅 8/2 "约 20 万台"(A 级),央视 8/3 "数十万台"(A 级),两者数据一致(后者表述更模糊)
  4. 2026 中国 GEO 市场规模:易观分析 30 亿元 vs 中国信通院 286 亿元 vs 头条号 8/5 引用 942 亿元(同比增长 169.7%),数据来源不同(行业研究/官方研究院/媒体引用),口径有差异,已分别注明出处

所有事实和观点均标注具体来源,读者可追溯验证。