腾讯发布AI创意智能体Miora、把 10.8GB vLLM 镜像
承上启下:在上一篇《Dive deeper into I、Amazon Aurora》中,我们分析了 Aurora MySQL 结合 Kiro Powers 的 AI 开发模板、Amazon Bedrock 服务配额观测,以及 Meta 新设部门为大企业定制 AI 系统的战略蓝图。随着业务向多模态内容与海量容器弹性扩缩迁移,底层镜像冷启动效率和算力芯片国产化替代成为当下云原生平台必须攻克的硬核关卡。本篇我们将围绕云原生冷启动优化与国产算力生态展开:详解基于 Hermes 和 SOCI 延迟加载技术将 10.8GB vLLM 超大镜像的 Kubernetes Pod 就绪耗时缩短为 14 秒的实测,以及腾讯 Miora 国际版多模态智能体开启邀测、海光芯片指令集内生商密安全防护体系。
腾讯发布AI创意智能体Miora、把 10.8GB vLLM 镜像
为什么值得关注
今天这组素材围绕科技、创业、技术筛出,当前组合来自36Kr、V2EX,主要线索包括 腾讯发布AI创意智能体Miora、把 10.8GB vLLM 镜像的 Pod Ready、海光信息携全系CPU和DCU产品亮相智博会。把它们放在一起看,重点不是把不同新闻强行合成一个单一主题,而是判断这些变化会怎样影响团队接下来几周或几个月的技术决策。
关键信息
- 腾讯发布AI创意智能体Miora(36Kr:36氪获悉,5月28日,腾讯于香港Cloud Day上宣布,全场景创意智能体工作室妙境 Tencent Design Miora国际版开启邀测,搭载多个海内外主流视觉模型,支持AI生成图片、视频、UI/UX以及3D等多种模态的内容。目前,用户可以通过邀请码进行体验。
- 把 10.8GB vLLM 镜像的 Pod Ready 从 4m35s 降到 14s: Hermes + SOCI lazy loading 实测(V2EX:最近在看 Kubernetes 上 AI 推理服务的冷启动问题,发现很多时候慢的不只是模型加载,容器镜像本身也很夸张。 比如 vLLM 这类镜像,里面有 PyTorch 、CUDA 、Python 依赖、系统库,动不动就是 10GB+。传统 containerd / overlayfs 路径下,节点要先完整下载并解压镜像,Pod 才能真正起来。对 Karpenter 这种弹性扩容场景来说,这部分时间会很明显。 我们做了一个小项目 Hermes: https://github.com/cloudpilot-ai/he…
- 海光信息携全系CPU和DCU产品亮相智博会(36Kr:36氪获悉,5月28日,天津智博会开幕,海光信息展出全系CPU和DCU产品。据介绍,海光双芯底座通过异构协同适配多元负载,系统性提升Token产值转化效率,同时搭载芯片级内生安全技术,从指令集层深度植入国密算法、可信计算等防护技术。此前,海光已联合伙伴发布“抗量子密码平滑迁移解决方案”,采用“商密+抗量子密码”混合架构,实现密码无缝切换,适配低延迟、高敏感场景。
21ZHAO 判断
本篇主线索是「腾讯发布AI创意智能体Miora」。判断轴:成本与延迟是否可量化。 对照「把 10.8GB vLLM 镜像的 Pod Ready 从 4m35s 降到 14s: Hermes + SOCI lazy loading 实测」只用于交叉验证,不与主线索强行合成同一产品结论。 对照「海光信息携全系CPU和DCU产品亮相智博会」只用于交叉验证,不与主线索强行合成同一产品结论。 有可核对对象与回滚路径才进入试点;否则保持跟踪。
可复用建议
- 腾讯发布AI创意智能体Miora:写明影响层、成功指标、一周复盘问题;缺证据则不进默认模板。
- 把 10.8GB vLLM 镜像的 Pod Ready 从 4m35s 降到 14s: Hermes + SOCI lazy loading:写明影响层、成功指标、一周复盘问题;缺证据则不进默认模板。
- 海光信息携全系CPU和DCU产品亮相智博会:写明影响层、成功指标、一周复盘问题;缺证据则不进默认模板。
- 决策前打开本篇参考来源,逐条确认版本与限制条件(针对「腾讯发布AI创意智能体Miora、把 10.8GB vLLM」主题)。
可延展观察
下一窗口只跟踪与「腾讯发布AI创意智能体Miora」同层的后续版本/复现案例;出现反向证据则下调优先级。
参考来源
- 腾讯发布AI创意智能体Miora - 36Kr。
- 把 10.8GB vLLM 镜像的 Pod Ready 从 4m35s 降到 14s: Hermes + SOCI lazy loading 实测 - V2EX。
- 海光信息携全系CPU和DCU产品亮相智博会 - 36Kr。
💡 下一篇预告:通过 Hermes 与 SOCI 的容器延迟加载,我们成功攻克了云端超大镜像的冷启动壁垒,但当 AI 的运行时环境从传统的 Kubernetes 演进至网络边缘和托管的云端智能体(Claude Managed Agents)时,我们不仅要优化拉取速度,更要解决智能体运行时沙箱隔离与 CPU 推理成本。在下一篇《Cloudflare Adds、2026 AI 下半场变天》中,我们将聚焦边缘计算与成本重构,探讨 Cloudflare 托管 Claude Managed Agents 的安全边界、AI 落地中 CPU 对 GPU 推理的算力分流,以及 Gemini 长会话同步 Docs 的联网写入幻觉。