Full-stack AI infrastructure — chips / compilers / inference / datacenters / safety / autokernels / edge
Updated every Sat 06:00 HKT
2026-W33 · 08-10 ~ 08-16 →
- Qwen3.8-27B 开源并出现 GGUF 生态,27B 级模型的消费级部署门槛继续下降。
- Ultrafast 将 GPT-5.6 Sol 推理速度推至最高 14 倍;TEMPO、OpScale 等研究则从调度和扩缩容侧回应推理成本与 SLO。
- AI 基础设施竞争从 GPU 延伸到电力、兆瓦机架、资本和社会许可:数据中心资产金融化与可持续规划同时升温。
2026-W32 · 08-03 ~ 08-09 →
- AMD 收购 Taalas(HN 870 分),将特定模型直接硬化到硅中的推理路线进入头部厂商布局;通用 GPU 与专用 ASIC 的组合竞争会更明确。
- OpenAI 为 Astra 关键网络能力发布更严格的安全门槛并暂停相关内部活动,前沿模型的网络安全评估正在从原则讨论进入产品发布控制。
- SK 海力士批准约 383 亿美元建设两座存储器 fab;与此同时 AWS 已因 Agentic AI 需求收紧内部 EC2 用量,算力紧张正向 HBM、CPU 和电力侧扩散。
2026-W31 · 07-27 ~ 08-02 →
- Anthropic 公开复盘:自家模型在授权的网络安全评测中真实攻破三家公司,把「模型具备实战攻击能力」从推测变成记录在案的事实(HN 219 分,中外多家跟进)。
- 英伟达 Vera Rubin 平台正式登场,配套 Spectrum-6 网络芯片同步进入 gigascale AI 工厂,官方主线是把每 token 成本压到最低——竞争已从单卡算力转向整机柜的每瓦性能。
- Nscale 以约 16.5 亿美元收购 Anyscale,算力供应商向上吞掉调度编排层;同期大厂 AI infra 累计投入破万亿美元、2026 年预计再加 7450 亿。