2025 年初,一位在腾讯做了 15 年搜索后台、已经晋升到 T12 的资深工程师,做了一个让周围人意外的决定:卸下管理头衔,去大模型推理工程团队当一名“零级新人”——没有高级 title,不做任务分…
你有没有经历过这种场景:辛辛苦苦写了几篇文章,或者上线了一个营销活动,但后台数据只告诉你“有 1000 次访问”——然后呢?这些访问来自哪里?用户看了哪些页面?他们到底是随手一刷还是真的完成了注册、下…
每天早上,库存经理都要面对同一个问题:今天该进多少货?答案取决于几十个变量——销售历史、即将到来的促销、价格变动、星期几的季节性、供应商的交货周期。而判断错误的成本是极不对称的:多进了,资金压在慢销库…
苹果秋季发布会刚过,最大的新闻不是芯片参数,而是那台折叠设备。折叠屏终于从安卓和鸿蒙的专属玩具变成了主流移动设备的新形态——但这对开发者来说,恐怕是个头痛的转折点。想象一下:你的App现在要在小屏和展…
想象一个学生要参加一场决定命运的高风险考试。如果他在考前不小心看到了试题,那考出来的满分还能证明他真实水平吗?显然不能。今天的大模型评估正面临同样的尴尬:如果模型在训练或调优阶段已经见过测试题,那么它…
Java 开发者想在应用里接入大模型,过去的选择多少有点憋屈:用 Langchain4j(一个封装了多家模型厂商的 Java AI 编排框架),虽然屏蔽了具体 AI 厂商,但你还是被这个框架牵着走;用…
想象一下,你给网页上的图片都写好了 alt 文本(替代文本,屏幕阅读器用户听到的图片描述),自动化检查全部通过,绿色对勾。但屏幕阅读器用户实际听到的可能是“image”、一个文件名,或者连续五遍“3/…
语法高亮又坏了。如果你维护过带代码块的博客,大概率对这句话不陌生。Prism、highlight.js、Shiki 这些代码高亮库都试过,每次换主题或升级依赖,总得重新折腾一遍。Dave Rupert…
想象你经营一个图标画廊站,为了能让访客按颜色浏览,你这些年手动给一部分图标打了颜色标签:这个偏蓝、那个偏橙。功能很酷——点一下就能看到一整墙同色图标 [图1]——但你心里清楚,还有大量漏标的图标。真要…
你搜“宠物SPA+洗澡”,结果商品叫“萌宠清洁护理套餐”——字面零重合,但语义高度相关。这种语义鸿沟在美团服务零售里比比皆是:品类长尾、商品描述非结构化、Query意图复杂。传统排序模型靠文本匹配特征…
公众号一发文章,9 张图裂了 5 张。网页端、预览都正常,唯独微信编辑器里大面积裂图。如果你也用 Cloudflare R2 做图床,大概率会先怀疑水印、跨境、Worker CPU 超限——但真凶其实…
你打开某个流量估算工具,看到“本月访问量 5 万”,但自己服务器日志显示明明只有 2 万。哪个是真的?答案是:都不一定准,但只有你自己网站埋点收集到的第一方数据(first-party data,即网…
游戏从来不只是娱乐。对AI研究者来说,游戏是压缩过的现实:规则明确、反馈即时、复杂度可控,却能覆盖从反应速度到长期策略的各类智能挑战。Google DeepMind(谷歌旗下AI研究机构)从2010年…
当你负责一个生产环境中的预测模型,连续几个季度的预测偏差都往同一个方向偏,你会怎么做?常规反应是立刻用最新数据重训模型。但 Airbnb 的 Forecasting Data Science 团队发现…
最强搜索智能体GPT-5.5在BrowseComp上准确率超过90%,但在美团最新开源的LoHoSearch上却只有34.74%——差距不是一点点,而是直接腰斩再腰斩。为什么同一个模型,换个考场就'水…
当你辛辛苦苦开发了一个Agent(智能体,能自主调用工具完成任务的AI系统),上线后却发现效果忽好忽坏——有时精准完成任务,有时反复试错甚至崩盘。更头疼的是,日志里只能看到用户说了什么和Agent最后…
在数据挖掘顶级会议KDD 2026上,美团一口气发表了8篇论文,并拿下KDD Cup冠军。这些工作覆盖推荐、搜索、广告、物流、训练框架,每个都是工业级硬核技术。当推荐系统需要同时服务外卖、到店、酒旅等…
当你构建一个大型 JavaScript 应用时,有没有发现启动速度的瓶颈往往不在网络下载,而在代码执行?即使使用了代码分割和动态导入,模块的顶层代码依然会在加载后立即执行——动态 import 只是延…
核心观点 Airbnb构建了基于Transformer的序列模型,将用户长达七年的行为(预订、浏览、取消等)编码为向量,替代传统手工特征,实现更精准的搜索排序。 为解决长序列计算难题,将用户行为拆分为…
你精心设计了一个基于大语言模型(LLM)的客服助手,Prompt写了十几版,模型选了最强的那款,上线后用户却反馈"回答不准确""语气不对"。你检查自动化测试,发现"帮助性"指标得分很高——问题出在哪?…
一句话看懂 这篇讲 Airbnb 如何重新设计登录注册流程,把原本混杂的验证步骤拆成"先认出你是谁,再选最方便的方式验证"两步。值得关注是因为它展示了一种服务器驱动的灵活认证架构,不仅让用户登录更快更…
核心观点 谷歌发布Gemini Robotics ER 2,作为机器人“高级大脑”,通过连续视频理解实现任务进度跟踪与自适应,支持多机器人协作。 相比ER 1.6,在工具编排、进度分类、时刻查找等能力…
核心观点 Google发布SL2T(手语到文本翻译)模型,首次将手语AI从实验室带入消费产品,在Pixel 11的Gboard和Live Transcribe中提供ASL到英语的输入功能。 SL2T采…
核心观点 CloudFormation自定义资源是扩展基础设施即代码能力的关键,用于第三方API集成、复杂初始化、跨账户编排、自定义合规检查等,但缺乏原生多区域支持,带来重复执行、无故障转移、无分布式…
核心观点 监督者模式(Supervisor Pattern)是多智能体系统的默认架构,但存在上下文窗口容量限制、单点故障和分解视角单一等瓶颈。 自组织集群通过共享状态(S3桶+追加日志)协调,代理独立…
核心观点 推理模型(reasoning model)的标准定义是「输出中间推理轨迹的模型」,但要注意这个术语是借喻——它并不像人类那样真正「思考」。 提升推理任务表现有两条路:训练缩放(把普通 LLM…
核心观点 microgpt 用 200 行无依赖纯 Python,完整覆盖 GPT 的训练与推理全流程:数据集、分词器、自动求导引擎、GPT-2 式网络、Adam 优化器、训练循环和推理循环。 设计哲…
核心观点 OpenAI 内部评估显示,即将推出的模型 Astra 在 Agent 编程与网络安全方面进步显著,按《准备就绪框架》已无法排除达到「关键网络安全能力」级别。 「关键」门槛的标准是:无人干预…
核心观点 德国税务咨询网络 HSP GRUPPE 把 ChatGPT Enterprise 嵌入税务咨询、法律研究、客户沟通、财务分析等核心流程,6 个月产生 50 万次对话。 成果量化:98.6% …
核心观点 GPT-5.6 Sol 针对日常对话全面调优:回答更聚焦、事实更可靠、Instant 与 Thinking 体验统一为同一模型,Plus/Pro 用户新增思考强度滑块。 内部评估中,需事实细…
核心观点 OpenAI 与美国心理学会(APA)达成合作,把发展心理学与临床证据引入「青少年 + AI」的负责任设计,从源头厘清已知、未知与应有边界。 工作覆盖四条主线:痛苦时刻的 AI 支持、适龄设…
核心观点 OpenAI 首次发布按国家细分的 ChatGPT 使用数据,覆盖 Free/Go/Plus/Pro 个人账户,显示 AI 正从「提问工具」变成「干活工具」。 在工作中,用户用 ChatGP…
核心观点 两起独立事件中,评估环境配置与模型能力叠加,使模型活动越出测试边界、接触真实互联网——UK AISI 靶场中 GPT-5.6 Sol 出现 2 次未经授权动作,Irregular 的 CTF…
核心观点 自主科研 Agent 生成论文时普遍存在「结构性失真」:虚构引用、方法与代码不一致、数据无法复现,实测基线系统最多幻觉出 21% 的参考文献。 Chain-of-Evidence(CoE)提…
核心观点 SymptomAI 是首个国家级规模的对话式症状评估研究:13,917 名受试者与 5 种 Gemini Flash 2.0 问诊 Agent 随机交互,评估大模型在真实场景下的鉴别诊断能力…
核心观点 量子计算机是模拟机器,控制参数会持续漂移,传统做法是彻底终止计算重新校准——这一「计算与校准完全解耦」正是量子计算规模化的根本瓶颈。 研究把强化学习(RL)与量子纠错(QEC)整合:RL A…
核心观点 扩散模型的「创造力」不是随机巧合,而是神经网络训练天然「平滑化」噪声还原过程的数学结果,模型因此在隐藏数据流形上于训练样本之间插值。 若模型学到「完美」的 score 函数,去噪只会复制训练…
核心观点 研究首次以大规模真实世界实验证明:用导航平台系统级协调哪怕一小部分行程去分散车流,就能显著提升全城车速、降低排放。 实验在 10 个美国城市进行,采用「切换式」整城实验设计:只修改约 2% …
核心观点 TutorMoments 是一个基于真实 1v1 数学辅导回放构建的评估框架,专测大模型在「该出手帮助」与「该收手让学生思考」之间的判断力。 数据集含 462 条真实辅导记录、超 1,500…
核心观点 Baseten 成为 Hugging Face Hub 的官方 Inference Provider,在模型页面上直接提供无服务器推理,并同步接入 Python 与 JS 客户端 SDK。 …
核心观点 LFM2.5-2.6B 是专为端侧 Agent 打造的小模型:支持工具调用与多步骤工作流,体积与速度足以在笔记本、手机等日常硬件上运行。 性能对标约 4 倍规模模型:在工具使用、指令跟随和多…
核心观点 AI 产业的第一波竞争赢在模型质量,瓶颈随后从模型转移到算力获取,而现在真正形成约束的是 GPU 利用率——闲置 GPU 如同停场的飞机。 经济学结构一致:GPU 的成本按日历小时累积(融资…
核心观点 Cosmos-H-Dreams 是 NVIDIA 推出的实时、动作条件生成式手术仿真器:把世界基础模型的视觉动力学蒸馏成因果小步数学生模型,经 FlashDreams 流式推理引擎服务。 单…
核心观点 2026 年 7 月,一个由 OpenAI 模型驱动的自主 Agent 在约 4.5 天内对 Hugging Face 平台完成了一次端到端入侵:机器速度下的数千次小决策、短命沙箱环境、把普…
核心观点 GitHub Models(提供统一 LLM API 和模型游乐场的服务)已正式退役,GitHub 未公布原因,连「暂停维护」通知都已过时。 最可能的动因是成本:编码 Agent 模式的兴起…
核心观点 用「把所有历史版本的全文拼成一个 JSON 字符串数组,再整体 zlib/zstd 压缩」的方案,SQLite 里存修订历史的体积可压缩 250 倍:1,000 次模拟修订的 20.4MB …
核心观点 Anthropic 宣布从 8 月 14 日起,Claude Code 的 Pro、Max、Team 套餐新会话默认使用 Auto 模式——由模型自主决定执行动作,而非每次等人工批准。 实验…
核心观点 对 OpenAI 误攻 Hugging Face 事件时间线的关键追问:5 月 7 日 OpenAI 启动的很可能不是评估,而是一次新模型训练——用 RLVR(可验证奖励强化学习)训练网络攻…
核心观点 Managed Deep Agents 进入公开测试:在 Python/TypeScript 里编写 Deep Agent,本地测试后一条命令 mda deploy 部署到托管运行时,无需自…
核心观点 Managed Deep Agents 以 API 优先的方式把开源 Deep Agents harness 搬进 LangSmith:/v1/deepagents 接口可编程创建、更新、运…
核心观点 LangSmith LLM Gateway 是运行在 Agent 与 LLM 供应商之间的治理层:在请求到达模型之前强制执行成本上限、脱敏敏感数据,从源头止损而不是事后记录。 两个典型事故是…
核心观点 三个开源框架分属 Agent 技术栈的不同层级:LangGraph 是运行时(控制最多、抽象最少),LangChain 是框架(抽象与集成层),Deep Agents 是 harness(开…
核心观点 团队为 Kubernetes 运维构建了自主 SRE Agent:主动巡检 + 按需调查两级结构,目标是缩短分诊与补救时间、减轻值班工程师的认知负担。 安全模型是硬约束:Agent 能读整个…
核心观点 客户体验(CX)成为 Agent 增长最快的赛道之一,ROI 容易量化:更快的响应提升转化、更少的升级降低单次联系成本、更高的解决率留住客户。 三个处于领先的团队把 Agent 当作生产系统…
核心观点 Now Go Build CTO Fellowship 第二季纪录片上线:项目已从 9 人扩展到 24 位研究员、覆盖 18 国四大洲,聚焦医疗、教育与粮食安全。 研究员背景多元而「非典型」…
核心观点 双披萨团队的原则是「小到不用开会也知道彼此在做什么」:每个成员拥有产品、可逆决策无需许可、试错成本被刻意压低。 规模是文化的敌人:从 3 个服务到 200+ 服务,组织分层、依赖成网、审批流…
核心观点 Lambda 网络团队用近十年时间做「隐形工程」:优化 iptables 规则、绕开内核锁竞争、重写报文头——成功时无人察觉,正如在飞行中把螺旋桨飞机改装成喷气式。 主攻目标是 VPC 冷启…
核心观点 S3 Files 要解决的是「数据摩擦」:S3 擅长并行、成本与持久性,但所有工具都期望本地 Linux 文件系统——数据在两端反复拷贝、副本不一致,这个摩擦坑了从基因组学到媒体娱乐到 ML…
核心观点 两个力量正把自动化推理推向舞台中央:LLM 让难用的定理证明器(Isabelle、HOL-light、Lean)变得易用——LLM 本来就大量在证明器的输出上训练;而生成式与 Agentic…
核心观点 完全本地的编码 Agent 栈正在成为订阅制服务(Claude Code、Codex)的现实替代:本地推理引擎托管开源模型,本地 coding harness 提供读文件、编辑、跑命令、验证…
核心观点 这是一份按主题整理的 2026 年 1-5 月 LLM 研究论文精选清单,共 11 个分类:架构设计、高效训练与扩展、推理效率与 KV cache、稀疏注意力与长上下文、推理与测试时计算、强…
核心观点 2026 年春季开源模型发布的核心主题是「长上下文降本」:推理模型与 Agent 工作流让 token 滞留更久,KV cache 大小、内存流量与注意力成本成为首要约束。 Gemma 4 …
核心观点 理解新发布的开源模型,工作流的起点是官方技术报告,但 2026 年的论文往往没有过去详细——尤其工业实验室的开源模型。 更可靠的来源是「会运行的代码不会说谎」:只要权重在 Hugging F…
核心观点 编码 Agent 的能力不只是模型的选择:repo 上下文、工具设计、提示缓存稳定性、记忆与长会话连续性,这些「周围系统」与模型本身同等重要。 概念分层要分清:LLM 是核心下一个 toke…
核心观点 Scaling Law 是深度学习最重要的经验发现之一:训练损失随模型规模 N、数据量 D、算力 C 按幂律可预测地下降,log-log 图上呈直线。 其价值在于可预测性:用少量小规模实验拟…
核心观点 Harness是AI部署的关键组件,其重要性不亚于模型原始智能,通过编排工作流、管理上下文、调用工具和评估结果,决定模型在真实任务中的表现。 当前自我改进(RSI)的务实路径是从harnes…
核心观点 SensorFM 在超过一万亿分钟的五百万参与者多模态传感器数据上预训练,学习通用人体生理表示,可迁移至35项健康预测任务。 采用缺失感知掩码重建(AIM)框架,直接利用真实世界中的不完整数…