让AI离开温室,走向动态世界:MineExplorer揭示顶级多模态大模型被忽视的能力断层 美团技术团队 2 hours 53 minutes ago 美团 LongCat 团队构建了 MineExplorer —— 首个在开放世界中做到分钟级长程任务的评测基准,系统性地评测多模态大模型在需要长程规划、并包含隐藏前置条件的任务中的真实能力。
下一代搜索智能体评测基准!美团开源LoHoSearch,用知识图谱校准AI能力认知 美团技术团队 2 hours 53 minutes ago 过去一年,我们见证了 Search Agent 能力的显著演进。在 BrowseComp 等评测上,顶尖模型准确率从最初的 30% 区间迅速攀升至 90% 以上。然而,当基准迅速饱和,其区分模型能力的价值也随之递减。
直播回放·含 ACL'26 杰出论文 | 美团 AI 顶会论文 32 篇精讲 美团技术团队 2 weeks ago 如果你正在关注 AI 前沿,这篇内容值得收藏。2026 年,美团技术团队数十篇论文被 ACL、SIGIR、ICML、KDD 等顶会收录。我们精选 32 篇,进行了 5 大专场直播。
正式开源!美团 LongCat-2.0 同步开放国产卡推理代码 美团技术团队 2 weeks ago 美团 LongCat-2.0 总参数 1.6T,平均激活约 48B,为真实的 Agentic Coding 任务而生,架构上创新性引入 LongCat 稀疏注意力和 N-gram Embedding,提升长上下文处理效率与 Token 级表示能力的同时,结合动态激活进一步强化了代码理解、生成以及执行的表现。
ACL 2026 精选论文分享:美团履约团队前沿技术专场 美团技术团队 3 weeks 3 days ago 美团业务研发平台/履约 AI 算法团队,聚焦构建大模型为基础的 Agent 技术体系,用 AI 赋能美团履约业务, 构建 Agent 自进化的运营系统。在大模型 CPT、Post-training、Agentic RL 以及多模态理解等核心前沿方向持续深耕,已在 ACL、EMNLP 等AI领域的国际顶会发表数十篇高质量研究成果。本文分享了美团履约团队专场聚焦 ACL 会议论文以及前沿技术实践。
美团技术团队顶会论文分享:搜索推荐ASX专场 美团技术团队 3 weeks 3 days ago 美团业务研发平台/搜推 ASX (Agentic System X)团队聚焦构建大模型为基础的 Agent 技术体系,在大模型后训练、Agentic 强化学习以及多模态理解等核心前沿方向持续深耕,已在 ICLR、NeurIPS、CVPR、AAAI 等 AI 领域的国际顶会发表数十篇高质量研究成果。本文精选了6篇进行解读,希望对大家有所帮助或启发。
美团 LongCat-2.0 正式发布:在国产算力集群上完成全流程训练与推理的万亿参数模型 美团技术团队 3 weeks 5 days ago 作为业界首个在五万卡国产算力集群上完成全流程训练与推理的万亿参数模型(总参数 1.6 T,平均激活约 48 B,动态范围 33B~56B),LongCat-2.0 从零开始预训练,原生支持 1M 超长上下文,其架构设计自始至终围绕一个核心目标:让模型在真实的 Agentic Coding 任务中,更高效、更稳定地完成代码理解、生成与执行。
LongCat 开源 VitaBench 2.0:长期动态智能体基准新标杆 美团技术团队 3 weeks 6 days ago VitaBench 2.0 是首个真实生活场景下面向长期动态用户建模的智能体评测基准,它系统性地评测大语言模型在长期、真实、动态的用户互动中个性化与主动性的能力。
ICML 2026 | 美团技术团队学术论文精选 美团技术团队 3 weeks 6 days ago ICML是机器学习领域最具影响力的国际顶级学术会议之一。大会旨在探讨机器学习未来发展所面临的关键挑战与核心问题,并通过征集和评估具有重要理论价值和实际影响的前沿研究成果,推动领域发展并引领未来研究方向。
美团海报生成 AIGC 技术创新与实践 美团技术团队 1 month ago 美团智能创作团队围绕海报生成 AIGC 构建了完整技术体系,打造「生成-编辑-评判」技术闭环,目前在美团外卖、品牌 IP 等场景落地,已全部开源。
从月球漫步到赛博都市,WBench 测出了世界模型的边界 美团技术团队 1 month 1 week ago 美团 LongCat 团队提出并开源 WBench,它是首个面向交互式视频世界模型的系统性多轮评测基准。它就像一台“CT 扫描仪”,能精准定位当前世界模型在从“被动观看”到“主动交互”的过程中,到底卡在了哪里。。
ACL 2026美团论文精选:从能力评测到推理优化,构建生成新范式 美团技术团队 1 month 2 weeks ago ACL是计算语言学和自然语言处理(NLP)领域的国际顶级学术会议,本文解读了被 ACL 顶会收录的其中 6 篇论文,技术方向覆盖大模型评测、复杂流程推理、竞赛级数学思维优化、强化学习优化、生成式推荐等领域。
从高拟真到真可用,LongCat-Video-Avatar 1.5 正式开源 美团技术团队 2 months ago LongCat-Video-Avatar 1.5是一款从开源 SOTA 迈向商业级应用的数字人视频模型。在唇形同步、物理合理性、长视频稳定性、多人互动和高效推理上实现了全面跃升。LongCat-Video-Avatar 1.5 即便在复杂商业场景里,也能稳定、自然地输出高质量内容,让数字人视频生成从彩排室的完美演练,走向千人千面的真实舞台。
美团 LongCat 开源 General 365:树立推理评测新标尺 美团技术团队 2 months 1 week ago 美团 LongCat 团队正式发布 General 365。我们发现,在对 26 款主流模型的实测中,目前地表最强的 Gemini 3 Pro 准确率仅为 62.8%,而绝大多数模型甚至没能摸到 60 分的及格线。
用Agent评测思路管理AI Coding —— 31万行代码AI重构的实践 美团技术团队 2 months 3 weeks ago 当 90% 以上代码由 AI 生成,决定系统走向的不是谁写得更快,而是约束 AI 的能力。没有统一规范,AI 只会成倍放大混乱。本文基于 31 万行代码重构实践,分享我们如何用 Agent 评测思路管理 AI Coding——通过技术债梳理、建设Rule、重构 SOP 和 Pre-PR 机制,把重构从高成本专项变成随迭代持续推进的日常动作。
LARYBench 发布:定义具身动作表征 ImageNet,首次度量从人类视频学习的泛化表征 美团技术团队 3 months ago LARYBench (Latent Action Representation Yielding Benchmark),一个指引从大规模的视觉数据学习到通用的隐式动作表征的系统化评测基准。实验结果表明:在动作泛化和控制精度上,通用视觉模型的表现均显著优于专门为具身智能设计的动作专家模型,具身动作表征可以从大规模人类视频数据中涌现。
突破零样本 TTS 音色克隆上限:LongCat-AudioDiT 的声音克隆艺术 美团技术团队 3 months 1 week ago 能不能让 AI 直接学会声音本身的规律,跳过中间环节?为破解这一技术瓶颈,美团 LongCat 团队正式发布 LongCat-AudioDiT。在该模型中,彻底抛弃梅尔谱等中间表示,直接在波形潜空间进行基于扩散模型的文本转语音(Text-to-Speech, TTS),从根源阻断数据转换的级联误差。
LongCat-Flash-Prover:AI 攻克数学定理证明,不仅要“算得对”,更要“证得严” 美团技术团队 3 months 3 weeks ago 在常规的数学解题中,模型只需要“答对最终数值”即可,但数学定理证明不同,它要求极度严苛的逻辑链条,任何一句自然语言的模棱两可,都可能导致整个证明的崩塌。那么,如何让 AI 从“猜答案”走向“严谨证明”,成为复杂推理具有挑战的课题。为了解答这个问题,我们开源了专门用于数学形式化与定理证明的模型 —— LongCat-Flash-Prover。
美团发布原生多模态 LongCat-Next:当视觉和语音成为AI的母语 美团技术团队 3 months 3 weeks ago LongCat-Next 是我们在通往物理世界 AI 道路上的一次探索。今天,我们把研究思路的核心——LongCat-Next 模型和它的离散分词器全部开源,希望更多开发者能基于它,构建真正能感知、理解并作用于真实世界的 AI。
美团 BI 在指标平台和分析引擎上的探索和实践 美团技术团队 4 months 1 week ago 美团数据平台构建了以指标平台为核心的新一代 BI 架构,通过自动语义和增强计算两种核心能力的建设,部分解决了传统 BI 平台在个性化数据集驱动下产生的数据口径混乱、查询性能差等问题。