Agent评测漫谈 —— 由浅入深讲解Agent评测 美团技术团队 15 hours 18 minutes ago 本篇博客是一篇科普文章,由浅入深的介绍Agent评测。其中前两章系统介绍了评测是什么,以及如何建立评测体系;其中第二章是美团图灵Agent评测团队深入美团各业务团队BP总结出的实践经验,是我们在两年实践过程中逐步打磨出来的认知。
KDD'26美团学术论文精选及KDD Cup'26 DataAgents赛道冠军思路解读 美团技术团队 15 hours 18 minutes ago 本文精选了美团技术团队被 KDD 2026 收录的 8 篇论文进行分享,这些论文覆盖了推荐大模型、生成与奖励建模框架、智能体搜索、Transformer 框架、元泛化框架等技术领域。
美团搜索3.0:LLM 语义表征在排序模型的探索与应用 美团技术团队 15 hours 18 minutes ago 美团搜索团队正依托团垂融合新架构与生成式大模型新技术,全面重构本地生活搜索底座。本系列技术博客将持续介绍美团搜索 3.0 的技术探索,本文聚焦 LLM 语义表征在服务零售排序场景上的三期实践——从单点特征验证到系统性表征体系构建,再到跨场景迁移复用,探索语义匹配信号在搜索排序中的应用路径。
美团正式发布 CatPaw:全场景 AI Agent,从个人提效到企业智能化 美团技术团队 3 weeks 3 days ago 搭载美团 LongCat 2.0 的全场景 AI Agent 平台 CatPaw 正式上线,我们将模型能力从“跑得动”推向“用得好”。CatPaw 提供开箱即用的 AI 智能工作台与企业级 Agent 开发托管能力。
让AI离开温室,走向动态世界:MineExplorer揭示顶级多模态大模型被忽视的能力断层 美团技术团队 3 weeks 3 days ago 美团 LongCat 团队构建了 MineExplorer —— 首个在开放世界中做到分钟级长程任务的评测基准,系统性地评测多模态大模型在需要长程规划、并包含隐藏前置条件的任务中的真实能力。
下一代搜索智能体评测基准!美团开源LoHoSearch,用知识图谱校准AI能力认知 美团技术团队 3 weeks 3 days ago 过去一年,我们见证了 Search Agent 能力的显著演进。在 BrowseComp 等评测上,顶尖模型准确率从最初的 30% 区间迅速攀升至 90% 以上。然而,当基准迅速饱和,其区分模型能力的价值也随之递减。
直播回放·含 ACL'26 杰出论文 | 美团 AI 顶会论文 32 篇精讲 美团技术团队 1 month 1 week ago 如果你正在关注 AI 前沿,这篇内容值得收藏。2026 年,美团技术团队数十篇论文被 ACL、SIGIR、ICML、KDD 等顶会收录。我们精选 32 篇,进行了 5 大专场直播。
正式开源!美团 LongCat-2.0 同步开放国产卡推理代码 美团技术团队 1 month 1 week ago 美团 LongCat-2.0 总参数 1.6T,平均激活约 48B,为真实的 Agentic Coding 任务而生,架构上创新性引入 LongCat 稀疏注意力和 N-gram Embedding,提升长上下文处理效率与 Token 级表示能力的同时,结合动态激活进一步强化了代码理解、生成以及执行的表现。
ACL 2026 精选论文分享:美团履约团队前沿技术专场 美团技术团队 1 month 2 weeks ago 美团业务研发平台/履约 AI 算法团队,聚焦构建大模型为基础的 Agent 技术体系,用 AI 赋能美团履约业务, 构建 Agent 自进化的运营系统。在大模型 CPT、Post-training、Agentic RL 以及多模态理解等核心前沿方向持续深耕,已在 ACL、EMNLP 等AI领域的国际顶会发表数十篇高质量研究成果。本文分享了美团履约团队专场聚焦 ACL 会议论文以及前沿技术实践。
美团技术团队顶会论文分享:搜索推荐ASX专场 美团技术团队 1 month 2 weeks ago 美团业务研发平台/搜推 ASX (Agentic System X)团队聚焦构建大模型为基础的 Agent 技术体系,在大模型后训练、Agentic 强化学习以及多模态理解等核心前沿方向持续深耕,已在 ICLR、NeurIPS、CVPR、AAAI 等 AI 领域的国际顶会发表数十篇高质量研究成果。本文精选了6篇进行解读,希望对大家有所帮助或启发。
美团 LongCat-2.0 正式发布:在国产算力集群上完成全流程训练与推理的万亿参数模型 美团技术团队 1 month 2 weeks ago 作为业界首个在五万卡国产算力集群上完成全流程训练与推理的万亿参数模型(总参数 1.6 T,平均激活约 48 B,动态范围 33B~56B),LongCat-2.0 从零开始预训练,原生支持 1M 超长上下文,其架构设计自始至终围绕一个核心目标:让模型在真实的 Agentic Coding 任务中,更高效、更稳定地完成代码理解、生成与执行。
LongCat 开源 VitaBench 2.0:长期动态智能体基准新标杆 美团技术团队 1 month 3 weeks ago VitaBench 2.0 是首个真实生活场景下面向长期动态用户建模的智能体评测基准,它系统性地评测大语言模型在长期、真实、动态的用户互动中个性化与主动性的能力。
ICML 2026 | 美团技术团队学术论文精选 美团技术团队 1 month 3 weeks ago ICML是机器学习领域最具影响力的国际顶级学术会议之一。大会旨在探讨机器学习未来发展所面临的关键挑战与核心问题,并通过征集和评估具有重要理论价值和实际影响的前沿研究成果,推动领域发展并引领未来研究方向。
美团海报生成 AIGC 技术创新与实践 美团技术团队 1 month 4 weeks ago 美团智能创作团队围绕海报生成 AIGC 构建了完整技术体系,打造「生成-编辑-评判」技术闭环,目前在美团外卖、品牌 IP 等场景落地,已全部开源。
从月球漫步到赛博都市,WBench 测出了世界模型的边界 美团技术团队 2 months ago 美团 LongCat 团队提出并开源 WBench,它是首个面向交互式视频世界模型的系统性多轮评测基准。它就像一台“CT 扫描仪”,能精准定位当前世界模型在从“被动观看”到“主动交互”的过程中,到底卡在了哪里。。
ACL 2026美团论文精选:从能力评测到推理优化,构建生成新范式 美团技术团队 2 months 1 week ago ACL是计算语言学和自然语言处理(NLP)领域的国际顶级学术会议,本文解读了被 ACL 顶会收录的其中 6 篇论文,技术方向覆盖大模型评测、复杂流程推理、竞赛级数学思维优化、强化学习优化、生成式推荐等领域。
从高拟真到真可用,LongCat-Video-Avatar 1.5 正式开源 美团技术团队 2 months 4 weeks ago LongCat-Video-Avatar 1.5是一款从开源 SOTA 迈向商业级应用的数字人视频模型。在唇形同步、物理合理性、长视频稳定性、多人互动和高效推理上实现了全面跃升。LongCat-Video-Avatar 1.5 即便在复杂商业场景里,也能稳定、自然地输出高质量内容,让数字人视频生成从彩排室的完美演练,走向千人千面的真实舞台。
美团 LongCat 开源 General 365:树立推理评测新标尺 美团技术团队 3 months 1 week ago 美团 LongCat 团队正式发布 General 365。我们发现,在对 26 款主流模型的实测中,目前地表最强的 Gemini 3 Pro 准确率仅为 62.8%,而绝大多数模型甚至没能摸到 60 分的及格线。
用Agent评测思路管理AI Coding —— 31万行代码AI重构的实践 美团技术团队 3 months 2 weeks ago 当 90% 以上代码由 AI 生成,决定系统走向的不是谁写得更快,而是约束 AI 的能力。没有统一规范,AI 只会成倍放大混乱。本文基于 31 万行代码重构实践,分享我们如何用 Agent 评测思路管理 AI Coding——通过技术债梳理、建设Rule、重构 SOP 和 Pre-PR 机制,把重构从高成本专项变成随迭代持续推进的日常动作。
LARYBench 发布:定义具身动作表征 ImageNet,首次度量从人类视频学习的泛化表征 美团技术团队 3 months 3 weeks ago LARYBench (Latent Action Representation Yielding Benchmark),一个指引从大规模的视觉数据学习到通用的隐式动作表征的系统化评测基准。实验结果表明:在动作泛化和控制精度上,通用视觉模型的表现均显著优于专门为具身智能设计的动作专家模型,具身动作表征可以从大规模人类视频数据中涌现。