Follow feeds: blogs, news, RSS and more. An effortless way to read and digest content of your choice.
Get Feedertech.meituan.com
Get the latest updates from 美团技术团队 directly as they happen.
Follow now 477 followers
Last updated 3 days ago
3 days ago
在大语言模型(LLM)技术的深刻影响下,搜索引擎正经历第三次范式跃迁:从 1.0 时代的“关键词文本匹配”,到 2.0 时代的“行为统计与个性化搜索”,再到 3.0 时代向“复杂意图理解与认知决策”的全面进化。 美团搜索团队正依托团垂融合新架构与生成式大模型新技术,全面重构本地生活搜索底座。本系列技术博客将持续介绍美团搜索 3.0 的技术探索,本文聚焦 LLM 语义表征在服务零售排序场景上的三期实践——从单点特征验证到系统性表征体系构建,再到跨场景迁移复用,探索语义匹配信号在搜索排序中的应用路径。...
6 days ago
KDD(ACM SIGKDD Conference on Knowledge Discovery and Data Mining)是数据挖掘与知识发现领域最具影响力的国际顶级学术会议。KDD 以其严格的论文录用标准和深厚的学术影响力著称,是推动数据驱动研究与应用创新的重要平台。大会为学术界和工业界提供了交流前沿成果的高水平论坛,论文录用率通常在 15%-20% 左右,属于计算机领域的...
13 days ago
本篇博客是一篇科普文章,由浅入深的介绍Agent评测。其中前两章系统介绍了评测是什么,以及如何建立评测体系;其中第二章是美团图灵Agent评测团队深入美团各业务团队BP总结出的实践经验,是我们在两年实践过程中逐步打磨出来的认知。第三章重点介绍了龙虾/爱马仕这类长程Agent框架的出现对评测带来的变化。 本篇博客在美团内部发表之后获得了较多的关注,我们发现大家对Agent评测的热情非常高,因此我们决定将内部博客进行公开,想把这些经验分享给更多的同学,希望对大家有所启发或帮助。 一、Agent评测是什么 1.1 评测的核心目的 评测的核心目的是为了回答 Agent 的好不好?以及到底哪里好,哪里不好? 从而为下一轮迭代指明方向。评测是Agent效果的“精密量具”。 这也是为什么 Agent 评测不能只停留在离线打榜,更不能只看某次...
26 days ago
本月,美团 LongCat 2.0 已正式开源,总参数 1.6T,平均激活约 48B,动态范围 33B 到 56B,原生支持 1M 超长上下文。这是首个在五万张国产算力卡上完成全流程训练与推理的万亿参数模型。开源只是第一步,让 LongCat...
27 days ago
假如你出生在一片未知的森林,太阳即将下山,饥肠辘辘,前方一只蜘蛛正向你缓慢爬来。——这是来自《我的世界》最经典的开局。 此时如果你按下暂停,把截图发给所有顶级的多模态大模型,它们都能完美回答你:“黄昏、有怪物,面临威胁。” 我们发现,多模态大模型能看懂图像、解析视频、在复杂场景里推理,然而一旦它们被丢进一个实时变化、需要持续探索的开放世界又会发生什么? 为了深入探索,美团 LongCat 团队构建了MineExplorer——首个在开放世界中做到分钟级长程任务的评测基准,系统性地评测多模态大模型在需要长程规划、并包含隐藏前置条件的任务中的真实能力。 MineExplorer 核心看点: 一个能直接跑的评测基准:813 个人工验证的高质量实例(1-hop 到 4-hop),配套规则化的里程碑自动评测框架。...
27 days ago
过去一年,我们见证了 Search Agent 能力的显著演进。在 BrowseComp 等评测上,顶尖模型准确率从最初的30%区间迅速攀升至90%以上。然而,当基准迅速饱和,其区分模型能力的价值也随之递减。 BrowseComp 的题目由人工设计,局限在于只能基于标注者已知的实体和关系构思,无法站在全局知识网络视角判断:哪些条件真的难检索?哪些约束的候选空间足够大?正是这种局限,让我们开始思考另一种可能性:能不能让机器自己来出题? 美团 LongCat 团队在最新论文中提出的 LoHoSearch...
about 1 month ago
🏆 近日,ACL 2026 杰出论文奖在圣地亚哥揭晓,全球仅 18 篇入选,美团履约技术团队的《GeoRA: Geometry-Aware Low-Rank Adaptation for RLVR》上榜啦,一键直达视频回放👉🏻 小红书...
about 1 month ago
本周,美团万亿参数大模型 LongCat-2.0 正式开源! HuggingFace | GitHub | ModelScope 作为业界首个在五万卡国产算力集群上完成推理的万亿参数模型,LongCat-2.0 已全面开源。针对显存与带宽受限的国产算力芯片,我们在模型架构、芯片适配到部署策略上进行了深度协同优化,让万亿参数模型在存量卡上同样跑得稳、跑得快。 我们希望以真实 Agentic...
about 2 months ago
团队介绍 美团业务研发平台/履约 AI 算法团队,聚焦构建大模型为基础的 Agent 技术体系,用 AI 赋能美团履约业务, 构建 Agent 自进化的运营系统。在大模型 CPT、Post-training、Agentic...
about 2 months ago
美团业务研发平台/搜推 ASX (Agentic System X)团队聚焦构建大模型为基础的 Agent 技术体系,在大模型后训练、Agentic 强化学习以及多模态理解等核心前沿方向持续深耕,已在 ICLR、NeurIPS、CVPR、AAAI 等 AI 领域的国际顶会发表数十篇高质量研究成果。本文精选了6篇进行解读,希望对大家有所帮助或启发。...
about 2 months ago
6月30日,美团正式发布新一代万亿参数大模型 LongCat-2.0,并将对外开源。 作为业界首个在五万卡国产算力集群上完成全流程训练与推理的万亿参数模型(总参数 1.6 T,平均激活约 48 B,动态范围 33B~56B),LongCat-2.0 从零开始预训练,原生支持 1M 超长上下文,其架构设计自始至终围绕一个核心目标:让模型在真实的 Agentic...
about 2 months ago
一个经常加班的白领,一个带着孩子出游的父亲,你的AI助理能分清他们需要什么样的服务吗? 现实是,它常常分不清。 AI能执行你明确的指令,却很难记住那些藏在场景和身份背后的真实需求。它们是真的无法理解,还是“情商”不够高呢? 自去年10月发布了 VitaBench 1.0,首次定义了生活场景下智能体任务的复杂度,美团 Longcat 团队再次推出 VitaBench 2.0,它不再仅仅关注任务有多难,而是将目光投向了更深层次的挑战。 VitaBench 2.0...