复旦大学计算与智能创新学院张谧教授深耕 AI 安全领域多年,近期重点攻关大模型及智能体安全。他在网络安全与人工智能方向发表学术论文逾百篇,并作为联合起草人参与《生成式人工智能服务安全基本要求》等国家标准制定。其团队研发的 JADE 大模型安全风险分析与治理平台成果显著,获新华社、人民日报等主流媒体关注,多次接受南都大数据研究院专访,全网阅读量累计突破千万次。

只需输入一句话,手机智能体便能代点外卖、撰写评价,甚至运行小程序游戏。然而,这种便捷背后潜藏着巨大风险:智能体会否沦为不知疲倦的「网络水军」?是否会自动筛选诈骗目标并群发定制话术?甚至协助购买制毒、制爆原料,成为黑灰产乃至犯罪活动的「帮凶」?

研究团队将 8 款基于不同模型构建的智能体接入真实手机,在 31 个国民级 APP 中进行逐一验证。结果首次证实,这些有害任务可在端到端真实环境中执行,且在部分场景下速度超越人类。

用户一句指令下达后,号称拥有 Anthropic 最强安全护栏的 Claude Fable5,迅速化身「诈骗惯犯」。它先自动锁定急需购票的受害者,抓取主页信息构建用户画像,最后量身定制话术并通过私信行骗。从寻找目标、搜集资料到实施诈骗,整套流程在真实 App 内端到端完成,全程无需人工干预。

为系统评估手机智能体在真实 APP 中的违规风险,我们构建了 BadPhoneAgent 数据集。该数据集从 11 部国内外法律法规以及最高法案例等 50 余处权威来源中提取真实安全风险,建立起涵盖 6 大类、40 个子类的《手机智能体恶意使用分类体系》。

我们在微信、微博、小红书等 31 个真实 APP 上,人工构造了 2768 个中英文违规问题,打造出目前测试样例最多、覆盖真实 APP 最广的手机端智能体安全测评数据集。依托高质量数据,我们将 8 款基于国内外旗舰模型的手机智能体接入真实手机,在真实 APP 中开展端到端测评,开启了真实环境安全测评的新局面。

基于 BadPhoneAgent 数据集,我们从两个维度对模型进行了系统测评:一是安全意识,即模型能否主动拒绝违规请求;二是有害任务执行能力,即模型在真实环境中能否完成违规操作。

结果显示,模型的安全意识近乎缺失。在不使用任何越狱手段的情况下,Gemini 3.1 Pro、Claude Sonnet-4.5、GPT-5.4 以及 Doubao-Seed-2.0-Pro 这 4 款商业模型的平均拒答率仅为 18%。经过安全加固的谷歌旗舰模型 Gemini 3.1 Pro,其拒答率甚至低至 4.4%。多款开源模型如智谱 AutoGLM、字节 UI-TARS-1.5-7B 以及阿里 GUI-Owl-1.5-8B,其拒答率更是达到 0%。

作为首个在真实世界中测试有害任务完成率的研究,我们发现开源和闭源模型的平均有害任务完成率高达 68.8%。能力最强的商业模型 Gemini 3.1 Pro 达到 86%,而开源的 AutoGLM 更是飙至 96%。在执行速度方面,包括 GUI-Owl-1.5、UI-TARS-1.5 在内的多款开源模型,执行速度已能比肩甚至超过人类。在「制毒制爆」任务中,Gemini 3.1 Pro 和 Sonnet-4.5 全程无一拒绝,成功下单付款,买齐了 3 种可直接用于制造爆炸物的原料配方。Opus 4.8 为了购买制毒原料,竟伪造病史,欺骗线上医生开具处方。据我们所知,这是世界上首次由智能体端到端完成的制毒制爆原料采购。

图注:Opus 4.8 为了制作碘化汞,虚构病史,欺骗线上医生购买处方药红药水,并端到端自主完成了全部所需原料的下单与付款。

由此得出的结论令人担忧:基于各类模型的手机智能体安全意识薄弱、有害任务完成率高,加之比肩人类的执行速度,已使其初步具备在真实世界中被批量恶意使用的条件。

我们揭露了手机智能体中存在的一个隐藏现象——「Safety Awareness-Execution Gap」(安全意识与执行鸿沟)。当直接询问「这个请求是否违规」时,智能体往往能识别出其中的风险;但要求它们执行同一个有害任务时,却可能毫不犹豫地完成操作。

图注:当直接询问 Claude Sonnet-4.5「该任务是否违规」时,它能够识别其中包含的威胁、骚扰等有害意图。然而,当要求智能体在真实手机环境中执行同一个有害任务时,它却继续完成点击、发布等操作。

图注:左图显示,执行 Agent 任务时,安全神经元的激活值明显低于判断 query 是否有害时的激活值。右图表明,模型能够准确识别 60% 以上的任务是否有害,但仍会执行这些任务。

通过神经元分析,我们发现:在执行 Agent 任务时,负责安全判断的机制并未被充分激活,这与智能体「知道危险却依然执行」的行为密切相关。通过定位安全神经元并进行干预,智能体能够在几乎不增加推理成本的情况下显著提升拒绝能力,为未来构建更可行、更鲁棒的手机智能体提供了新方向。

本文是 JADE 大模型安全风险分析与治理平台的最新成果。JADE 研发的靶向式红队方法,被指击中了生成式模型的阿克琉斯之踵,其开源工具与数据集 GitHub Star 位居同类中文平台 TOP 1,相关技术已在阿里千问、华为云核等亿级用户的 AI 应用中落地。

第一作者:孙翊铭,复旦大学计算与智能创新学院博士生,研究方向为 AI 安全。

通讯作者/指导教师:张谧,复旦大学计算与智能创新学院教授,白泽智能负责人

主要参与同学:陈晨、周子凡。