Gemini 3.5 Flash 引入计算机使用功能
Google 在 Gemini 3.5 Flash 模型中新增了计算机使用功能,使其能够像人类一样操作桌面环境。该模型可理解屏幕界面、移动光标、点击按钮并输入文本,适用于自动化工作流和智能代理场景。开发者可通过 API 将此能力集成到自己的应用中,开启全新的交互方式。
背景速读
- Google 在 Gemini 3.5 Flash 模型中加入「计算机使用」(computer use)能力,意味着 AI 不再只是聊天或生成文本,而是能像人一样操作屏幕、点击按钮、填写表单、抓取网页数据。
- 这项技术属于「基于视觉的自动化」(vision-based automation)——模型通过截图理解界面,然后模拟鼠标和键盘操作,完成预订、填表、数据整理等任务。
- 此前这类功能多由 RPA(机器人流程自动化)工具或专门训练的模型完成,通用大模型直接操控界面是较新的方向。Anthropic 的 Claude 也在 2024 年推出了类似能力(computer use)。
- Gemini 3.5 Flash 是 Google 的轻量级高效模型,主打低延迟和低成本,适合大规模部署;加入此功能后,开发者可以让 AI 自动执行更多日常办公或网页操作任务。
- 关键看点:可靠性如何?能否处理操作失败后的恢复?以及安全隐患——如果模型被诱导操作敏感页面或执行危险命令,防范机制是否足够?