该内容为自助投放广告,真伪自辨
立即入驻

DeepSeek Harness 多模态功能上手:从图片理解到智能体搭建

广告也精彩

DeepSeek Harness 在 8 月 21 日发布的 v0.1.1-rc.1 里,给 DeepSeek 适配器加上了多模态视觉理解模型选项,并支持配置原生图片请求。对一直在用纯文本 Agent 的开发者来说,这意味着之前只能靠文字转述的截图、设计稿、图表,现在可以直接丢给智能体去理解。这篇文章不讨论 DeepSeek 模型本身,只走一遍 Harness 框架里的多模态集成:从配置视觉模型、上传图片测试,到把图片理解能力接进智能体工作流。

第一步:把视觉模型接进 Harness

升级到 v0.1.1-rc.1 之后,模型配置的入口没有变,还是熟悉的设置界面。打开设置 → 模型,DeepSeek 卡片上会有一个 API 密钥字段,填入密钥保存即可。密钥是只写的,保存后页面只显示脱敏描述符,不会回显明文,实际存储在 $DSH_HOME/.credentials.yaml 里,settings 只保留凭据引用。模型变更会在下一次请求时生效,不需要重启服务器,这点在调试时很省事。

如果你想用的视觉模型不在 DeepSeek 官方端点,也可以走目录提供方或自定义提供方。目录提供方适用于已安装目录里已有的 Anthropic、OpenAI 等,各自需要对应的原生凭据;自定义提供方则适合公司网关或自建服务器。选择自定义提供方时,需要填 Provider ID、基础 URL、API 协议、凭据和至少一个模型,其中 Provider ID 是永久的,会关联到请求和已保存会话,命名时要想清楚。

在 Harness 设置中配置支持图片输入的视觉模型

关键一步:手动录入的模型要声明图片输入

这里有个容易踩的坑。如果你用的是手动录入的自定义模型,Harness 在它自己声明之前一律按纯文本对待——因为没有任何环节能去询问端点到底接受哪些模态。给这类模型附加图片,会在发送前就被拒绝,并直接点名这个模型。

解决办法是在 $DSH_HOME/settings.yaml 里给对应模型加上 input 字段,声明它接受 textimage。示例配置大致长这样:

llm-pi-ai:
  providers:
    my-gateway:
      apiKeyEnv: GATEWAY_API_KEY
      api: openai-completions
      baseURL: https://gateway.example/v1
      models:
        - id: legacy-chat
        - id: vision-preview
          input: [text, image]

input 只作用于该模型,所以一条路由可以同时服务文本模型和视觉模型。省略这个字段,或写成空列表,则保留已安装目录记录的模态;目录没描述的模型,就回退到该路由的默认值。如果你的手动模型全都接受图片,可以在路由级别统一设置,不用逐个加。

第二步:上传图片,测试多模态输入

配置完成后,就可以实测了。v0.1.1-rc.1 里,/goal/plan 等命令都能接收图文输入,@ 菜单也可以引用文件和会话。这意味着你可以在输入框直接拖入一张图片,配合文字指令一起发给模型,而不是像以前那样只能描述"图片里大概是什么"。

测试时建议用真实场景的素材,别用随手找的装饰图。比如截一张你实际项目的报错页面、一张数据报表截图,或者一张设计稿,让模型描述内容并给出判断。这样能很快摸清模型在什么类型的图上表现好、什么场景会翻车。注意,模型变更要等下一次请求才生效,刚改完配置如果没反应,先别急着排查代码,检查一下是不是请求没触发新的模型。

第三步:把多模态能力搬进智能体工作流

配置好单次图片问答只是开始,真正的价值在于把视觉理解接进 Agent 的自动化流程。一个典型的场景是:让 Agent 根据截图执行操作。过去纯文本 Agent 处理不了这类任务,因为截图信息在进入模型之前就丢失了。现在你可以把 UI 截图作为输入传给 Agent,让它识别界面元素、判断当前状态,再生成下一步操作建议或对应的脚本。

这里的关键不是让 Agent"看见"图片,而是让感知层和行动层打通。图片输入进来,模型先理解内容,再基于理解做决策、生成动作。多模态输入补上了 Agent 在视觉侧的感知缺口,判断才有依据。建议从小场景切入,比如先做一个"读截图 → 输出操作步骤"的辅助 Agent,跑通了再逐步扩展到更复杂的自动化流程。

智能体读取界面截图并生成操作建议

纯文本 Agent 的局限在哪里

对比一下传统纯文本 Agent,局限就很明显。它只能依赖用户转述、结构化文本或人工预处理后的数据。遇到界面变化、图表分析、报错截图这类信息,要么用户手动描述,要么写脚本提前抽取,链路又长又容易失真。而多模态输入让 Agent 直接拿到原始视觉信息,省掉了中间转述环节,理解误差也会小一些。

当然,多模态不是万能药。它带来的是感知层的扩展,决策质量仍然取决于模型对图片内容的理解是否准确,以及工作流设计是否合理。对开发者来说,Harness 这次的多模态支持最大的意义,是让 Agent 从"只能读文字"变成了"能看图再行动",这个能力边界的扩展,值得拿真实场景去试一遍。建议先配好视觉模型,用一两张真实截图跑通流程,再逐步把图片输入接进你现有的智能体工作流里。

© 版权声明

相关文章

暂无评论

none
暂无评论...