多模态、OCR 与理解内测准备中

图片理解

上传图片,快速获得描述、标签和问题回答

识别图片中的主体、场景、文字与关键信息,支持按问题输出自然语言或结构化结果。

输入

你需要提供

  • 图片
  • 问题
输出

你将获得

  • 描述
  • 标签
  • JSON
适合场景

把清晰任务交给工具

  1. 01素材自动打标
  2. 02商品图片理解
  3. 03图片问答
使用边界

提交前需要知道

  • 小字号和模糊文字可能识别不完整
  • 人物身份与敏感属性不作确定性判断
适用角色内容运营电商开发者
当前开放状态

内测准备中

该能力正在完成真实账号调用、代表样本、成本对账和合规验收。开放前不会展示虚假的在线体验按钮。

进入用户控制台API 文档会与公共调用同步开放
默认私有

输入、上传文件和生成结果默认只对用户本人及获授权的组织成员可见。

授权明确

声音、肖像、去水印等高风险任务需要独立授权,普通媒体授权不会自动覆盖。

结果可追溯

任务开放后,网页试用和 API 调用将使用统一请求 ID、结果资产和用量记录。