UMI AI TOOLKIT

一个账号,使用不断扩展的 AI 能力

从文本、图片、语音到视频处理,按你要完成的任务选择工具。供应商调度、结果格式和后续切换由平台统一处理。

8首批工具
1个统一账号
7类能力目录
任务导向选择统一调用规范结果默认私有开放前逐项验收
能力目录

先从成熟、可核验的任务开始

当前页面展示首批产品化清单。只有通过账号、质量、成本和合规验收的工具,才会出现“立即试用”。

T内测准备中

智能字段提取

把长文本整理成可直接使用的结构化数据

粘贴合同、访谈、商品资料或业务记录,按指定字段输出 JSON 或表格结果。

输入:文本 · 字段说明输出:JSON · 表格
通常 5–20 秒查看能力 →
M内测准备中

图片理解

上传图片,快速获得描述、标签和问题回答

识别图片中的主体、场景、文字与关键信息,支持按问题输出自然语言或结构化结果。

输入:图片 · 问题输出:描述 · 标签 · JSON
通常 5–30 秒查看能力 →
M内测准备中

图片文字与风险检查

一次检查文字、二维码、联系方式、水印和清晰度

面向内容发布前审核,提取图片文字并提示二维码、联系方式、第三方水印和低清风险。

输入:图片输出:文字 · 风险清单 · JSON
通常 5–30 秒查看能力 →
A内测准备中

音频转文字

上传短音频,获得带时间信息的文字稿

适合会议片段、采访、口述和短视频音频,输出可编辑转写与基础时间戳。

输入:MP3 · WAV · M4A输出:文字稿 · 时间戳 · SRT
通常为音频时长的 0.2–1 倍查看能力 →
A内测准备中

文字转语音

把文字生成自然、清晰的普通话音频

输入文案并选择通用音色,生成适合讲解、播报和内容配音的音频文件。

输入:文本 · 通用音色输出:MP3 · WAV
通常 5–60 秒查看能力 →
P内测准备中

视频格式转换

统一视频格式、分辨率与码率,方便发布和后续处理

将常见视频转为适合网页、社交平台或内部流程使用的标准格式。

输入:MP4 · MOV · AVI输出:MP4 · 指定分辨率
通常为视频时长的 0.3–2 倍查看能力 →
P内测准备中

视频关键帧提取

从视频中提取可用于封面、审核和理解的画面

按时间间隔或关键场景生成图片,便于封面选择、内容理解和后续图文生产。

输入:视频 · 抽帧规则输出:JPG · 时间点清单
通常 10 秒–3 分钟查看能力 →
W内测准备中

企业知识库问答

基于已授权企业资料回答问题,并给出依据

连接企业知识空间后进行检索问答,适合制度、产品、方案和客服知识查询。

输入:问题 · 知识空间输出:回答 · 引用依据
通常 3–20 秒查看能力 →
面向使用与开发

网页试用和 API 调用,共用同一套任务记录

首批能力开放后,用户可以先在网站验证结果,再使用同一个账号创建 API Key。异步任务、结果资产和用量记录保持一致。

登录控制台,提前建立账号
  1. 01
    选择任务不用先理解模型和供应商
  2. 02
    提交试用提交前显示限制与预计消耗
  3. 03
    保存成果输入和结果默认归用户私有
  4. 04
    接入 API一个 Key 调用已开放能力
01

不会伪装可用

官方有接口不等于网站已开放。未完成真实账号调用和成本验收的能力会明确标注状态。

02

不会自动共享内容

提示词、上传文件和生成结果默认私有,只有用户主动咨询或分享时才进入对应业务流程。

03

高风险能力单独授权

声音复刻、形象克隆、去水印和数字人等能力需要专项授权,不被普通媒体授权自动覆盖。