统一 skill 与 specialist 清单,移除旧的 office 执行包与下线对象,并补入 text_to_speech、customer_followup 等当前目录定义与种子数据。
OCR 图文理解(ocr-understanding)样例
用途
识别图片中的文字并结构化输出(OCR / 图文理解)。
样例文件
images/公司介绍_帧1.png—— 从公司介绍视频抽取的一帧画面,作为图片输入样例。
调用方式
- 接口:
POST /api/skills/office/ocr(multipart 上传图片file,带task_id;如需可带prompt)。 - 把
images/公司介绍_帧1.png作为上传图片。
期望产出
识别出的文本(text)+ 行级坐标(lines)+ 引擎与上传信息,便于下游进一步整理。
说明:技能为「已实现」,走 office 自定义 OCR(PaddleOCR 脚本)运行时。