← 返回信息流

Reddit r/LocalLLaMA产品

Youtu-Parsing-Omni:5B多模态文档与媒体解析模型

reddit.com作者:/u/jacek2023模型AI评分:70/100

腾讯发布Youtu-Parsing-Omni,一款5B参数的全模态解析模型。支持输入文档、图片、图表、音频或视频,输出包含感知(布局、OCR、ASR等)和认知(摘要、报告)的结构化JSON。通过任务提示词切换输出类型。

阅读原文