多模态
AIEZZ工具标签
正在浏览与“多模态”相关的AI智能产品,共展示 5 个匹配结果。
ShieldstralAI智能问答Shieldstral – Mistral AI 开源的多模态内容安全分类模型 是 Mistral AI 推出的 3B 参数开源多模态内容安全分类模型,基于 Ministral-3B 构建。模型将传统固定类别的内容审核重新定义为二元问答任务,支持通过自然语言查询实时定义审核策略,无需重新训练即可适配不同场景。模型在文本安全基准上平均 F1 达 84.9%,多模态安全 F1 达 83.8% 均为 SOTA,且仅需单张 16GB GPU 可部署,支持 12 种语言。核心功能包括策略自适应审核、多模态统一检测、细粒度违规识别、校准安全评分和轻量端侧部署,适用于社交平台内容风控、AI 对话安全防护、广告与营销合规、在线教育内容过滤及企业文档安全审计等场景。00
HOMIEAI视频生成HOMIE 是香港科技大学开源的数字人视频生成框架,基于 Wan2.1-T2V-14B 骨干网络并集成 Qwen3-VL 多模态大模型。框架能统一处理数字人+商品+Logo+文字四要素,...00
SenseNova U1.5-Lite-Preview – 商汤开源的轻量多模态模型AI大模型SenseNova U1.5-Lite-Preview – 商汤开源的轻量多模态模型基于NEO-Unify架构,以8B-MoT参数实现视觉理解、推理、生成与编辑的原生统一。模型支持4K超高清图像原生生成,具备精细纹理、真实质感及中英文复杂版式文字渲染能力。内置Prompt Enhance Skill降低创作门槛,可精准执行超长自然语言与结构化视觉指令并支持可持续迭代编辑。面向设计师、开发者及内容创作者,提供低部署成本、高指令遵循度的商业级视觉创作工具。00
MAGI-2-preview – Sand.ai 开源的多模态视频生成模型AI视频生成MAGI-2-preview – Sand.ai 开源的多模态视频生成模型 是 Sand.ai 开源的全球首个千亿参数 MoE 多模态视频生成模型,总参数 114B、激活仅 6B。模型延续单流架构,将文本、视频、音频统一纳入同一 Transformer 联合建模,实现原生多模态生成。其核心功能包括支持文本、图像、视频到视频的生成并原生融合音频理解,通过 MoE 稀疏激活将推理成本大幅降低。目标用户为 AI 研究者、开发者及企业技术团队,适用于学术研究、私有化部署及多模态影视预演等场景,提供开源可商用的高效视频生成解决方案。00
Hunyuan3D-Buffalo 1.0 – 腾讯混元推出的 3D 多模态框架3D设计Hunyuan3D-Buffalo 1.0 – 腾讯混元推出的 3D 多模态框架 是腾讯混元推出的统一3D多模态框架,通过共享的 Hunyuan3D-VLM 主干将3D问答、空间定位、文生3D、指令编辑和部件生成集成到单一流程中。框架支持自然语言理解3D模型结构、定位部件、按指令修改局部几何,提取语义级部件,旨在打通3D理解、生成与编辑的闭环,为游戏、动画和工业设计提供可组合的3D资产生产方案。核心功能包括3D理解、文生3D、指令编辑和部件生成,四类任务共享同一种3D语义表示与处理管线。适用于游戏开发者、动画制作人员、工业设计师及3D内容创作者,通过自然语言交互降低专业门槛,提升资产复用与迭代效率。00已显示当前标签下的全部工具
