跳到主要内容

开源

AIEZZ工具标签

正在浏览与“开源”相关的AI智能产品,共展示 29 个匹配结果。

SmartSub – 开源的一站式音视频字幕处理桌面工具AI语音识别SmartSub(妙幕) 是开源的一站式音视频字幕处理桌面工具。工具将全流程整合为单一应用,基于 Whisper、FunASR、Qwen3-ASR 等本地模型离线语音转文字,支持 20 余种翻译服务与多角色 AI 配音。内置在线视频下载器,兼容 B 站、YouTube 等平台,支持 NVIDIA CUDA、Apple Core ML 等硬件加速,跨 Windows、macOS、Linux 三平台本地运行。00InstructAV2AV – 智源联合北大开源的音视频联合编辑模型图像编辑InstructAV2AV – 智源联合北大开源的音视频联合编辑模型 是北京智源人工智能研究院与北京大学联合推出的音视频联合编辑模型。用户只需一句自然语言指令,可在端到端生成过程中同时编辑视频画面与对应声音,无需手工掩码或分步处理。模型支持台词修改、人物替换、对象插入与删除,能保持背景与环境声不变,维持声画时间同步。核心功能包括身份保持的语音修改、音视频实例替换、实例插入、实例移除及属性组合编辑,适用于影视后期、短视频制作、虚拟人运营、广告创意及交互式内容生产等场景。00JoyAI-Video-EditAI视频编辑JoyAI-Video-Edit – 京东开源的实时流式视频编辑模型是京东开源自研的实时流式视频编辑模型,基于16B参数自回归扩散架构,在720P分辨率下实现30FPS推理速度,支持任意时长稳定流式编辑。用户可通过自然语言指令在视频播放过程中实时修改人物、场景、风格及物体,无需等待完整视频生成。模型在OpenVE-Bench评测中超越所有流式编辑方法,各项指标全面领先,同时可为具身智能提供大规模数据合成路径。00Orchard – 微软研究院开源的 Agentic AI 建模框架AI智能体Orchard – 微软研究院开源的 Agentic AI 建模框架。该框架以基于 Kubernetes 的 Orchard Env 环境服务为核心,支持跨域复用沙箱进行数据蒸馏、强化学习 rollout 与评估,覆盖软件工程、浏览器导航和个人助理三大场景。它提供完整的 SFT + RL 训练配方以及 107K 条 SWE 轨迹与 3,070 条 GUI 多模态 rollout 数据,并能在 Codex、OpenClaw 等真实 harness 中直接进行端到端训练。面向 Agent 研发的学术与工业团队,Orchard 具备更低的算力与托管成本,同时通过跨 harness 泛化能力帮助以较小模型逼近前沿性能。00Alpamayo 2 Super – 英伟达开源的自动驾驶 AI 推理模型AI编程Alpamayo 2 Super 是英伟达开源的自动驾驶 AI 推理模型,基于 NVIDIA Cosmos 3 Super Reasoner 构建,具备 360° 环境感知、高级驾驶决策与自动推理标签生成能力。模型在 LingoQA 自动驾驶推理基准中排名第一,采用 OpenMDW-1.1 宽松许可,支持微调、衍生与商业再分发。同时提供 Alpamayo 1.5 / 1 版本,用于云端开发与车端蒸馏部署,面向 Robotaxi 与自动驾驶汽车领域。00wigoloAI智能体wigolo 是开源的本地搜索工具,通过 MCP 接入 Claude Code、Cursor 等编程 Agent。无需 API Key,零成本可在本地完成搜索、网页抓取、全站爬取、结构化提取、...00MemHarness – 上海 AI Lab 等推出的智能体记忆重构框架AI智能体MemHarness 是上海 AI Lab 联合浙大、复旦、上海交大等高校推出的 LLM Agent 记忆重构框架。它在检索与动作之间插入批判与重构环节,结合当前上下文对历史经验进行保留、改写或丢弃,通过 GRPO 端到端训练,无需额外人工标注。该框架支持记忆检索、批判重构、动作生成、经验回写与剪枝等完整流程,并提供五阶段决策流程。其 7B 参数模型在 ALFWorld 和 WebShop 上分别超越 Gemini-2.5-Pro 23.1% 和 39.7%,在分布外场景中平均成功率达 85.9%。适用于具身智能家务、自主在线购物、智能客服、代码辅助开发等场景。00ForgeStencil – 面壁智能推出的 Stencil 全自动研究部署系统AI智能体ForgeStencil – 面壁智能推出的 Stencil 全自动研究部署系统由面壁智能联合 OpenBMB 社区开发,采用 Kernel Agent 与 App Agent 双智能体闭环架构。可自主完成从优化策略发现、高性能 CUDA Kernel 合成到生产级应用集成验证的全流程,实现零人工介入。系统在一周内对 100 余个工业与科学计算软件完成端到端优化,中位加速比达 1.41 倍。覆盖油气勘探、电磁仿真、医学影像等 8 大工业与 5 大科学领域,显著降低 HPC 专家依赖与研发周期。00dots.ttsAI语音合成dots.tts 是小红书 dots 团队与上海交大 X-LANCE 实验室联合开源的 20 亿参数全连续自回归语音合成基座模型。模型直接在连续隐空间中逐块生成 48kHz 音频,在...00ShieldstralAI智能问答Shieldstral – Mistral AI 开源的多模态内容安全分类模型 是 Mistral AI 推出的 3B 参数开源多模态内容安全分类模型,基于 Ministral-3B 构建。模型将传统固定类别的内容审核重新定义为二元问答任务,支持通过自然语言查询实时定义审核策略,无需重新训练即可适配不同场景。模型在文本安全基准上平均 F1 达 84.9%,多模态安全 F1 达 83.8% 均为 SOTA,且仅需单张 16GB GPU 可部署,支持 12 种语言。核心功能包括策略自适应审核、多模态统一检测、细粒度违规识别、校准安全评分和轻量端侧部署,适用于社交平台内容风控、AI 对话安全防护、广告与营销合规、在线教育内容过滤及企业文档安全审计等场景。00PAST-BenchAI智能体PAST-Bench 是普林斯顿大学王梦迪团队推出出的基准测试,用于检验个人 AI Agent 的递归自我改进能力。PAST-Bench通过对比有记忆与无记忆条件下的任务表现,判...00PixelRAG开发平台PixelRAG 是伯克利 SkyLab/BAIR 开源的视觉原生 RAG 框架。框架跳出网页抽成纯文本再检索的传统路线,改用浏览器把网页、PDF 渲染成截图瓦片,通过 LoRA 微调...00LTX-2.5AI视频生成LTX-2.5 是 LTX 开源的 AI 视频生成基础模型,拥有 22B 参数,发布即开放权重。模型支持原生多镜头生成、4K HDR 与 RAW/EXR 专业工作流,可同步生成音频,具...00HOMIEAI视频生成HOMIE 是香港科技大学开源的数字人视频生成框架,基于 Wan2.1-T2V-14B 骨干网络并集成 Qwen3-VL 多模态大模型。框架能统一处理数字人+商品+Logo+文字四要素,...00Palmier ProAI视频编辑Palmier Pro 是为 AI 时代打造的 macOS 原生视频编辑器,采用 Swift 从零构建,开源且基础功能免费。产品将生成式 AI 直接嵌入时间线,支持 Seedance、Kling ...00MindMemOS – 华为诺亚方舟开源的 AI Agent 记忆操作系统AI智能体MindMemOS – 华为诺亚方舟开源的 AI Agent 记忆操作系统,旨在为需要长期记忆管理的智能体提供开源、可复用的记忆层。它采用实体‑属性‑时间的三维结构,将记忆从单个 Agent 中解耦为跨框架的独立资产,并通过 Dreaming 离线整理、Feedback 纠偏和 Skill Evolution 自动进化等机制实现记忆的持续优化。系统提供双模式记忆写入(MindVanilla、MindSchema)和多路径 Compact Search 检索,支持 Docker 本地部署、云端 API、Python SDK、CLI 等多种接入方式。凭借 94% 以上的结构化召回准确率和压缩记忆后问答准确率提升 10% 的效果,帮助开发者在个性化助手、多 Agent 协作和复杂办公自动化等场景中实现跨会话信息共享与任务效率提升。00Nemotron 3.5 LightningAI智能体Nemotron 3.5 Lightning 是英伟达推出的 30B 参数开源 MoE 模型,专为多智能体系统优化。相比同类模型,输出速度提升 4 倍,智能体任务完成速度加快 30%,在...00Wan-Animate-2 – 万相团队开源的新一代角色动画模型动画制作Wan-Animate-2是万相团队开源的新一代角色动画模型,作为Wan-Animate的重大架构升级,采用端到端双分支DiT,无需显式姿态骨架即可从参考视频捕捉运动先验。它支持驱动视频转角色动画、身份外观保持以及文本驱动的视角控制,提供Base高质量与Distillation低步数两种推理模式,并面向实时流式角色动画推出了Lite变体。该模型适合虚拟主播、短视频创作、数字人等应用场景,旨在同时提升运动保真与身份一致性,并降低生成延迟。00SenseNova U1.5-Lite-Preview – 商汤开源的轻量多模态模型AI大模型SenseNova U1.5-Lite-Preview – 商汤开源的轻量多模态模型基于NEO-Unify架构,以8B-MoT参数实现视觉理解、推理、生成与编辑的原生统一。模型支持4K超高清图像原生生成,具备精细纹理、真实质感及中英文复杂版式文字渲染能力。内置Prompt Enhance Skill降低创作门槛,可精准执行超长自然语言与结构化视觉指令并支持可持续迭代编辑。面向设计师、开发者及内容创作者,提供低部署成本、高指令遵循度的商业级视觉创作工具。00IndexTTS-2.5AI语音合成IndexTTS-2.5 是 Bilibili 开源的工业级零样本语音克隆模型,参数量仅 0.8B,支持中文、英语、日语、西班牙语和阿拉伯语五语跨语种迁移。00MAGI-2-preview – Sand.ai 开源的多模态视频生成模型AI视频生成MAGI-2-preview – Sand.ai 开源的多模态视频生成模型 是 Sand.ai 开源的全球首个千亿参数 MoE 多模态视频生成模型,总参数 114B、激活仅 6B。模型延续单流架构,将文本、视频、音频统一纳入同一 Transformer 联合建模,实现原生多模态生成。其核心功能包括支持文本、图像、视频到视频的生成并原生融合音频理解,通过 MoE 稀疏激活将推理成本大幅降低。目标用户为 AI 研究者、开发者及企业技术团队,适用于学术研究、私有化部署及多模态影视预演等场景,提供开源可商用的高效视频生成解决方案。00Qwen-CUA – 阿里 Qwen 等推出的原生 Computer Use AgentAI智能体Qwen-CUA – 阿里 Qwen 等推出的原生 Computer Use Agent 基于 397B-A17B 混合专家架构,仅通过屏幕截图感知界面状态,无需依赖 DOM 树或无障碍元数据,即可直接输出键盘鼠标事件操控浏览器、桌面及专业软件。在 OSWorld-Verified 基准测试中得分 86.2 分,更大版本 Qwen-CUA-Max 达 87.6 分,处于开源 CUA 领域领先水平。采用端到端视觉-动作训练,具备跨平台通用性与高稳定性,已开源技术报告与 Demo,适配自动化测试、RPA、无障碍辅助及科研软件操控等场景。00SALMONN-2 – 清华等开源的通用音频大语言模型AI编程SALMONN-2 – 清华等开源的通用音频大语言模型 是基于字节跳动 SPEAR 统一自监督音频编码器与多层特征融合适配器构建,以 Qwen3 为文本基座的通用音频大语言模型。它支持语音识别、音频描述、音乐理解、情绪识别、说话人验证等跨域任务,并首次在通用 ALLM 中系统实现声音事件检测、音频伪造检测、语音质量评估与多模态上下文语音识别等进阶能力。模型采用单一 SPEAR 编码器替代传统双编码器方案,通过 MLF 适配器融合多层声学特征,实现更均衡的跨域表现。凭借仅约 1.8 万小时监督数据的高效训练,SALMONN-2 在 MMAU-Pro、MMAR、MMSU 三大综合基准上达到同规模开源模型最佳表现,适用于智能会议助手、音频内容审核、语音质量监控等场景。00Muse Glimmer – Meta 开源的 300 亿参数大语言模型AI智能体Muse Glimmer 是 Meta 开源的 300 亿参数大语言模型,专为全天候本地常驻 Agent 工作流深度优化。通过 4bit 量化技术,模型可在 24 GB 显存的单卡 GPU 或 32 GB 统一内存的 Apple Silicon(M4/M5 Max)上流畅运行,性能衰减几乎为零。集成 DFlash 推测解码,在 RTX 5090 等高端硬件上实现最高 3.1 倍提速,支持实时对话、工具调用、代码生成和多步推理等多模态任务。适合个人开发者、中小企业以及对数据隐私要求高的医疗、金融等行业,提供低显存门槛的本地高效 AI 能力,数据全部留在设备内。00Hunyuan3D-Buffalo 1.0 – 腾讯混元推出的 3D 多模态框架3D设计Hunyuan3D-Buffalo 1.0 – 腾讯混元推出的 3D 多模态框架 是腾讯混元推出的统一3D多模态框架,通过共享的 Hunyuan3D-VLM 主干将3D问答、空间定位、文生3D、指令编辑和部件生成集成到单一流程中。框架支持自然语言理解3D模型结构、定位部件、按指令修改局部几何,提取语义级部件,旨在打通3D理解、生成与编辑的闭环,为游戏、动画和工业设计提供可组合的3D资产生产方案。核心功能包括3D理解、文生3D、指令编辑和部件生成,四类任务共享同一种3D语义表示与处理管线。适用于游戏开发者、动画制作人员、工业设计师及3D内容创作者,通过自然语言交互降低专业门槛,提升资产复用与迭代效率。00ShotcutAI视频编辑Shotcut 是基于 FFmpeg 的开源视频编辑软件,完全免费且无水印、无时长限制。软件支持数百种音视频格式免导入直接编辑,提供多轨道时间线、关键帧动画、丰富...00WorldClaw – 腾讯混元团队推出的 3D 世界生成框架3D设计WorldClaw是腾讯混元团队推出的Agent驱动开放世界3D生成框架。用户输入一句自然语言描述,系统可自动规划地形、区域、建筑、物体与空间关系,采用全局到局部的生成策略,在Blender中构建出可自由探索且支持逐对象编辑的完整3D场景。框架由Claude Opus、GPT-Image-2、SAM3及Hunyuan3D等多模型协同驱动,具备视觉Agent自检修复能力,可自动修正悬空、穿模等接触问题。00PyTorchAI编程工具PyTorch是一个开源机器学习框架,由Meta AI研究团队发起,现由Linux基金会管理,主要服务于人工智能研究人员、机器学习工程师、数据科学家及学生。用户通常使用Python定义模型和前向计算流程,再借助张量计算、自动微分与神经网络模块完成训练,并结合相关生态库处理视觉、音频或文本任务。动态计算图便于实验和调试,也支持从研究原型继续推进模型部署。实际使用仍需要掌握Python、张量运算和深度学习基础;从实验代码走向生产环境时,还需自行处理工程化部署与资源配置。057.6Qwen 3.8-Max – 阿里云 Qwen 团队推出的旗舰大模型AI大模型Qwen 3.8-Max – 阿里云 Qwen 团队推出的旗舰大模型,基于 Qwen 3.5 架构扩展至 2.4 万亿参数,定位为企业级和科研级的超大规模语言模型。它支持长程自动编程、论文复现、竞赛实战、办公提效、量化策略研发以及芯片自主设计等多种高价值场景。模型通过真实世界强化学习和自进化反馈闭环,实现数天至数十天的自主执行,无需人工干预即可完成复杂任务。用户可通过千问AI平台的兼容 OpenAI 或 Anthropic 协议的 API 调用,或在本地部署开源权重,便捷集成至 Claude Code、Codex、Qoder 等智能体框架。因此,研发团队、法律合规、设计师等专业用户能够显著提升工作效率,压缩长周期项目为一次对话内交付。00

已显示当前标签下的全部工具