音视频 - 小智博客

AI视频生成模型从无到有：构建、实现与调试完全指南

文章目录 **引言：从理论到实践的跃迁** **第一部分：理论基石——视频生成模型的核心思想** **第二部分：开发环境搭建与工具链** **第三部分：亲手构建一个简易视频生成模型** **第四部分：系统调试与效果评估** **第五部分：模型优化与进阶探索** **第六部分：从玩具到应用—

音视频 2026年02月14日 159 点赞 0 评论 14241 浏览

Kimi-Audio音频大模型介绍、本地部署与开发

目录一、模型介绍二、模型部署 1、创建工作空间2、下载模型3、下载依赖4、下载模型库 5、下载glm4_tokenizer6、代码编程修改4 月 26 日，Moonshot AI正式宣布推出Kimi-Audio，一款全新的开源音频基础模型，旨在推动音频理解、生成和交互领域的技术进步。这一发布引发了全球AI社区的广泛关注，被认为是多模态AI发展

音视频 2025年05月18日 107 点赞 0 评论 14226 浏览

基于深度学习的多模态人脸情绪识别研究与实现（视频+图像＋语音）

这是一个结合图像和音频的情绪识别系统，从架构、数据准备、模型实现、训练等。包括数据收集、预处理、模型训练、融合方法、部署优化等全流程。确定完整系统的组成部分：数据收集与处理、模型设计与训练、多模态融合、系统集成、部署优化、用户界面等。详细说明，还要给出详细的代码框架和工具。包括如何处理实时数据流，如何同步音频和视频&#xf

音视频 2025年04月20日 87 点赞 0 评论 14214 浏览

Qwen2.5-Omni 大模型部署实践（九）：音视频交互中多元知识探讨实践

系列篇章💥 No. 文章 1 Qwen2.5-Omni 大模型部署实践（一）：环境搭建与模型下载 2 Qwen2.5-Omni 大模型部署实践（二）：使用transformers推理实践 3 Qwen2.5-Omni 大模型部署实践（三）：

音视频 2025年05月09日 94 点赞 0 评论 14210 浏览

一个人就是一支影视团队：实测国内最强影视级 AI 视频创作平台 TapNow——告别抽卡，导演级精准控制

实测国内最强影视级 AI 视频平台 TapNow：告别“盲盒抽卡”，实现导演级精准调度在过去的一年里，文生视频赛道经历了爆发式增长。但对于真正需要将 AI 投入到生产环境中的创作者、产品经理和开发者来说，目前的 AI 视频工具普遍存在一个致命痛点——不可控。跑偏的物理规律、诡异的肢体形变、如同“开盲盒”般的提示

音视频 2026年04月03日 180 点赞 0 评论 14204 浏览

使用 C++ 和 OpenCV 进行表面划痕检测

使用 C++ 和 OpenCV 进行表面划痕检测在工业自动化生产中，产品表面的质量控制至关重要。划痕作为一种常见的表面缺陷，其检测是许多领域（如金属、玻璃、塑料制造）质量保证流程中的一个关键环节。本文将介绍如何使用 C++ 和强大的计算机视觉库 OpenCV 来实现一个基本的表面划痕检测算法。核心思路划痕通

音视频 2025年09月25日 75 点赞 0 评论 14167 浏览

通义万相2.1：开启视频生成新时代

摘要：文章开篇便点明了通义万相2.1在视频生成领域的重大突破，强调其作为阿里云通义系列AI模型的重要成员，不仅是简单的模型升级，更是视频生成技术迈向更智能、高效、精准的重要里程碑。其核心技术包括自研的高效VAE和DiT架构，使得模型能够实现无限长1080P视频的高效编解码，并在中文文字视频生成方面取得重大突破&#x

音视频 2025年07月11日 138 点赞 0 评论 14143 浏览

终极指南：用m3u8下载器永久保存直播视频的5个关键步骤

终极指南：用m3u8下载器永久保存直播视频的5个关键步骤【免费下载链接】m3u8-downloader 一个M3U8 视频下载(M3U8 downloader)工具。跨平台: 提供windows、linux、mac三大平台可执行文件,方便直接使用。项目地址:

音视频 2026年02月14日 117 点赞 0 评论 14119 浏览

全网首发! Nvidia Jetson Thor 128GB DK 刷机与测评（一）刷机与 OpenCV-CUDA、pytorch CUDA13.0+ 使用

Nvidia Jetson Thor DK 于 2025年8月25日正式发售，我们实验室获得了首批套件，经过几天的折腾，这篇博客将总结如何刷机以及刷机过程中的注意事项。【Note】：由于评测部分内容太多，我们将这篇博客拆分为多篇避免单独的博客失去重点，你可以通过下面的链接进行跳转： 《全网首发! Nv

音视频 2025年10月24日 181 点赞 0 评论 14104 浏览

FunASR开源项目实战：解锁语音识别新姿势

摘要：FunASR是阿里巴巴达摩院开源的高性能语音识别工具包，具备语音识别、说话人分离、标点恢复等核心功能。项目采用先进的Paraformer非自回归架构，在中文识别任务上表现优异，支持实时与非实时处理模式。通过预训练模型和易用API，可快速搭建智能语音助手、会议转写、视频字幕等应用场景。技术亮点包括：多说话

音视频 2025年09月29日 139 点赞 0 评论 14084 浏览

音视频

首页

IT互联网

音视频

列表

默认

浏览次数

发布时间