音视频

Claude Code 装个 Skill,一段文字几分钟变 1080p 视频

在 Claude Code 对话窗口输入 /make-video,贴一段文字(博客、笔记、教程、PPT 大纲都行),纯渲染约 1 分钟出片(端到端含分镜和 TTS 生成约 2-3 分钟)。无需打开剪辑软件。 一、痛点写技术博客的人都有这个需求:把文章转成短视频。传统做法是:写脚

多模态 AI 系统的后端架构:文本、图像、音频的统一推理调度与资源管理

多模态 AI 系统的后端架构:文本、图像、音频的统一推理调度与资源管理一、多模型后端的调度复杂度一个典型的多模态 AI 后端需要同时服务:文本生成(LLaMA 70B)、图像理解(LLaVA 13B)、语音识别(Whisper Large-v3)、文本到语音(Bark/VI

音频麦克风技术笔记

麦克风(Microphone,简称Mic)是将声能(声波振动)转换为电能(电信号) 的换能器件,广泛应用于录音、直播、会议、语音交互等场景。下面从核心技术原理、常见形态、使用方法、MCU 处理流程四个维度详细拆解:一、 麦克风的核心技术原理(按换能方式分类&#

MiniMax 和OpenClaw视频生成环境配置指南

MiniMax 视频生成环境配置指南 问题背景OpenClaw 的 minimax-multimodal-toolkit skill 依赖以下环境: Git Bash — 运行 bash 脚本 ffmpeg — 音视频处理 jq — JSON 命令行处理 MINIMAX_API_KEY — MiniMax API 密钥 MINIMAX_API_HOST — Mini

媒体处理:HTML5音视频标签结合AI的智能转码与播放

媒体处理:HTML5音视频标签结合AI的智能转码与播放 📝 本章学习目标:本章是基础入门部分,帮助零基础读者建立HTML5与AI结合开发的初步认知。通过本章学习,你将全面掌握"媒体处理:HTML5音视频标签结合AI的智能转码与播放"这一核心主题。 一、引言:为什么这个话题如此重要

酷狗音乐下载的KGG/KGM/KGMA音频如何转换成MP3?从原理到实操一次讲清(2026可用方案)

很多朋友第一次接触酷狗下载的音频文件时,都会有点懵。明明歌曲已经下载好了,但文件后缀却变成了: kgm kgma kgg 双击打不开、拖进剪映报错、车载播放器不识别,甚至改成 .mp3 后缀后还是播放失败。其实问题并不复杂。因为这些文件本质上并不是普通音频,而是酷狗做过 DRM 加密封装的专有格式。这篇文章我就尽量用通俗一点的方

别被代码吓跑!普通人3步搞定AI视频神器——Pixelle-Video - AI 全自动短视频引擎(附避坑)

我一个做自媒体运营的朋友找我吐槽:她每天要剪3-5条短视频发抖音和小红书,每条从找素材、写脚本、配音到剪辑,少则两小时多则半天。她不是技术背景,面对各种”AI视频生成工具”要么是英文界面劝退,要么要付费订阅,要么需要本地GPU。我想起之前在GitHub上看到过一个开源项目Pixelle-Video,一

计算机视觉:异常检测(paper with code汇总更新中)

本文汇总异常检测相关论文,持续更新,所有内容均为开源,欢迎交流学习! 【异常检测】(WACV2026)VLMDiff: Leveraging Vision-Language Models for Multi-Class Anomaly Detection with Diffusion论文地址:http

学术会议丨顶会CVPR 2026收官:从论文数据看计算机视觉的五大范式迁移

第43届IEEE/CVF计算机视觉与模式识别会议(CVPR 2026),是计算机视觉与人工智能领域的国际顶级学术会议,于6月3日至7日在美国丹佛落幕,本届会议有效投稿 16092篇,录用约4090篇(录用率25.4%),维持了近三年25%左右的低位水平。与此同时&#xff0

ESP32-S3 智能语音助手项目(语音识别+播放)

基于 ESP32-S3 的离线语音助手:从麦克风到扬声器的完整闭环 你有没有想过,一个能听懂你说“打开台灯”并立刻执行的小盒子,其实不需要联网?也不需要云服务器?甚至成本还不到一杯奶茶? 这不再是科幻。借助 ESP32-S3 和乐鑫官方推出的 ESP-SR 语音识别 SDK ,我们完全可