feat: NVIDIA 切换到原生视频输入 — nemotron-3-nano-omni + 集锦视频单次调用
调研结论: build.nvidia.com 免费托管 API 上 video-llama3-8b 与 qwen2.5-vl-72b 已下线(404),nvidia/nemotron-3-nano-omni-30b-a3b-reasoning 可用(200, 40RPM 免费额度内),原生支持 video_url 输入(MP4 base64)。 实现: 1. nvidia_adapter 新增 analyze_video: 按关键帧时间点截取 ±1.5s 片段 (drawtext 叠加时间戳,连字符避免冒号转义)拼集锦视频,640 宽 CRF28, base64 后经 video_url 单次调用,输出全 schema JSON(frame_details + global_summary + entities_json)并归一化对齐时间戳 2. analyze_frames 保留为无视频文件时的降级路径; chat max_tokens 512→2048(reasoning 模型 token 消耗大); timeout 20→120s 3. orchestrator.run_visual_analysis 增加 video_path 参数,fallback 循环 对支持 analyze_video 的适配器优先走视频模式,失败自动降级逐帧 实测(360MB 测试视频, 3 关键帧): 集锦 107KB, 全程 37s, 动态动作识别准确 (走动→坐沙发→坐餐桌),跨片段综合摘要正常 — 显著优于旧逐帧静态识别。
This commit is contained in:
@@ -69,11 +69,14 @@ models:
|
||||
# cooldown: 900
|
||||
|
||||
# - provider: "nvidia"
|
||||
# enabled: false
|
||||
# model_name: "nvidia/llama-3.1-nemotron-70b-instruct"
|
||||
# role: "vision"
|
||||
# enabled: true
|
||||
# # Omni 模型原生支持视频输入(video_url),适配器自动按关键帧时间点
|
||||
# # 截取片段拼集锦后单次调用;失败自动降级逐帧图片模式
|
||||
# model_name: "nvidia/nemotron-3-nano-omni-30b-a3b-reasoning"
|
||||
# api_key: "${NVIDIA_API_KEY}"
|
||||
# base_url: "https://integrate.api.nvidia.com/v1"
|
||||
# timeout: 30
|
||||
# timeout: 120 # reasoning 模型视频推理较慢,勿低于 90
|
||||
# circuit_breaker:
|
||||
# enabled: true
|
||||
# threshold: 5
|
||||
|
||||
Reference in New Issue
Block a user