WaveSpeedAI

在 Gemini CLI 里用 WaveSpeed 扩展生成图像与视频

在 Gemini CLI 中安装 WaveSpeed 扩展,agent 就能搜索实时模型目录、读取输入 schema、运行任意图像/视频/音频/3D 模型——每次运行前还能先查价格。

By WaveSpeedAI1 min read

Gemini CLI 的扩展系统把上下文、命令和 agent 技能打包成一个可安装单元。WaveSpeed 扩展捆绑了 wavespeed 技能——wavespeed.ai 上的每个模型都是一条 wavespeed run <model-id> 命令,agent 在任务中途就能生成主图、编辑素材、让静态图动起来。

前置条件

  • Node.js ≥ 18
  • CLI:npm install -g @wavespeed/cli
  • WaveSpeed API 密钥——wavespeed login 打开密钥页面并处理剩下的事

安装

gemini extensions install https://github.com/WaveSpeedAI/wavespeed-gemini-extension

配置到此为止。扩展带一个精简的上下文文件和技能;遇到媒体生成任务时 Gemini CLI 会激活技能。

agent 拿它做什么

技能只教一个模式——查找、检查、运行:

# 1. 在实时目录里查找模型
wavespeed models "seedream"
wavespeed models --type image-to-video --popular

# 2. 检查它的真实输入 schema(逐模型实时拉取)
wavespeed run bytedance/seedream-v5.0-pro -h

# 3. 运行,用 JSON 读结果
wavespeed run bytedance/seedream-v5.0-pro \
  -p "a cyberpunk skyline at golden hour" \
  -i aspect_ratio="16:9" -i resolution="2k" --json

本地文件走 @path 标记——CLI 一步完成上传并替换成托管 URL:

# 编辑本地图片
wavespeed run bytedance/seedream-v5.0-pro/edit \
  -p "replace the background with a sunlit kitchen" \
  -i images='["@./input.jpg"]' --json

# 让本地静态图动起来
wavespeed run bytedance/seedance-2.5/image-to-video \
  -p "subtle parallax, gentle wind" -i image=@./hero.jpg --json

花费控制

wavespeed price bytedance/seedream-v5.0-pro -i resolution=2k   # 报价,不扣费
wavespeed balance

很多模型按输入计费——音频时长、帧数。不带这些输入询价,公式会坍缩到模型的基础价(区间下限);命令会列出它没看到的输入(--json 里的 unpriced_inputs)。实际扣费金额以运行为准。

  • 裸路径不会上传。 -i image=./photo.jpg 发出去的是字符串本身。要写 @./photo.jpg
  • 不要编造模型 ID——先用 wavespeed modelswavespeed schema <id> 确认。
  • 运行永远带 --json,让 agent 程序化读取 outputs[0]

相关链接

分享