在 Gemini CLI 里用 WaveSpeed 扩展生成图像与视频
在 Gemini CLI 中安装 WaveSpeed 扩展,agent 就能搜索实时模型目录、读取输入 schema、运行任意图像/视频/音频/3D 模型——每次运行前还能先查价格。
By WaveSpeedAI1 min read
Gemini CLI 的扩展系统把上下文、命令和 agent 技能打包成一个可安装单元。WaveSpeed 扩展捆绑了 wavespeed 技能——wavespeed.ai 上的每个模型都是一条 wavespeed run <model-id> 命令,agent 在任务中途就能生成主图、编辑素材、让静态图动起来。
前置条件
- Node.js ≥ 18
- CLI:
npm install -g @wavespeed/cli - WaveSpeed API 密钥——
wavespeed login打开密钥页面并处理剩下的事
安装
gemini extensions install https://github.com/WaveSpeedAI/wavespeed-gemini-extension
配置到此为止。扩展带一个精简的上下文文件和技能;遇到媒体生成任务时 Gemini CLI 会激活技能。
agent 拿它做什么
技能只教一个模式——查找、检查、运行:
# 1. 在实时目录里查找模型
wavespeed models "seedream"
wavespeed models --type image-to-video --popular
# 2. 检查它的真实输入 schema(逐模型实时拉取)
wavespeed run bytedance/seedream-v5.0-pro -h
# 3. 运行,用 JSON 读结果
wavespeed run bytedance/seedream-v5.0-pro \
-p "a cyberpunk skyline at golden hour" \
-i aspect_ratio="16:9" -i resolution="2k" --json
本地文件走 @path 标记——CLI 一步完成上传并替换成托管 URL:
# 编辑本地图片
wavespeed run bytedance/seedream-v5.0-pro/edit \
-p "replace the background with a sunlit kitchen" \
-i images='["@./input.jpg"]' --json
# 让本地静态图动起来
wavespeed run bytedance/seedance-2.5/image-to-video \
-p "subtle parallax, gentle wind" -i image=@./hero.jpg --json
花费控制
wavespeed price bytedance/seedream-v5.0-pro -i resolution=2k # 报价,不扣费
wavespeed balance
很多模型按输入计费——音频时长、帧数。不带这些输入询价,公式会坍缩到模型的基础价(区间下限);命令会列出它没看到的输入(--json 里的 unpriced_inputs)。实际扣费金额以运行为准。
坑
- 裸路径不会上传。
-i image=./photo.jpg发出去的是字符串本身。要写@./photo.jpg。 - 不要编造模型 ID——先用
wavespeed models或wavespeed schema <id>确认。 - 运行永远带
--json,让 agent 程序化读取outputs[0]。
