Multi-Modal Content Creator

通过 WhatsApp 接收文本或语音请求,利用 Whisper 识别语音,结合 DALL-E 3 生成图像,实现多模态内容创作全流程自动化。

已扫描
适合谁
自由职业创作者、数字营销人员
不适合谁
无OpenAI API密钥者、无法使用WhatsApp CLI的用户
国内可用性
需网络配置。可能需要网络配置或第三方服务可访问。
安装难度
新手友好(★☆☆)。基于终端操作、依赖、API Key 和本地环境要求的初步判断。

安装与下载

openclaw skills install @terrycarter1985/multimodal-content-creator

Skill 说明

命令、参数、文件名以原文为准

多模态内容创作者

面向自由职业创作者的自动化内容创作流程。通过 WhatsApp 接收客户请求(文本或语音消息),将音频转录为文字,根据提示生成图像,并将结果返回。

组件

  • wacli.py — 用于接收和发送消息的 WhatsApp CLI 客户端
  • transcribe.py — 使用 OpenAI Whisper API 进行音频转录(支持大文件分块处理)
  • generate_images.py — 支持批量处理的 DALL-E 3 图像生成
  • workflow.py — 端到端的工作流协调器

前置条件

  • Python 3.10+
  • OpenAI API 密钥(设置为环境变量 OPENAI_API_KEY
  • WhatsApp CLI 认证令牌

安装步骤

pip install -r requirements.txt
export OPENAI_API_KEY="your-api-key"
python wacli.py login <your-wacli-token>

使用方法

处理所有收到的 WhatsApp 请求

python workflow.py process-all

生成单张图像

python generate_images.py "一只猫骑着滑板"

从文件批量生成图像

python generate_images.py prompts.txt

转录音频文件

python transcribe.py recording.mp3

WhatsApp CLI 操作

python wacli.py list
python wacli.py send +1234567890 "你好!"
T
@terrycarter1985

已收录 9 个 Skill

相关推荐