voice-text-to-meme
by @hei-maom
根据输入法语音识别文本或润色后文本生成单张表情包图片。适用于用户想把一句话做成聊天可发送的表情包、meme 图、带字梗图或贴纸图时。支持原始语音文本和润色后文本两种输入,默认优先使用润色后文本;自动根据文本语气判断风格;默认直接生成带字图片,也支持生成无字图并同时给出配文模板;使用 doubao-seedream...
clawhub install voice-text-to-meme📖 About This Skill
name: voice-text-to-meme description: 根据输入法语音识别文本或润色后文本生成单张表情包图片。适用于用户想把一句话做成聊天可发送的表情包、meme 图、带字梗图或贴纸图时。支持原始语音文本和润色后文本两种输入,默认优先使用润色后文本;自动根据文本语气判断风格;默认直接生成带字图片,也支持生成无字图并同时给出配文模板;使用 doubao-seedream-4-5-251128 作为默认图片模型。
语音文本转表情包
概述
此 Skill 用于把输入法侧已经拿到的语音文本,转换成一张适合聊天发送的表情包图片。默认处理目标:
工作流
按以下顺序执行:1. 选择输入文本
- 若同时提供 polished_text 和 original_text,优先使用 polished_text。
- 若只有一个文本字段,则使用该字段。
- 若两个字段都很短或明显无意义,先让用户补充更完整文本。
2. 判断语气与意图 根据文本判断整体方向,常见类型包括: - 开心/得意 - 无语/吐槽 - 委屈/求助 - 拒绝/婉拒 - 催促/提醒 - 敷衍/摆烂 - 惊讶/震惊 - 日常可爱/轻松
3. 生成表情包文案与视觉提示 - 把输入文本压缩成适合上图的短文案。 - 文案优先短、狠、准,通常不超过 12 个汉字;确有必要时可放宽,但避免长段落。 - 构造适合图片模型的视觉提示词,包含:人物表情、动作、构图、风格、字幕位置、背景简洁程度。
4. 选择输出模式 - 默认:带字图模式 - 直接要求图片模型生成带字表情包。 - 备选:无字图 + 文案模板模式 - 生成无字图。 - 同时给出上字幕/下字幕或单行字幕建议,便于 UI 或后处理叠字。 - 当用户明确说“不要直接在图里写字”“我要自己后处理字幕”,必须使用备选模式。
5. 调用脚本生成图片
- 使用 scripts/generate_meme.py。
- 默认图片模型为 doubao-seedream-4-5-251128。
- 默认通过 OpenAI 兼容接口调用,基地址从环境变量读取。
6. 返回结果 - 若生成成功,返回图片文件路径,以及必要时的字幕模板。 - 不要输出冗长解释;以可直接发送为目标。
文案规则
始终遵守:建议的文案模式:
风格选择规则
按语气自动选择合适视觉风格:除非用户明确指定,不要默认生成过于写实或复杂场景。优先:
直接带字图模式
默认优先使用此模式。要求:
无字图 + 文案模板模式
以下情况优先使用:此模式下:
top_text
- bottom_text
- 或 single_caption配置
默认环境变量:MEME_MODEL_API_KEY:必填,图片模型 API tokenMEME_MODEL_BASE_URL:默认 https://models.audiozen.cn/v1MEME_MODEL_NAME:默认 doubao-seedream-4-5-251128MEME_OUTPUT_DIR:图片输出目录,可选脚本
使用scripts/generate_meme.py 生成图片。常用参数:
--text:输入文本--polished-text:润色后文本,可选--mode:direct-text 或 template--style:可选,手动指定风格--size:图片尺寸,默认 2K--output:输出文件路径示例
示例 1:默认带字图
输入:original_text: “我真的会谢”polished_text: “我真的会谢。”处理:
示例 2:自己后处理字幕
输入:original_text: “你先忙 我不急”处理: