本项目包含一系列基于 AI 的多媒体处理工具,涵盖音频转录翻译、图像打标、提示词优化等功能。
| 文件名 | 功能描述 | 典型用途 |
|---|---|---|
geminiAudio.py |
🎙️ 音频转录与翻译 基于 Google Gemini API,将音频文件转录为日文文本并翻译成中文。支持多线程批量处理。 |
想知道日语生肉视频/音频讲了什么,生成中日对照字幕文本。 |
AItag.py |
🏷️ 图像打标 (标准版) 利用视觉大模型分析图片内容,生成标准化的英文标签 (Tag)。包含标签库匹配和修正功能。 |
想要反推一张图片的 Prompt,并且希望 Tag 比较规范、准确。 |
image_processing_app.py |
⚡ 图像打标 (增强版/辣椒炒肉) 功能类似 AItag.py,界面库不同 (CustomTkinter)。内置特殊提示词 (Jailbreak) 以绕过限制,获取更详尽的描述。 |
需要对图片进行非常详细、无限制的内容解析,或者处理大批量图片 (带压缩功能)。 |
congpaixu.py |
🔄 提示词重排序 利用 AI 模型 (Claude/GPT) 将杂乱的 Stable Diffusion 提示词按逻辑顺序重新排列。 |
整理网上复制的或者是自己随手写的乱序 Prompt,提高 AI 绘图的质量和稳定性。 |
chat_with_api.py |
💬 API 测试工具 简单的命令行对话脚本,用于测试 API 连接。 |
开发或调试时,快速测试 API Key 是否有效,网络是否通畅。 |
- 输入:把
.mp3,.wav等音频文件放入指定文件夹。 - 配置: 在界面填入 Google Gemini API Key。
- 输出: 生成同名的
_jp.txt(日文) 和_zh.txt(中文) 文件。
- 输入: 把图片文件放入指定文件夹。
- 输出: 生成同名的
.txt文件,内容为分析出的 Prompt 标签。
- 输入: 包含乱序 Prompt 的
.txt文件。 - 输出: 覆盖或生成新的
.txt文件,内容为排序后的标准 Prompt。- 排序逻辑参考:
[角色名] -> [数量] -> [外貌特征] -> [服装] -> [动作] -> [背景]
- 排序逻辑参考:
- 运行: 直接运行脚本。
- 操作: 在终端输入文字,查看 AI 回复。
Pro Tip: 如果遇到 API 报错,请先运行
chat_with_api.py检查你的 Key 和网络环境是否正常。