Skip to content

Latest commit

 

History

History
39 lines (28 loc) · 2.55 KB

File metadata and controls

39 lines (28 loc) · 2.55 KB

AI 工具箱项目说明

本项目包含一系列基于 AI 的多媒体处理工具,涵盖音频转录翻译、图像打标、提示词优化等功能。

📁 文件功能清单

文件名 功能描述 典型用途
geminiAudio.py 🎙️ 音频转录与翻译
基于 Google Gemini API,将音频文件转录为日文文本并翻译成中文。支持多线程批量处理。
想知道日语生肉视频/音频讲了什么,生成中日对照字幕文本。
AItag.py 🏷️ 图像打标 (标准版)
利用视觉大模型分析图片内容,生成标准化的英文标签 (Tag)。包含标签库匹配和修正功能。
想要反推一张图片的 Prompt,并且希望 Tag 比较规范、准确。
image_processing_app.py 图像打标 (增强版/辣椒炒肉)
功能类似 AItag.py,界面库不同 (CustomTkinter)。内置特殊提示词 (Jailbreak) 以绕过限制,获取更详尽的描述。
需要对图片进行非常详细、无限制的内容解析,或者处理大批量图片 (带压缩功能)。
congpaixu.py 🔄 提示词重排序
利用 AI 模型 (Claude/GPT) 将杂乱的 Stable Diffusion 提示词按逻辑顺序重新排列。
整理网上复制的或者是自己随手写的乱序 Prompt,提高 AI 绘图的质量和稳定性。
chat_with_api.py 💬 API 测试工具
简单的命令行对话脚本,用于测试 API 连接。
开发或调试时,快速测试 API Key 是否有效,网络是否通畅。

🛠️ 快速使用指南

1. 音频处理 (geminiAudio.py)

  • 输入:把 .mp3, .wav 等音频文件放入指定文件夹。
  • 配置: 在界面填入 Google Gemini API Key。
  • 输出: 生成同名的 _jp.txt (日文) 和 _zh.txt (中文) 文件。

2. 图片打标 (AItag.py / image_processing_app.py)

  • 输入: 把图片文件放入指定文件夹。
  • 输出: 生成同名的 .txt 文件,内容为分析出的 Prompt 标签。

3. 提示词整理 (congpaixu.py)

  • 输入: 包含乱序 Prompt 的 .txt 文件。
  • 输出: 覆盖或生成新的 .txt 文件,内容为排序后的标准 Prompt。
    • 排序逻辑参考: [角色名] -> [数量] -> [外貌特征] -> [服装] -> [动作] -> [背景]

4. API 测试 (chat_with_api.py)

  • 运行: 直接运行脚本。
  • 操作: 在终端输入文字,查看 AI 回复。

Pro Tip: 如果遇到 API 报错,请先运行 chat_with_api.py 检查你的 Key 和网络环境是否正常。