Skip to content

Paris corpusのtrainingとtuningを録音単位で分離 - #40

Merged
PyYoshi merged 1 commit into
devfrom
v3/paris-tuning-split
Sep 20, 2026
Merged

PyYoshi merged 1 commit into
devfrom
v3/paris-tuning-split

Conversation

@PyYoshi

@PyYoshi PyYoshi commented Sep 20, 2026

Copy link
Copy Markdown
Owner

概要

  • 新しい固定recipeで、録音identity SHA-256順の8録音をtuning、残り24録音をtrainingへ分離。
  • 本文・予測値・変換可否・入力長で選別せず、既存validationと旧corpusを維持。
  • 旧32録音学習modelの流用不可をreportへ明示。新modelは再学習が必要。
  • 日本語手順と実データのmanifest/overlap hashを記録。

検証

  • corpus 49件、source 42件のunittest成功、Ruff E/F、diff check成功。
  • UTF-8/cp1252全64 variants成功、2回の取込と生成が全file byte一致。
  • validationを含む48 source / 1128 pairで近似重複候補0(意味・話者の独立性を保証しない)。
  • tuning full入力は1625〜3331 bytes。長さによる再選択なし。

新model学習・tuning予測・係数変更・独立holdout開封は未実施。P01は再開しません。

関連: PyYoshi/cChardet#123

@PyYoshi
PyYoshi marked this pull request as ready for review September 20, 2026 23:30
@PyYoshi
PyYoshi merged commit 90c7955 into dev Sep 20, 2026
11 checks passed
@PyYoshi
PyYoshi deleted the v3/paris-tuning-split branch September 20, 2026 23:30
Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Labels

None yet

Projects

None yet

Development

Successfully merging this pull request may close these issues.

1 participant