GPT
V

video-vec2wav2-tokenizer

קוד פתוח

k9cliרישיון לא דווח2026-06-19

המאגר מכיל קוד של צינור עיבוד מלא להמרת סרטוני וידאו לקבצי קול ותמלולים מוכנים. הוא מיועד למי שרוצה לייצר בעצמו נתוני אימון למודלי דיבור וזיהוי קולי.

  • 1,143,281הורדות בחודש
  • 19לייקים

מה זה

הפרויקט הזה אינו אוסף קול סטנדרטי מוכן מראש, אלא תשתית תוכנה וקבצי חיתוך. המאגר כולל עשרות אלפי קבצים שמורכבים מסקריפטים בפייתון, הגדרות ומבנה של חבילת קוד בשם video_vec2wav2_tokenizer. הרעיון הוא לסרוק תיקיות של סרטונים בפורמטים כמו mp4, mkv או avi, לחלץ מהם את פס הקול לפורמט WAV מונו ב־16 קילוהרץ, ולתמלל אותם באמצעות faster-whisper.

התוצרים שהמערכת פולטת מחולקים לקטעי שמע קצרים לפי חותמות הזמן של המילים. לצד קבצי הקול נוצרים קבצי מטא-דאטה בתצורות שונות כמו metadata.csv, קובץ dataset.jsonl שמכיל את נתיב השמע, הטקסט ומשך הקטע, וקובץ tts_metadata.csv שמוסיף מזהה דובר. המערכת מסוגלת גם לייצר קבצי מאפיינים בינאריים עם ספקטרוגרמות לצורך אימון ישיר.

מתאים ל

  • בניית דאטהסט לזיהוי דיבור

    חיתוך סרטונים לקטעי אודיו קצרים בליווי תמלול וזמני מילים עבור אימון ASR.

  • הכנת נתונים להקראת טקסט

    הפקת קבצי שמע נקיים יחד עם שיוך מזהה דובר עבור אימון מודלי TTS.

  • אימון Wav2Vec2

    חילוץ ספקטרוגרמות לקבצים בינאריים והרצת אימון מודל קול ישירות מהפקודה המובנית.

איפה זה נופל

התמלולים נוצרים בצורה אוטומטית לחלוטין על ידי Whisper, מה שאומר שטעויות זיהוי, הזיות של המודל ואי דיוקים בחיתוך הזמנים יעברו ישירות לנתוני האימון שלכם. המאגר עצמו לא מספק נתוני קול מתויגים ביד. אם תריצו אותו על סרטונים בעברית, האיכות תהיה תלויה ברמת הדיוק של Whisper בשפה, שמציגה לעיתים קרובות שגיאות ניקוד ותעתיק, כך שאי אפשר להכניס את התוצרים למודל סופי בלי בדיקה וסינון ידני.

שאלות
נפוצות

האם הדאטהסט כולל קבצי אודיו מוכנים להורדה?

לא, המאגר מכיל בעיקר את קוד המקור והסקריפטים שמרכיבים את הצינור. מטרת הכלי היא שאתם תספקו את קבצי הווידאו שלכם, והוא ייצר מהם את הדאטהסט המקומי.

האם יש תמיכה בעברית?

הקוד משתמש במודל faster-whisper שמזהה שפות באופן אוטומטי ותומך גם בעברית. עם זאת, רמת הדיוק של התמלול והחלוקה למקטעים תהיה מוגבלת ביחס לאנגלית ותדרוש בדיקה של התוצאות.

מותר להשתמש בתוצרים לצרכים מסחריים?

בתיעוד עצמו מצוין רישיון MIT שמאפשר שימוש מסחרי, אך במטא-דאטה של הדף הרישיון מסומן כלא ידוע. בנוסף, החוקיות של התוצר הסופי תלויה לחלוטין בזכויות היוצרים של סרטוני המקור שתזינו למערכת.

מה דרישות החומרה להרצת הכלי?

הקוד תומך בריצה על מעבד רגיל אך פועל מהר משמעותית עם מעבד גרפי של Nvidia ו־CUDA עבור שלב התמלול. תהליך הפריסה משתמש בהזרמת מידע חסכונית בזיכרון, כך שאין צורך בנפח RAM חריג גם בעיבוד מאות ג׳יגה-בייט של וידאו.

איך טוענים

כדי להשתמש בקוד צריך סביבת פייתון 3.11 ומעלה והתקנה של FFmpeg במערכת ההפעלה. מתקינים את התלויות דרך pip ומריצים את פקודת ה־CLI בשם video2dataset מול תיקיית הווידאו שלכם. התוכנה תומכת בעיבוד מקבילי ובהזרמת נתונים שמתאימה גם למדיה בנפח של מעל טרה-בייט בלי לחנוק את הזיכרון. אין צורך באישור גישה מיוחד למאגר עצמו.

from datasets import load_dataset

ds = load_dataset("k9cli/video-vec2wav2-tokenizer")

הרישיון

בעמוד המאגר החיצוני לא דווח רישיון רשמי בשדות המטא-דאטה, אך בתוך הטקסט של התיעוד נכתב שמדובר ברישיון MIT. אי ההתאמה הזו דורשת זהירות משפטית. אם הרישיון הוא אכן MIT, השימוש חופשי לחלוטין כולל מטרות מסחריות, אך עליכם לוודא מראש את הסטטוס מול היוצר כדי לא להסתכן בהפרת זכויות יוצרים על הקוד.

הרישיון המלא ב־Hugging Face ↗