GPT
V

various

קוד פתוח

malcolmreywtfpl2025-10-18

אוסף קבצים מבולגן שכולל מדריכים לאימון מודלים של תמונה ווידאו, לצד קובצי מדיה ודוגמאות. שווה לפתוח אותו רק אם אתם מחפשים הדרכה מעשית על WAN 2.1 או Flux.

  • 49,375הורדות בחודש
  • 172לייקים

מה זה

זה לא מאגר נתונים רגיל של טבלאות או תמונות מתויגות, אלא מעין ארכיון אישי שמכיל 3,358 קבצים שונים. לפי התיעוד, המטרה של המפרסם היא לרכז חומרים שקשורים למודלים כמו Stable Diffusion, Flux ו־WAN. בפועל יש שם מדריכים טכניים שנלקחו מאתר CivitAI, כולל מדריך מפורט לאימון LoRA על גבי WAN 2.1 בעזרת AI Toolkit, ורשימת מאמרים שמכסה נושאים כמו DreamBooth, LyCORIS ו־SDXL.

חוץ מקובצי הטקסט והמדריכים, המאגר מחזיק קבצים בינאריים שלא מוסברים במלואם בעמוד הראשי. בין השאר תמצאו שם ארכיוני זיפ כמו ernie-samples, ותיקייה בשם crossovers שמכילה פרקי וידאו שלמים בפורמט MP4. אין פירוט איך החומרים האלה נאספו, האם עברו סינון כלשהו, או מה הקשר הישיר ביניהם לבין מדריכי האימון המוצגים בטקסט.

מתאים ל

  • אימון LoRA על וידאו

    לימוד השלבים המעשיים והגדרות העבודה לאימון מודל WAN 2.1 באמצעות כלי AI Toolkit לפי המדריך.

  • העמקת ידע במודלי תמונה

    קריאת מאמרים מרוכזים על טכניקות שונות כמו LyCORIS, DreamBooth ושיפור איכות היצירה ב־SDXL.

  • בחינת דוגמאות קוד ומדיה

    הורדה ובדיקה של קובצי הווידאו והדוגמאות הדחוסות כדי להבין תוצרי אימון אישיים של היוצר.

איפה זה נופל

הבעיה המרכזית היא היעדר מבנה שמגדיר מה הופך את האוסף הזה לדאטהסט. אין כאן מטא-דאטה מסודר, אין חלוקה לסט אימון או מבחן, ואין שום עדות לסינון מידע אישי, תוכן מוגן או זיהום נתונים. המידע הטקסטואלי קיים באנגלית בלבד, ואין שום התייחסות לעברית. בנוסף, קובצי הווידאו והדוגמאות נראים כמו פרויקטים אישיים של היוצר. אם תנסו להזין את החומרים האלה ישירות לתוך צינור למידה חישובית בלי ניקוי ידני כבד, אתם פשוט תאמנו מודל על גיבוב של קבצים אקראיים.

שאלות
נפוצות

האם המאגר הזה מתאים לאימון ישיר של מודל שפה או ראייה ממוחשבת?

לא ממש, לפחות לא במצבו הנוכחי. אין כאן מבנה אחיד של תמונות ותיוגים או טקסטים מקבילים, אלא שילוב של מדריכים כתובים לצד סרטונים וקובצי דחיסה. כדי להשתמש בו לאימון, תצטרכו להפריד את הקבצים ידנית ולבנות דאטהסט מאפס.

האם מותר להשתמש בתכנים האלה במוצר מסחרי?

הרישיון שמופיע בעמוד הוא WTFPL, שמתיר כל שימוש כולל מסחרי לחלוטין וללא דרישת ייחוס. עם זאת, יש לזכור שחלק מקובצי המדיה והסרטונים עשויים להכיל חומרים ממקורות חיצוניים שלא הובהרו ברישיון עצמו. לכן כדאי להיזהר משימוש מסחרי בקובצי המדיה עצמם.

האם יש במאגר תמיכה או תוכן בעברית?

אין במאגר הזה שום תוכן בעברית. כל המדריכים, שמות הקבצים וההסברים כתובים באנגלית בלבד. אם אתם מחפשים נתונים או הדרכות בשפה העברית, תצטרכו לפנות למקורות אחרים לחלוטין.

כמה קבצים יש בפנים ואיך מורידים אותם בצורה נוחה?

המאגר כולל 3,358 קבצים, והוא אינו מחולק לתצורת דאטהסט מוכרת כמו חלוקת train ו־test. במקום למשוך את כל התיקייה בפקודה אחת, הכי פשוט להיכנס ישירות לעמוד הקבצים בהאגינג פייס ולהוריד נקודתית את קובצי ה־Markdown או המדיה הדרושים לכם.

איך טוענים

אין צורך לבקש אישור גישה מיוחד כדי להוריד את הקבצים, הכל פתוח לחלוטין ברשת. עם זאת, לא מומלץ להריץ פקודת טעינה אוטומטית של ספריית datasets על המאגר כולו, כי אין כאן מבנה נתונים אחיד. במקום זה עדיף לגשת ישירות לקבצים הספציפיים שאתם צריכים דרך ממשק הגיט או דפדפן הקבצים. אם מעניין אתכם מדריך האימון, פשוט קראו את קובצי ה־Markdown. אם אתם רוצים את הסרטונים או דוגמאות ה־zip, קחו בחשבון שיש שם אלפי קבצים נפרדים ומומלץ לבחור נקודתית מה להוריד למחשב במקום למשוך את כל הנפח בבת אחת.

from datasets import load_dataset

ds = load_dataset("malcolmrey/various")

הרישיון

המאגר פורסם תחת רישיון WTFPL, שזה אומר פשוטו כמשמעו שאתם יכולים לעשות עם הקבצים מה שאתם רוצים. מותר להשתמש בהם למטרות מסחריות, לשנות, להפיץ מחדש ואפילו לאמן מודלים בלי לתת קרדיט ובלי חובה לשחרר את התוצר באותו רישיון. החופש הזה חל על הרישיון המוצהר, אך קחו בחשבון שאין ערובה לגבי זכויות היוצרים המקוריות של הסרטונים והדוגמאות שנמצאים בתוך התיקיות.

הרישיון המלא ב־Hugging Face ↗