GPT
N

naruto-blip-captions

קוד פתוח

lambdaרישיון לא דווח2022-10-27

תמונות אנימה מסדרת נארוטו עם תיאורי טקסט שנוצרו אוטומטית. המאגר מתאים למי שרוצה לאמן מודל דיפוזיה לייצר סגנון ציור יפני ספציפי בלי לעבוד שבועות על תיוג ידני.

  • 1,788הורדות בחודש
  • 56לייקים

מה זה

המאגר כולל זוגות של תמונה וטקסט שמיועדים לאימון מודלים של טקסט לתמונה, בעיקר למי שרוצה לשחזר את הסגנון הגרפי של נארוטו. התמונות המקוריות נאספו ישירות מתוך אתר המעריצים Narutopedia, והן מציגות דמויות, סצנות ופרטים מתוך סדרת האנימה המוכרת.

כל שורה במאגר מכילה שני שדות בלבד: שדה תמונה ושדה טקסט. התמונות שמורות כקובצי JPEG בגדלים משתנים, והטקסט הוא תיאור שנוצר על ידי מודל הראייה הממוחשבת BLIP של חברת Salesforce. לא מדובר בתיאורים שנכתבו בידי אדם או מעריצים, אלא בכתוביות שחולצו בצורה ממוחשבת לחלוטין. הנתונים לא עברו חלוקה מובנית לסט בדיקה או אימות, והמאגר מגיע כפי שהוא בחלק אימון יחיד.

מתאים ל

  • אימון סגנון באנימה

    כוונון עדין של מודלי תמונה כדי לייצר דמויות חדשות בסגנון הציור המוכר של הסדרה.

  • ניסויי לורה ודיפוזיה

    בדיקת התכנסות של מתאמי LoRA על דאטהסט קטן וסגור סביב עולם תוכן אחיד.

  • הערכת תיוג אוטומטי

    השוואת התיאורים שייצר מודל הראייה אל מול תיאורים שנכתבו ידנית בידי מעריצים.

איפה זה נופל

הבעיה המרכזית כאן היא איכות הכתוביות. מודל BLIP לא מכיר שמות של דמויות, טכניקות לחימה או מושגים פנימיים מהעולם של נארוטו, אלא מתאר בצורה גנרית מה שהוא רואה בעין, כמו אדם עם שיער צהוב או חליפה כתומה. בנוסף, כל התיאורים באנגלית בלבד, ואין שום תמיכה בעברית או ביפנית. אין מידע על סינון תוכן, כפילויות או איכות התמונות שנמשכו מאתר המעריצים, ולכן תצטרכו לעבור בעצמכם על הדוגמאות כדי לוודא שאין שם מריחות, רעש או חיתוכים בעייתיים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא, אין במאגר רישיון מוצהר והתמונות מבוססות על זכויות היוצרים של הסדרה נארוטו. שימוש מסחרי במודל שאומן עליו חושף אתכם לתביעות של בעלי הזכויות. המאגר מיועד לניסויים ומחקר בלבד.

האם יש במאגר תיאורים בעברית?

אין שום עברית במאגר. כל התיאורים נוצרו באנגלית באמצעות מודל BLIP. אם רוצים לאמן מודל שמבין הנחיות בעברית, תצטרכו לתרגם את הטקסטים בעצמכם.

איך נאספו התמונות והטקסטים?

היוצרים הורידו תמונות מתוך אתר הוויקי של מעריצי הסדרה. לאחר מכן הם הריצו על כל תמונה מודל ראייה ממוחשבת שייצר את תיאור הטקסט באופן אוטומטי.

האם התמונות מגיעות בגודל אחיד?

לא, התמונות שמורות כקובצי JPEG בגדלים וברזולוציות שונות. מי שרוצה להזין אותן למודל אימון יצטרך לבצע חיתוך ושינוי גודל בצורה יזומה לפני האימון.

איך טוענים

טוענים את המאגר ישירות דרך ספריית datasets באמצעות המזהה lambda/naruto-blip-captions. אין כאן תהליך אישור גישה או שאלונים למלא, הכל פתוח להורדה מיידית. המידע מחולק לשני קובצי Parquet שונים בתוך תיקיית הנתונים, לצד קובץ הגדרות. כשמושכים את השורות מקבלים אובייקט תמונה בפורמט PIL ושדה טקסט מקביל. בגלל שהתמונות שמורות ברזולוציות ובגדלים שונים לחלוטין, תצטרכו להוסיף צינור עיבוד מקדים שיחתוך או ישנה את קנה המידה שלהן לפני שדוחפים אותן למודל כמו סטייבל דיפיוז'ן.

from datasets import load_dataset

ds = load_dataset("lambda/naruto-blip-captions")

הרישיון

היוצרים לא דיווחו על רישיון כלל בכרטיס המאגר. מעבר לזה, התמונות עצמן מוגנות בזכויות יוצרים של יוצרי הסדרה ונלקחו מאתר מעריצים, כך שאין כאן זכויות נקיות. בפועל, אסור לבנות על זה מוצר מסחרי או לשלב את המאגר בתהליכי ייצור של חברה. הוא מתאים אך ורק לניסויי מחקר עצמאיים, בדיקות קונספט או למידה אישית, ומי שמחליט לאמן עליו מודל צריך לקחת בחשבון את הסיכון המשפטי סביב קניין רוחני.

הרישיון המלא ב־Hugging Face ↗