GPT
D

danbooru2023-florence2-caption

קוד פתוח

KBlueLeafapache-2.02024-07-08

מאגר כתוביות טקסט באנגלית שנבנו עבור מיליוני תמונות אנימה מתוך Danbooru2023. הוא חוסך שבועות של הרצת מודלי ראייה כבדים אם אתם מאמנים מודלי יצירת תמונה.

  • 76הורדות בחודש
  • 66לייקים

מה זה

במקום תגיות בודדות שמאפיינות מאגרי אנימה, יש כאן תיאורי תמונה מלאים באנגלית שנבנו באמצעות המודל Florence-2-large של מיקרוסופט. הנתונים מבוססים על תמונות מתוך המאגר Danbooru2023, והתיאורים חולצו בשתי רמות פירוט שונות, תיאור מפורט ותיאור מפורט מאוד, באמצעות פרומפטים ייעודיים של המודל.

גרסת התיאור המפורט ביותר כוללת כמעט שבעה וחצי מיליון רשומות, 7,438,449 ליתר דיוק, עם אורך ממוצע של כ־120 טוקנים לפי טוקנייזר של פלאן טי חמש. בגרסה המפורטת הרגילה יש 7,439,002 רשומות קצרות יותר, סביב 50 עד 56 טוקנים בממוצע. המאגר עצמו מופץ כקבצי פארקט מאוחדים וכולל חלוקות לקבצים לפי אורך הכיתובים וגרסאות שעברו פיינטיון, בלי שבוצע סינון ידני נוסף על פלטי המודל.

מתאים ל

  • אימון מודלי יצירת תמונה

    שיפור היכולת של מודלי טקסט לתמונה להבין סצנות אנימה מורכבות לפי משפטים שלמים במקום רשימות של תגיות בודדות.

  • פיינטיון למודלי ראייה

    אימון מודלי שפה וראייה על זיהוי פרטים ספציפיים וסגנונות איור בעולם האנימה בעזרת מיליוני זוגות מזהים וכתוביות.

  • החלפת תגיות בכתוביות טבעיות

    המרת מאגרי תמונות מבוססי תגיות לפורמט כתוביות רציף לצורך משימות אימון שמחייבות תיאור שפתי קולח באנגלית.

איפה זה נופל

המאגר אינו מכיל את קובצי התמונות עצמם אלא רק מזהי תמונה וכתוביות, כך שצריך לחבר אליו את תמונות המקור בנפרד. כל הטקסטים נוצרו אוטומטית על ידי מודל ראייה שנוטה לתבניות קבועות. למשל, מעל שישה מיליון וחצי משפטים מתחילים בדיוק באותו ניסוח. בנוסף, המאגר קיים באנגלית בלבד, ואין מידע בכרטיס על סינון תכנים בעייתיים שקיימים לעיתים קרובות במאגרי אנימה פתוחים.

שאלות
נפוצות

האם יש במאגר עברית?

לא, המאגר כולו נוצר באנגלית בלבד באמצעות מודל השפה של מיקרוסופט. אין בו תרגום, תמיכה בניסוחים בעברית או תגיות מקומיות. מי שצריך עברית יצטרך לתרגם את הכתוביות באופן עצמאי.

האם התמונות עצמן כלולות בהורדה?

לא, הקבצים מכילים אך ורק טקסט ומספרי זיהוי. כדי לאמן מודלים תצטרכו להחזיק מראש את תמונות המקור של Danbooru2023. הקישור נעשה לפי שדה המזהה בכל שורה.

האם מותר להשתמש בזה למוצרים מסחריים?

הטקסט והקוד שפורסמו במאגר מוגדרים תחת רישיון אפאצ'י שתיים, שמתיר שימוש מסחרי. החלק המורכב נוגע לתמונות המקוריות של המאגר עליהן המודל רץ. עליהן עשויות לחול זכויות יוצרים שאינן מוסדרות ברישיון הזה.

איך נוצרו התיאורים של התמונות?

היוצר הריץ את מודל הראייה Florence-2-large על ארבעה כרטיסי שלוש אפס תשעים במשך שבעה עד עשרה ימים. המודל ייצר כתוביות באמצעות פקודת תיאור מפורט ישירות מתוך התמונות. לא היה כאן תהליך תיוג אנושי או הגהה ידנית.

איך טוענים

הנתונים מגיעים בקובצי פארקט ישירים כמו data-merged.parquet וגרסאות קצרות או מעובדות נוספות, ללא צורך באישור גישה מיוחד. בכל רשומה תמצאו רק שני שדות, key שמכיל את המספר המזהה של התמונה בבסיס הנתונים המקורי, ו־parsed שמחזיק את פלט הטקסט שנוצר. כדי לעבוד איתו צריך לטעון את השדות האלה בספריות נתונים סטנדרטיות ולקשר אותם לקבצי התמונה שכבר שמרתם מקומית.

from datasets import load_dataset

ds = load_dataset("KBlueLeaf/danbooru2023-florence2-caption")

הרישיון

המאגר מופץ תחת רישיון apache-2.0, מה שמתיר שימוש חופשי כולל שימוש מסחרי ואימון מודלים, תחת החובה לתת ייחוס ולשמור על תנאי הרישיון. יחד עם זאת, הרישיון חל על קובצי הטקסט והקוד שפורסמו כאן, ואינו פותר זכויות יוצרים שקשורות לתמונות המקוריות עצמן.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗