GPT
P

photo-concept-bucket

קוד פתוח

bghiraopenrail++2024-02-19

מאגר של מעל חצי מיליון קישורים לתמונות ברזולוציה גבוהה יחד עם תיאורים שנוצרו במודל ראייה. הוא מתאים למי שרוצה לאמן מודלי תמונה וטקסט בלי להסתבך עם זכויות יוצרים שדורשות ייחוס.

  • 232הורדות בחודש
  • 74לייקים

מה זה

המאגר כולל 567,597 רשומות שמחזיקות מטא דאטה וקישורים לתמונות חופשיות מזכויות יוצרים, בלי צורך במתן קרדיט. כל רשומה כוללת 18 עמודות, וביניהן כתובת התמונה ברשת, ממדים פיזיים, מונח החיפוש שהוביל אליה, צבע דומיננטי, וחותמת זמן ההעלאה. היוצר השתמש במערך מחשוב מבוזר שכלל עשרות כרטיסי מסך כדי לייצר תיאור סינתטי מדויק לכל תמונה באמצעות מודל הראייה CogVLM בדיוק של שמונה ביט.

התמונות עצמן מגוונות מאוד בגודלן, מרוחב של 684 פיקסלים ועד יותר מ־24,000 פיקסלים, עם ממוצע של כ־20.7 מגה פיקסל לתמונה. לצד המידע הטכני, הקובץ מכיל שדות טקסט שמקורם ביוצרי התמונות המקוריים, כמו כותרת, מיקום גיאוגרפי ותגיות, אבל המידע הזה נאסף כפי שהוא מהרשת ולא עבר סינון ידני מוקפד.

מתאים ל

  • אימון מודלי טקסט לתמונה

    חיבור התיאורים של CogVLM ישירות לתמונות המקוריות ברזולוציה גבוהה כדי לשפר הבנה של סצנות.

  • סיווג תמונות לפי נושאים

    חלוקת דוגמאות לקטגוריות שונות על בסיס מונחי החיפוש בעמודת class_label.

  • ניתוח צבעים ואסתטיקה

    בניית מודלים להתאמת פלטות עיצוב באמצעות השדות המוכנים של צבע ראשי ורשימת צבעים.

איפה זה נופל

חלק גדול מהטקסט המקורי מלא בזבל. עמודת התיאור חסרה בהרבה שורות ובאחרות מכילה ספאם, התגיות אינן מדויקות, ועמודת ה־alt נוצרה אוטומטית ואיכותה נמוכה. בנוסף, מי שבונה על התמונות צריך לזכור שהן יושבות על שרתים חיצוניים ויכולות להיעלם או להשתנות בכל רגע, ואין שום עדות לנוכחות של שפות שאינן אנגלית.

שאלות
נפוצות

האם התמונות עצמן נמצאות בתוך הדאטהסט?

לא, הקובץ מכיל רק קישורים לקובצי התמונות ברשת לצד המטא דאטה והתיאורים. המשמעות היא שתצטרכו להוריד את התמונות בעצמכם, ושחלק מהקישורים עלולים להישבר עם הזמן.

האם מותר להשתמש במאגר לפרויקט מסחרי?

הרישיון הוא openrail++ ומטרת המאגר היא לספק חומרים חופשיים ללא צורך בקרדיט. יחד עם זאת, הרישיון מכיל תנאי שימוש אתיים שאוסרים יישומים מסוימים, ולכן צריך לוודא שהפיתוח שלכם תואם למגבלות האלו.

איזה תיאור טקסטואלי כדאי לקחת לאימון?

עדיף להשתמש בעמודה cogvlm_caption, שנוצרה במיוחד עם מודל CogVLM בהנחיה לתאר את התמונה בדייקנות. הטקסטים שהגיעו מהגולשים, כמו description או tags, סובלים מאיכות נמוכה, חוסרים וספאם.

האם יש במאגר נתונים בעברית?

לא. מונחי החיפוש, התגיות והתיאורים שנוצרו על ידי המודל מבוססים על אנגלית בלבד, ואין ייצוג לשפה העברית בנתונים.

איך טוענים

טוענים את קובץ ה־parquet ישירות מ־Hugging Face, והוא שוקל רק כ־78 מגה בייט בזיכרון כי הוא לא מכיל את קובצי התמונות עצמם אלא רק קישורים ומטא דאטה. הגישה חופשית ואין צורך לבקש הרשאה מיוחדת. כדי לעבוד איתו באמת תצטרכו לכתוב סקריפט שיוריד את התמונות מהשדה url, ולהתמקד בעמודת cogvlm_caption שמכילה את התיאור המלא והאיכותי ביותר שנוצר עבור כל תמונה.

from datasets import load_dataset

ds = load_dataset("bghira/photo-concept-bucket")

הרישיון

המאגר מפורסם תחת רישיון openrail++. הרישיון מאפשר שימוש חופשי ונועד לאפשר עבודה ללא צורך במתן קרדיט, אך הוא כולל הגבלות שימוש אתיות שמחייבות גם מוצרים ומודלים שפותחו על בסיס הנתונים. אם אתם מתכננים מוצר מסחרי, חובה לבדוק שהשימוש הספציפי אינו מפר את תנאי ההתנהגות המוגדרים ברישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • מגבלות שימוש ברישיון

הרישיון המלא ב־Hugging Face ↗