GPT
B

BLIP3o-Pretrain-Long-Caption

קוד פתוח

BLIP3oapache-2.02025-05-12

מאגר ענק של 27 מיליון תמונות שלכל אחת מהן הוצמד תיאור טקסטואלי מפורט. הוא נבנה עבור מי שמאמן מודלים של ראייה ושפה וזקוק לתיאורים עשירים בהרבה מכיתובים קצרים רגילים.

  • 17,337הורדות בחודש
  • 74לייקים

מה זה

המאגר כולל 27 מיליון צמדים של תמונה וכיתוב ארוך. כל כיתוב מחזיק בערך 120 טוקנים ונוצר באופן סינתטי באמצעות המודל Qwen2.5-VL-7B-Instruct. לפי שמות הקבצים שמתחילים בקידומת sa, התמונות מגיעות כנראה מאוסף פומבי קיים, אך הכרטיס אינו מפרט את מקורן המדויק, כיצד הן נאספו או אילו סינונים עברו לפני שנכנסו לתהליך.

התוכן מחולק לרוחב 2,893 קבצים שנארזו בארכיוני tar נפרדים, כולם שייכים לחלק האימון היחיד. אין בכרטיס חלוקה מוגדרת לולידציה או למבחן, ואין תיעוד לגבי תגיות או מטא דאטה נוסף פרט לתמונה עצמה ולתיאור המיוצר.

מתאים ל

  • אימון מקדים של מודלי ראייה

    לימוד קשרים מורכבים בין תמונה לטקסט בעזרת כיתובים שמפרטים סצנות מלאות ולא רק אובייקט בודד.

  • שיפור מודלי יצירת תמונות

    הזנת תיאורים ארוכים ומפורטים לשלב האימון כדי לשפר את ההיענות להנחיות טקסט מורכבות.

  • כוונון מודלי תיאור תמונה

    אימון מודלים קטנים לייצור פסקאות תיאור מלאות ועשירות במקום משפט לקוני אחד.

איפה זה נופל

הכיתובים נוצרו כולם על ידי מודל שפה חזותי ולא בידי בני אדם, מה שחושף את האימון להזיות, שגיאות זיהוי והטיות מובנות של Qwen2.5-VL-7B-Instruct. הכרטיס אינו מציין שימוש בשפות שאינן אנגלית, אין תיעוד לסינון של תכנים רגישים או כפילויות, ומקור התמונות המקורי לא מוצהר במפורש. לא הייתי מכניס את הנתונים ישירות לפיתוח מוצר לפני בדיקה מדגמית של איכות התיאורים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מסחרי?

כן, הרישיון המדווח הוא apache-2.0 שמתיר שימוש מסחרי מלא ושינוי של הנתונים. יש להקפיד על מתן קרדיט כנדרש ברישיון, ולזכור שהכרטיס לא מפרט את תנאי השימוש בתמונות המקור עצמן.

האם המאגר כולל תיאורים בעברית?

לא, התיאורים נוצרו באנגלית בלבד באמצעות מודל שפה חזותי. אם יש צורך בעברית, תידרש עבודת תרגום מקדימה או אימון המשך ייעודי.

כמה מקום בדיסק צריך כדי להוריד את הכל?

המאגר מורכב מ־2,893 קבצי tar המכילים 27 מיליון תמונות. מדובר בהיקף נתונים עצום שדורש נפח אחסון של טרה-בייטים רבים ותשתית הורדה חזקה.

במה הוא שונה ממאגרי כיתובים רגילים?

במקום כיתובי רשת קצרים של מילים בודדות, כל תמונה מקבלת תיאור סינתטי באורך של כ־120 טוקנים. הפירוט העשיר עוזר למודלים להבין יחסים מורכבים בתוך התמונה.

איך טוענים

טוענים את הקבצים ישירות באמצעות snapshot_download מתוך ספריית huggingface_hub, או שעובדים מולם באמצעות load_dataset עם תמיכה בפורמט webdataset ללא חילוץ של ארכיוני ה־tar. המאגר פתוח לחלוטין ואינו דורש אישור גישה מוקדם, אך כמות הקבצים והיקף של 27 מיליון תמונות דורשים נפח אחסון מקומי משמעותי מאוד ותמיכה בעיבוד מקבילי רחב בעת הטעינה.

from datasets import load_dataset

ds = load_dataset("BLIP3o/BLIP3o-Pretrain-Long-Caption")

הרישיון

המאגר מפורסם תחת רישיון apache-2.0, שמאפשר שימוש מסחרי, שינוי והפצה, בכפוף למתן ייחוס מתאים ושמירה על תנאי הרישיון המקוריים. הרישיון אינו דורש שיתוף תחת אותו רישיון, כך שניתן לאמן עליו מודלים מסחריים וקוד סגור, אם כי תמיד כדאי לוודא שזכויות התמונות המקוריות תואמות לשימוש כזה.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗