GPT
4

4KLSDB

קוד פתוח

SingleBicyclecc-by-4.02025-05-16

  • 4K
  • super-resolution
  • text-to-image
  • diffusion
  • restoration

מאגר של מעל 130 אלף תמונות ברזולוציית 4K מקורית, שמיועד לשחזור תמונה ומודלי טקסט לתמונה. הוא כולל תמונות ברזולוציה גבוהה, גרסאות מונמכות ומודלים מאומנים.

  • 57,818הורדות בחודש
  • 15לייקים

מה זה

המאגר מחולק לשלושה חלקים ברורים: 129,484 תמונות לאימון, 2,000 תמונות לולידציה ו־1,984 תמונות למבחן. התוכן מכסה מגוון נושאים רחב שכולל טבע, נוף עירוני, אנשים, אוכל, יצירות אמנות, הדמיות מחשב, חיות וארכיטקטורה. הקבצים נשמרים כרסיסי Parquet שמכילים את התמונות המקוריות, גרסאות ברזולוציה נמוכה בהגדלות של פי 4, פי 8 ופי 16, ותיאורים טקסטואליים.

נקודה חשובה לגבי התיאורים: המאגר כולל שני סוגי טקסט. בתוך קובצי ה־Parquet תמצאו את התיאורים הקצרים המקוריים בסגנון LAION או CogVLM. לעומת זאת, קובץ metadata.jsonl מרכז תיאורים מפורטים וארוכים יותר שנוצרו על ידי Qwen2.5-VL-7B-Instruct ומותאמים במיוחד לאימון של מודלי יצירת תמונה. בנוסף, המאגר מציע משקלי מודלים מוכנים כמו HiT-SR, SwinIR, MambaIR, OSEDiff ו־Sana.

מתאים ל

  • אימון מודלי סופר-רזולוציה

    שחזור והגדלת תמונות מורכבות לפי 4, 8 או 16 באמצעות זוגות התמונות המוכנים.

  • יצירת תמונות מבוססת טקסט

    פיין-טיונינג למודלי טקסט לתמונה ברזולוציה מלאה של 4K בעזרת תיאורי Qwen.

  • הערכת איכות שחזור תמונה

    בדיקת ביצועים השוואתית של מודלים קיימים מול סט המבחן שמכיל כמעט 2,000 תמונות.

איפה זה נופל

כל התיאורים במאגר נכתבו באנגלית בלבד, ואין בו שום תוכן או תיוג בעברית. התיאורים המעודכנים נוצרו כולם על ידי מודל שפה ויזואלי ולא בידי בני אדם, מה שעלול לייצר הזיות או עיוותים בפרטים קטנים. הכרטיס לא מפרט מאיפה התמונות נאספו ברשת, איך נוהל סינון התכנים, או האם יש ייצוג הוגן לקבוצות אוכלוסייה שונות.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, רישיון cc-by-4.0 מתיר שימוש מסחרי מלא. התנאי היחיד הוא לתת ייחוס מתאים לחוקרים שפרסמו אותו. עם זאת, מכיוון שמקור התמונות ברשת אינו מפורט, כדאי לבדוק סיכוני זכויות יוצרים על התמונות עצמן.

האם הדאטהסט כולל תמיכה בעברית?

לא. כל התיאורים והמטא-דאטה קיימים באנגלית בלבד. אם אתם רוצים לאמן מודל שיבין פרומפטים בעברית, תצטרכו לתרגם את התיאורים באופן עצמאי.

מה ההבדל בין התיאורים בקובצי ה־Parquet ל־metadata.jsonl?

קובצי ה־Parquet שומרים את התיאורים הישנים והקצרים בסגנון LAION ו־CogVLM. קובץ ה־jsonl מכיל תיאורי סצנה מפורטים וארוכים בהרבה שנוצרו על ידי Qwen2.5-VL-7B-Instruct, והוא המקור המומלץ למשימות יצירת תמונה.

האם חייבים להוריד את כל 660 הקבצים כדי להשתמש במודל?

ממש לא. המאגר מציע משקלי מודלים מוכנים בתיקיית ckpts וניתן להוריד אותם ישירות באמצעות snapshot_download עם סינון נתיב. אין צורך להוריד את עשרות אלפי תמונות האימון אם המטרה היא רק להריץ מודל קיים.

איך טוענים

הגישה פתוחה ואין צורך באישור מיוחד. הנתונים מאוחסנים ב־660 קבצים בפורמט Parquet יחד עם קובצי מטא-דאטה נפרדים. אפשר למשוך ישירות את metadata.jsonl באמצעות huggingface_hub כדי לקבל את התיאורים העדכניים, או להוריד משקלים ספציפיים מתיקיית ckpts בלי למשוך את כל המאגר. אם אתם מאמנים מודלי טקסט לתמונה, אל תסתמכו על עמודת התיאור ב־Parquet אלא חברו את התמונות לתיאורים מתוך קובץ ה־jsonl.

from datasets import load_dataset

ds = load_dataset("SingleBicycle/4KLSDB")

הרישיון

הרישיון המדווח הוא cc-by-4.0. המשמעות היא שמותר להשתמש במאגר לצרכים מסחריים ומחקריים, לשנות אותו ולשלב אותו במוצרים. החובה המרכזית היא מתן קרדיט ברור ליוצרים. אין כאן דרישה לשתף תוצרי אימון באותו הרישיון, אך יש לוודא שהשימוש בתמונות המקור עצמן עומד בכללי זכויות היוצרים שלהן.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗