GPT
A

Aesthetic-4K

קוד פתוח

zhang0jhonmit2025-02-16

תמונות ברזולוציה גבוהה במיוחד עם תיאורים שנוצרו במודל GPT-4o. המאגר נבנה כדי לאמן ולהעריך מודלים לגנרציית תמונות חדות בלי להתפשר על איכות הוויזואל.

  • 59,534הורדות בחודש
  • 56לייקים

מה זה

המאגר מכיל קרוב ל־15,000 קבצים שמיועדים ליצירת תמונות ברזולוציית 4K. הנתונים מורכבים מתמונות בפורמטים נפוצים כמו jpeg ו־png לצד תיאורי טקסט מפורטים. לפי התיעוד, הטקסטים לא נאספו מהאינטרנט בצורה עיוורת אלא נוצרו ישירות באמצעות GPT-4o כדי להבטיח התאמה מלאה לתוכן הוויזואלי.

מבנה התיקיות מציג חלוקה להערכה שכוללת תיקיות משנה לפי מידות, כמו גודל 2048. תהליך הסינון המתואר בכרטיס כלל בדיקה ידנית של התמונות, במטרה לפסול מראש קבצים עם טשטוש תנועה, בעיות פוקוס או חוסר התאמה בין הטקסט לתמונה. המקור המקורי שממנו לוקטו התמונות עצמן לפני שלב הסינון הידני אינו מפורט בכרטיס.

מתאים ל

  • אימון מודלי תמונה

    אימון וחידוד של מודלי דיפוזיה לתמונות חדות ברזולוציה גבוהה בעזרת תיאורים מפורטים.

  • הערכת ביצועי מודלים

    בדיקת איכות יצירת תמונות מול סט המבחן המסונן ידנית שנמצא בתיקיות ההערכה.

  • מחקר טקסט לתמונה

    בחינת ההשפעה של כתוביות סינתטיות שנכתבו במודל שפה על דיוק היצירה הוויזואלית.

איפה זה נופל

הכרטיס לא חושף את מקור התמונות המקורי, מה שמקשה לדעת אילו זכויות צד שלישי קיימות בהן. כל התיאורים נכתבו באנגלית בידי מודל שפה, ולכן אין כאן ייצוג לעברית או לשפות אחרות. מעבר לזה, סינון ידני מוריד בעיות טשטוש אבל מחדיר טעם סובייקטיבי של הבודקים לגבי מה נחשב אסתטי, והסתמכות מלאה על GPT-4o מקבעת סגנון תיאור סינתטי ואחיד.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

הרישיון המוצהר הוא MIT, והוא מתיר שימוש מסחרי מלא ללא תמלוגים. עם זאת, היוצרים לא מפרטים מה מקור התמונות המקורי ברשת. אם אתם בונים מוצר מסחרי, כדאי לקחת בחשבון את שאלת זכויות היוצרים בתמונות עצמן.

כמה המאגר שוקל וכמה קבצים יש בו?

המאגר כולל 14,996 קבצים שמכילים תמונות וקבצי תיעוד. המשקל המדויק בגיגה-בייט לא צוין בעמוד, אך מדובר בתמונות ברזולוציית 2048 ומעלה עד 4K. הורדה מלאה תדרוש נפח אחסון פנוי וזמן הורדה משמעותי.

האם יש במאגר תמיכה בעברית?

לא, התיאורים נוצרו כולם באנגלית באמצעות GPT-4o. אם אתם רוצים לאמן מודל שמבין פרומפטים בעברית, תצטרכו לתרגם את התיאורים בעצמכם או להוסיף דאטה חיצוני. המאגר במצבו הנוכחי מתאים לתשתיות באנגלית בלבד.

איך הנתונים נאספו ונבדקו לפי החוקרים?

החוקרים אספו תמונות ברזולוציה גבוהה וייצרו להן תיאורים חדשים בעזרת GPT-4o. לאחר מכן הם ביצעו סינון ידני קפדני של התוצאות. הסינון פסל תמונות שסבלו מטשטוש, בעיות מיקוד או פערים בין התמונה לטקסט.

איך טוענים

טעינת המאגר מתבצעת ישירות מתוך Hugging Face, ואין צורך בהרשאת גישה מיוחדת או בחתימה על טופסי שער. הגישה חופשית לגמרי. מכיוון שמדובר באלפי תמונות ברזולוציה גבוהה שמגיעות עד 4K, נפח האחסון בדיסק והתעבורה יהיו משמעותיים בהורדה מלאה. נתיבי הקבצים מסודרים בתיקיות ייעודיות כמו תיקיית eval ורזולוציות שונות, ולכן שווה להוריד מקומית רק את התיקייה שרלוונטית למשימה שלכם במקום למשוך הכל בבת אחת.

from datasets import load_dataset

ds = load_dataset("zhang0jhon/Aesthetic-4K")

הרישיון

המאגר פורסם תחת רישיון MIT, שמאפשר שימוש מסחרי, שינוי, הפצה ושילוב במודלים כמעט ללא הגבלה, כל עוד שומרים על תנאי הרישיון ומתן הקרדיט. הרישיון הזה מתיר לאמן מודלים לצרכים מסחריים בלי לחייב אתכם לחשוף את הקוד שלכם, אך הוא מתייחס למאגר עצמו ולא בהכרח פוטר מסיכוני זכויות יוצרים בתמונות המקוריות שלא פורטו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗