GPT
S

ShareGPT-4o-Image

קוד פתוח

FreedomIntelligenceapache-2.02025-06-16

  • GPT-4o-Image-Generation

מאגר שמביא פלטים ישירים מיכולות יצירת התמונה של GPT-4o לצורך אימון מודלים פתוחים. הוא נבנה עבור מי שרוצה לשפר מודל מולטימודלי ביצירה ועריכה ויזואלית לפי דוגמאות מוכנות.

  • 15,770הורדות בחודש
  • 102לייקים

מה זה

המאגר כולל 92,256 דוגמאות שנוצרו כולן על ידי יכולות התמונה של GPT-4o. המטרה המוצהרת של היוצרים היא לאמן וליישר מודלים מולטימודליים פתוחים מול הרמה הוויזואלית של המודל הסגור.

התוכן מחולק כמעט שווה בשווה לשני סוגי משימות. החלק הראשון מכיל 45,717 רשומות של יצירת תמונה מטקסט בלבד. החלק השני מכיל 46,539 דוגמאות של יצירת תמונה על בסיס טקסט ותמונה קיימת יחד, מה שמתאים בעיקר למשימות של עריכה והתמרת תמונות לפי הוראות. הכרטיס לא מפרט תהליכי סינון או מקורות לפרומפטים ששימשו להפקה.

מתאים ל

  • אימון text-to-image

    כוונון עדין של מודלי יצירת תמונה על בסיס 45,717 זוגות של תיאור טקסטואלי ותמונה תואמת.

  • עריכת תמונות מונחית טקסט

    אימון יכולות עריכה עם 46,539 דוגמאות שמשלבות תמונת מקור, הוראת שינוי ותוצאה סופית.

  • יישור מודלים מולטימודליים

    לימוד מודלים פתוחים לחקות את איכות הפלט והסגנון הוויזואלי של מודלים סגורים.

איפה זה נופל

השפה המדווחת היא אנגלית בלבד. אין כאן שום ייצוג לעברית או להקשרים מקומיים, לא בפרומפטים ולא בתמונות עצמן, כך שלא תלמדו ממנו שום יכולת שפתית מקומית.

הכרטיס לא מציין כיצד נבחרו הפרומפטים, האם בוצע סינון של תכנים בעייתיים, או מהיכן הגיעו תמונות הקלט במשימות העריכה. בנוסף, מדובר בנתונים שיוצרו במלואם על ידי מכונה, מה שמביא איתו את ההטיות, החזרתיות והעיוותים הוויזואליים של המודל המקורי, לצד שאלת תנאי השימוש החיצוניים של המערכת שיצרה את התמונות.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

המאגר עצמו מופץ תחת רישיון apache-2.0, שמתיר שימוש מסחרי ללא תשלום תמלוגים. עם זאת, כל התמונות הופקו ישירות על ידי מודל של חברה מסחרית אחרת. לפני שמשלבים אותו במוצר עסקי, מומלץ לבדוק אם השימוש בפלטים כאלה אינו מתנגש עם תנאי השימוש החיצוניים של השירות המקורי.

האם הדאטהסט כולל תמיכה בעברית?

לא, המאגר מסומן ככזה שמכיל אנגלית בלבד. הפרומפטים ששימשו ליצירת התמונות וההוראות לעריכה כתובים באנגלית. כדי לאמן מודל שיבין עברית תצטרכו לתרגם את הטקסטים או לשלב מקורות נתונים נוספים.

איך מחלצים את התמונות לשימוש מקומי?

התמונות מגיעות בארכיוני tar מפוצלים לפי משימה. היוצרים מספקים סקריפט bash פשוט של שורה אחת שמריץ לולאה על כל קובצי ה־tar בספרייה ופותח אותם. לאחר החילוץ מקשרים את שמות הקבצים לטקסטים שנמצאים בקובצי ה־json.

מה הגודל של המאגר בדיסק?

הכרטיס לא מפרט את המשקל המדויק בגיגה-בייטים אלא רק מציין שיש 24 קבצים וסך של 92,256 דוגמאות. היות שמדובר בעשרות אלפי תמונות ברזולוציה שנוצרה על ידי מודל מתקדם, יש להיערך לשטח אחסון משמעותי להורדה ולפריקה.

איך טוענים

אין צורך לבקש אישור גישה מיוחד, המאגר פתוח להורדה ישירה מחשבון היוצר. הוא כולל 24 קבצים, כאשר התמונות עצמן ארוזות בתוך ארכיוני tar נפרדים ומחולקים לחלקים, כמו text_and_image_to_image_part_0.tar ודומיו, לצד קובצי מטא-דאטה בפורמט json דוגמת text_and_image_to_image.json.

כדי לעבוד עם המידע צריך להוריד את הארכיונים, לפתוח אותם מקומית עם פקודת חילוץ רגילה של tar, ולחבר בין מזהי התמונות לפרומפטים שמופיעים בקובצי ה־json. המשקל הכולל אינו מצוין בכרטיס, אבל פריסה של עשרות אלפי תמונות דורשת מקום אחסון פנוי וזמן פריקה לפני שמתחילים להזין את הנתונים לצינור האימון.

from datasets import load_dataset

ds = load_dataset("FreedomIntelligence/ShareGPT-4o-Image")

הרישיון

המאגר מפורסם תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי, שינוי והפצה, ומאפשר לאמן מודלים בלי לחייב אתכם לשחרר את הקוד או את המודל החדש באותו הרישיון. התנאי העיקרי הוא שמירה על הודעות זכויות היוצרים והייחוס למחברים המקוריים במסמכי ההפצה שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗