GPT
M

MMSVG-Illustration

קוד פתוח

OmniSVGcc-by-nc-sa-4.02025-04-08

מאגר איורי וקטור שמיועד לאימון מודלים של טקסט לתמונה או תמונה לווקטור. הוא מציע שילוב מוכן של קוד SVG מפושט לצד תמונות תצוגה מקדימה וכמה רמות של תיאורי טקסט.

  • 1,213הורדות בחודש
  • 66לייקים

מה זה

המאגר כולל 255,412 דוגמאות של איורים וקטוריים שעברו עיבוד ופישוט. כל רשומה מכילה קוד SVG ששונה לגודל של 200 על 200 ועבר פישוט באמצעות ספריית picosvg, לצד תצוגה מקדימה בפורמט PNG בגודל של 448 על 448 פיקסלים. מעבר לקבצים הגרפיים, כל פריט כולל מזהה ייחודי, ספירת טוקנים לפי הטוקנייזר של OmniSVG, ושלוש שכבות של טקסט: תיאור קצר, מילות מפתח ותיאור מפורט.

היוצרים לא מפרטים בכרטיס מה מקור האיורים ברשת או איך בדיוק נאספו. הם כן מציינים שבגרסה השנייה הם הסירו כפילויות על בסיס MD5, הגדילו את כמות הנתונים מ־65,751 פריטים להיקף הנוכחי, הוסיפו תצוגות מקדימות ורינדרו את כל הווקטורים לגדלים אחידים כדי שיתאימו להזנה ישירה למודלים רב-מודאליים.

מתאים ל

  • אימון text-to-SVG

    יצירת קוד SVG מפושט ישירות מתיאורי טקסט קצרים או מפורטים ללא צורך בהמרת פיקסלים.

  • אימון image-to-SVG

    מיפוי תמונות PNG בגודל 448 על 448 ישירות לייצוג הווקטורי המקביל שלהן.

  • הערכת מודלים רב-מודאליים

    בדיקת ביצועים של מודלי שפה ותמונה ביצירת גרפיקה וקטורית אחידה ונקייה מכפילויות.

איפה זה נופל

בכרטיס אין שום תיעוד לגבי המקור של האיורים, זכויות היוצרים המקוריות שלהם, או הטיות בתוכן. הפישוט של ה־SVG דרך picosvg וההגבלה הנוקשה לגודל 200 על 200 מקצצים אלמנטים מורכבים ועלולים לא להתאים למי שבונה גרפיקה וקטורית עשירה לתעשייה. בנוסף, כל התיאורים כתובים באנגלית בלבד, כך שאין כאן תמיכה בעברית או בשפות אחרות, וההסתמכות היא כולה על איורים בסגנון illustration בלבד ולא על גרפיקה טכנית או סמלים מגוונים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא, הרישיון הוא cc-by-nc-sa-4.0 שמונע כל שימוש מסחרי. המאגר מיועד למחקר ולניסויים בלבד. אם תאמנו עליו מודל כדי למכור גישה אליו, אתם מפרים את תנאי הרישיון.

האם יש במאגר תמיכה בעברית?

לא, כל שדות הטקסט כולל התיאורים ומילות המפתח נכתבו באנגלית. אם המטרה שלכם היא מודל שמבין פרומפטים בעברית, תצטרכו לתרגם את השדות או לאמן מודל ביניים. גם הטוקנייזר המובנה חושב עבור אנגלית.

מאיפה הגיעו האיורים המקוריים?

המפתחים לא ציינו את מקור הנתונים או מאיזה אתרים הם נאספו. הכרטיס מפרט רק את שלבי העיבוד הטכניים, כמו הסרת כפילויות ושינוי גודל. אין מידע על היוצרים המקוריים של האיורים עצמם.

מה עשו לקוד ה־SVG לפני שהכניסו אותו למאגר?

כל קובצי הווקטור עברו כיווץ ופישוט קוד בעזרת הכלי picosvg כדי לשמור על מבנה אחיד. בנוסף, כל האיורים שונו לרזולוציה אחידה של 200 על 200 פיקסלים. השינוי הזה הופך את הקוד לקל יותר ללמידה אך מוחק מאפיינים וקטוריים מתקדמים.

איך טוענים

הנתונים מחולקים ל־27 קובצי parquet תחת תיקיית data, בתוספת קובץ json של המאגר. אין כאן תהליך אישור גישה או שער כלשהו, פשוט מושכים את הקבצים ישירות דרך הספרייה של Hugging Face או מורידים את ה־parquet לעבודה מקומית. השדות המרכזיים שתרצו לבדוק מיד הם svg שמחזיק את הקוד הגולמי, image שמספק את הפיקסלים בגודל 448 על 448, והשדות description ו־detail להזנת הפרומפטים. שימו לב שהשדה token len מחושב ספציפית לטוקנייזר של המפתחים, כך שאם אתם עובדים עם ארכיטקטורה אחרת תצטרכו לחשב את האורכים בעצמכם.

from datasets import load_dataset

ds = load_dataset("OmniSVG/MMSVG-Illustration")

הרישיון

המאגר מופץ תחת רישיון cc-by-nc-sa-4.0. זה אומר שאסור להשתמש בנתונים למטרות מסחריות כלל. בנוסף, חובה לתת קרדיט ליוצרים, ואם אתם משנים, מעבדים או בונים נגזרת של המאגר, עליכם להפיץ את התוצאה תחת אותו רישיון בדיוק. אימון מודל על המאגר הזה כובל אתכם למחקר בלבד ומונע שימוש מסחרי בתוצרים.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗