GPT
F

FineVision

קוד פתוח

HuggingFaceM4רישיון לא דווח2025-07-28

אפשר גם להריץ אותו בדפדפן בלי להתקין דבר.

המאגר מרכז עשרות תתי-מאגרים של שיחות מולטימודליות על תמונות, עם דירוגי איכות מספריים לכל דוגמה. הוא מתאים למי שרוצה לאמן מודלי ראייה-שפה בלי לסנן ידנית זבל ויזואלי.

  • 248,157הורדות בחודש
  • 516לייקים

מה זה

המאגר כולל בין 10 ל־100 מיליון רשומות המחולקות לפי עשרות תצורות שונות. כל רשומה בנויה מתמונות, היסטוריית שיחה בין משתמש לעוזר, מקור הדאטה, ומספר ציוני איכות שנשמרו כמספרים שלמים. הציונים האלה בודקים התאמה בין הטקסט לתמונה, תלות ויזואלית, רלוונטיות, ועיצוב התשובה, כולל ערכי מינימום לכל מדד.

התצורות מגוונות ומגיעות ממקורות ידועים בעולם המולטימודלי. יש כאן חלוקה לנושאים טכניים מסדרת CoSyn כמו מעגלים אלקטרוניים, נוסחאות כימיות, דיאגרמות ותרשימים, לצד דאטהסטים רחבים יותר כמו DoclingMatix שכולל מעל 1.2 מיליון דוגמאות, LLaVA Instruct, וסדרות סינתטיות לקוד ותרשימים. חלק מהתצורות מוקדש למשימות ספציפיות כמו פענוח קפצ'ה או שאלות על מאמרים מדעיים.

מתאים ל

  • אימון מודלי שיחה על תמונות

    לימוד מודלים רב-תחומיים לענות על שאלות מורכבות סביב תרשימים, מסמכים ותמונות כלליות.

  • סינון דאטה מולטימודלי

    שימוש בדירוגי האיכות הקיימים ברשומות כדי לחתוך דוגמאות באיכות נמוכה ממאגרי אימון.

  • הבנת מסמכים וגרפים

    כוונון ייעודי למשימות פענוח ותרגום ויזואלי של טבלאות, דיאגרמות וגרפים מורכבים.

איפה זה נופל

הכרטיס לא מציין תמיכה בעברית, ורובו המוחלט של התוכן באנגלית או מקורות ייעודיים כמו ממים בסינית. נוסף על כך, אין מידע על אופן הפקת הציונים המספריים או המודלים ששימשו להערכה, כך שאי אפשר להסתמך עליהם בעיניים עצומות. חלק מהתצורות סינתטיות לחלוטין כמו קוד ותרשימים שנוצרו במחשב, מה שעלול לייצר הזיות מובנות או תבניות קשיחות מדי באימון.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא מומלץ בכלל. המאגר פורסם ללא רישיון מוגדר, מה שאומר שאין לכם היתר חוקי להשתמש בו, לחלקו או להפיץ מודל שאומן עליו.

כמה המאגר שוקל בפועל?

המשקל הכולל מגיע למאות ג'יגה-בייט ואפילו לטרה-בייטים במצטבר. תצורה אחת כמו DoclingMatix שוקלת לבדה כ־950 ג'יגה-בייט להורדה, לצד תצורות קטנות יותר של מאות מגה-בייט.

האם יש במאגר נתונים בעברית?

אין שום אזכור לעברית בחומר המאגר. רוב התוכן מבוסס על אנגלית ותצורות ספציפיות אחרות כמו סינית, כך שהוא לא מתאים לאימון ישיר על שפה מקומית.

איך מחליטים אילו דוגמאות לקחת מתוך התצורות?

בכל רשומה יש עמודות דירוג לאיכות העיצוב, התלות בתמונה והרלוונטיות, כולל עמודות של ערכי מינימום. מומלץ לסנן את הנתונים לפי הספים האלה לפני שמתחילים באימון.

איך טוענים

הנתונים שמורים בקובצי parquet בתוך 9,501 קבצים במאגר. בגלל המשקל הכולל העצום של מאות ג'יגה-בייט וריבוי התצורות, אל תנסו למשוך את כל המאגר בבת אחת. טוענים תצורה ספציפית דרך הספרייה הרגילה של Hugging Face תוך ציון השם המדויק שלה. השדות המרכזיים שתרצו לבדוק בשליפה הם שרשור השיחה, התמונות, ועמודי הדירוג שיעזרו לכם לחתוך דוגמאות חלשות.

from datasets import load_dataset

ds = load_dataset("HuggingFaceM4/FineVision")

הרישיון

היוצרים לא הגדירו רישיון בכרטיס המאגר. מבחינה משפטית, היעדר רישיון אומר שכל הזכויות שמורות ואין הרשאה מפורשת להשתמש בדאטה, לא למחקר ובוודאי לא למטרות מסחריות. אם תאמנו מודל מסחרי על הנתונים האלה, אתם לוקחים סיכון משפטי מלא.

הרישיון המלא ב־Hugging Face ↗