GPT
F

FineVisionMax

קוד פתוח

HuggingFaceM4רישיון לא דווח2025-09-25

  • agent
  • vision

מאגר ענק של משימות תמונה וטקסט שנועד לאימון מודלי ראייה מתקדמים. הוא מרכז עשרות מיליוני דוגמאות בפורמט מעורבב שמתאים להזרמה ישירה בלי להוריד הכל מראש.

  • 87,130הורדות בחודש
  • 33לייקים

מה זה

המאגר מאחד אוסף של דאטהסטים ציבוריים שחוברו יחד ועורבבו מראש כדי להקל על הזרמת מידע ברשת. הוא כולל 24.3 מיליון דוגמאות, 17.3 מיליון תמונות, 88.9 מיליון תורות שיחה וכמעט עשרה מיליארד טוקנים של תשובות. הנתונים בנויים סביב משימות של תמונה וטקסט לטקסט, וכוללים שיחות רב שלביות שמיועדות לאימון סוכנים ומודלי ראייה שפה.

בגרסה הזו כל הקונפיגורציות של הדאטהסט המקורי שורשרו לקובץ נתונים אחד ומבוזר. במקום לחלק את המידע לפי מקורות נפרדים, הרשומות עברו ערבוב מלא. המבנה מיועד לעבודה שוטפת מול השרתים של Hugging Face בלי לנהל כל תת מאגר בנפרד, כשבפועל התוכן נשען על מקורות חיצוניים שונים שנאספו יחד.

מתאים ל

  • אימון מודלי ראייה

    אימון מודלי שפה רב מודליים על עשרות מיליוני שיחות ותמונות.

  • בניית סוכנים מבוססי תמונה

    פיתוח סוכנים שצריכים להבין הקשר חזותי ולנהל שיחה בכמה שלבים.

  • אימון בהזרמה רציפה

    אימון ישיר מהרשת בלי להוריד עשרות מיליוני קבצים לאחסון מקומי.

איפה זה נופל

הטקסטים במאגר מוגבלים לאנגלית ולסינית בלבד, כך שאין כאן שום ייצוג לעברית או לשפות אחרות. מעבר לזה, המאגר הוא איחוד של דאטהסטים קיימים, והכרטיס לא מפרט אילו סינונים או בקרות איכות הופעלו על התמונות והטקסטים. שרשור וערבוב כל המקורות יחד מקשים מאוד לבודד הטיות, תכנים בעייתיים או כפילויות שמגיעים מחלק מהתת מאגרים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

אין לזה תשובה אחת פשוטה. היוצרים שחררו רק את הפרומפטים שלהם ברישיון CC-BY-4.0, אך המאגר מורכב מדאטהסטים שונים שלכל אחד מהם רישיון משלו. אם אתם מתכננים מוצר מסחרי, תצטרכו לעבור על המקורות ולבדוק את תנאי השימוש של כל רכיב.

האם יש במאגר תמיכה בעברית?

לא. הדאטהסט כולל אך ורק אנגלית וסינית לפי התיעוד הרשמי. מי שרוצה לאמן מודל שיבין עברית וינתח תמונות יצטרך להוסיף נתונים ממקורות אחרים.

כמה נפח דרוש כדי לעבוד עם הנתונים?

המאגר כולל מעל 10,000 קובצי parquet, 17.3 מיליון תמונות ומיליארדי טוקנים. במקום להוריד את כל הנפח הזה לכונן, ההמלצה הרשמית היא לטעון אותו ישירות במצב הזרמה streaming מול השרת.

במה הגרסה הזו שונה מהדאטהסט המקורי של FineVision?

בגרסה הזו חיברו את כל התת מאגרים יחד וערבבו את הרשומות מראש. המטרה של השינוי הזה היא לאפשר הזרמה חלקה של דוגמאות מגוונות ישר מתוך Hub בלי צורך לבחור ולטעון תתי סטים בנפרד.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets באמצעות פקודת load_dataset עם הדגל streaming=True. בגלל שמדובר ביותר מעשרת אלפים קובצי parquet והיקף של עשרות מיליוני רשומות, לא כדאי לנסות להוריד את כולו לדיסק מקומי בלי נפח אחסון מסיבי. אין צורך בבקשת אישור גישה מיוחדת, וההזרמה מאפשרת להתחיל לדגום ולעבד את התורות והתמונות מיד.

from datasets import load_dataset

ds = load_dataset("HuggingFaceM4/FineVisionMax")

הרישיון

המאגר עצמו אינו כולל רישיון כולל אחיד. היוצרים מציינים שהפרומפטים שלהם מפורסמים תחת רישיון CC-BY-4.0, אבל כל תת מאגר שמרכיב את האוסף כפוף לתנאי הרישיון המקוריים שלו. לפני שימוש מסחרי או שחרור מודל שאומן עליו, חובה לבדוק בנפרד את הרישיונות של כל מקור ומקור כדי לא להפר זכויות יוצרים.

הרישיון המלא ב־Hugging Face ↗