GPT
S

SenseNova-Vision-Corpus-50M

קוד פתוח

sensenovacc-by-nc-4.02026-06-30

מאגר ענק לאימון מודלים של ראייה ממוחשבת וגאומטריה רב-תצוגתית. הוא מרכז עשרות מיליוני דוגמאות מפולטרות עם תיוגים עקביים לעומק, סגמנטציה והבנה מבנית.

  • 37,630הורדות בחודש
  • 57לייקים

מה זה

המאגר כולל עשרות מיליוני פריימים שמחולקים לארבע משפחות משימה. יש כאן 18.9 מיליון פריימים להבנה חזותית מובנית, 1.3 מיליון לסגמנטציה, 17.3 מיליון לחיזוי גאומטרי צפוף, ועוד 12.5 מיליון פריימים לגאומטריה רב-תצוגתית. הנתונים עצמם מאורגנים ב־73 שילובים של דאטהסטים ומשימות שמכסים עשרה סוגי משימות שונים.

איסוף המידע התבסס על מקורות פתוחים קיימים שעברו עיבוד מחדש כדי לפתור חוסר אחידות בתיוגים. צוות הפיתוח השתמש בצנרת Rex-Omni לייצור דוגמאות זיהוי ופענוח טקסט, ובכלים כמו MoGe-2 ו־LingBot-Depth כדי להפוך מידע עומק דליל לנתונים גאומטריים צפופים. בסגמנטציה בוצעו בדיקות התאמה קפדניות בין תיאורי האזורים, מקראי הצבעים ומסכות החלוקה בפועל.

מתאים ל

  • אימון מודלי עומק וגאומטריה

    הערכה וחיזוי של עומק צפוף ונורמלים מתוך תמונות בודדות או מספר זוויות צילום במקביל.

  • הבנת מסמכים ו־OCR

    אימון רכיבי ראייה ממוחשבת לזיהוי טקסט, מבנה מרחבי ואובייקטים לפי שיטת Rex-Omni.

  • סגמנטציה מונחית טקסט

    הפרדת אובייקטים ומסכות לפי תיאור שפתי תואם ברמת פיקסל.

איפה זה נופל

התיוגים הטקסטואליים והמטא-דאטה מוגדרים באנגלית בלבד, ואין כאן נתונים ייעודיים בעברית. המאגר נשען כולו על מקורות קיימים ועל הרחבות גאומטריות סינתטיות שנוצרו באמצעות מודלים כמו MoGe-2, מה שעלול לייצר ארטיפקטים או הטיות שמקורן במודלים המייצרים. בנוסף, חובת ההורדה הנפרדת של תמונות המקור מציבה סרבול טכני משמעותי לפני שאפשר להתחיל בכלל באימון.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא. הרישיון הוא CC BY-NC 4.0, מה שאוסר במפורש כל שימוש מסחרי במידע או במודלים שנשענים עליו ישירות.

האם כל התמונות יורדות ישירות מ־Hugging Face?

לא. המאגר מספק בעיקר קובצי תיוג בפורמט JSONL עם נתיבים יחסיים. את תמונות ה־RGB המקוריות צריך להוריד בעצמכם מהמאגרים המקוריים לפי ההנחיות בקובץ הנלווה.

האם המאגר רלוונטי לטקסט או תמונות בעברית?

לא באופן מובנה. השפה המוגדרת במאגר היא אנגלית, וכל התיוגים המילוליים מותאמים לה ללא התייחסות לשפות אחרות.

איך טוענים

המאגר מחולק למעל חמש מאות קבצים דחוסים בפורמט tar.gz לצד קובצי JSONL של תיוגים. נקודה קריטית לעבודה: הקבצים כאן לא כוללים את כל תמונות ה־RGB המקוריות כדי למנוע כפילויות של נכסים פתוחים. קובצי ה־JSONL מחזיקים נתיבים יחסיים בלבד, ואת התמונות עצמן תצטרכו להוריד מהמקורות הרשמיים לפי ההנחיות בקובץ Dataset_download_description.md, תוך סידור מבנה התיקיות המקומי בהתאמה מדויקת.

from datasets import load_dataset

ds = load_dataset("sensenova/SenseNova-Vision-Corpus-50M")

הרישיון

הרישיון הוא cc-by-nc-4.0. המשמעות פשוטה: המאגר מיועד אך ורק למחקר ולשימוש לא מסחרי, וחובה לתת קרדיט ליוצרים. אסור למכור את הדאטהסט או להשתמש בו לאימון מודלים שיוטמעו במוצרים מסחריים מניבי רווח.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗