GPT
S

SenseNova-SI-800K

קוד פתוח

sensenovaapache-2.02025-12-09

מאגר לאימון בינה מרחבית במודלים מולטימודליים, שנועד לחקור חוקי סקיילינג ומשפר ביצועים במשימות ראייה והבנת מרחב בלי צורך בכל מאגר המקור הענק.

  • 4,654הורדות בחודש
  • 22לייקים

מה זה

המאגר מכיל תת מדגם מתוך SenseNova-SI-8M, שמטרתו לספק מענה לחולשה של מודלי ראייה גדולים בהבנה מרחבית. הרשומות בנויות כשיחות מרובות תורות בין משתמש לבינה מלאכותית, תוך התייחסות לתמונה אחת או יותר לאורך הדיאלוג. כל דוגמה מקושרת לנתיבי קבצי תמונה יחסיים שמשולבים בתוך הטקסט בעזרת מצייני מיקום ייעודיים.

המקור מבוסס על טקסונומיה של יכולות מרחביות שנבנתה עבור גרסת שמונת מיליון הדגימות, אך המפרסמים לא מפרטים בכרטיס מהיכן נאספו התמונות בפועל או באילו כלים הן סוננו. הדאטהסט הנוכחי כולל קובץ מדגם מוקטן של 1,000 רשומות לצד הקובץ המלא, ומכוון בעיקר לחוקרים שרוצים לבדוק התנהגות מודל בקנה מידה בינוני.

מתאים ל

  • אימון הבנה מרחבית

    כיוונון עדין של מודלי ראייה שפה לשיפור היכולת לענות על שאלות שמערבות יחסי מיקום ומרחב.

  • מחקר חוקי סקיילינג

    בדיקת התנהגות מודלים ושיפורי ביצועים תחת כמות דאטה מוגדרת לפני מעבר למאגרי ענק.

  • הערכת הנמקה מולטימודלית

    בחינת יכולות הסקת מסקנות מרחבית בשיחות מרובות תורות על גבי רצף תמונות.

איפה זה נופל

כל הטקסט במאגר באנגלית בלבד, ואין שום תמיכה בעברית. הכרטיס מזהיר במפורש מסכנות של התאמת יתר וקיצורי דרך שפתיים שהמודלים לוקחים במקום הבנה מרחבית אמיתית. בנוסף, חסר מידע קריטי על מקור התמונות, זכויות היוצרים שלהן, וההטיות שקיימות בתוך סט הנתונים, ולכן לא הייתי מכניס אותו למערכת מבצעית בלי בדיקה של התמונות בפועל.

אותה משפחה

SenseNova-SI יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המאגר מתאים לשימוש מסחרי?

כן, הרישיון המדווח הוא apache-2.0 שמתיר שימוש מסחרי מלא. עם זאת, מכיוון שמקור התמונות לא מפורט, כדאי לוודא שאין סיכון זכויות יוצרים בחומרים עצמם.

כמה מקום צריך בשביל להוריד אותו?

הטקסט עצמו קל וזמין בפרקט או JSONL, אבל התמונות מחולקות ל־93 קובצי זיפ שכל אחד מהם שוקל כ־4 גיגה בייט. תצטרכו להכין קרוב ל־400 גיגה בייט רק עבור קובצי הארכיון, ועוד מקום נוסף לפריסה המלאה שלהם.

האם יש בו תמיכה בעברית?

לא. המאגר מוגדר ומכיל טקסט באנגלית בלבד, וכל השיחות והשאלות בנויות בשפה זו. כדי להשתמש בו במערכות מקומיות תצטרכו לתרגם את השיחות או להסתמך על יכולת התרגום של מודל הבסיס.

מה ההבדל בינו לבין SenseNova-SI-8M?

מדובר באותה משפחת נתונים, אך גרסת ה־800K היא תת קבוצה מוקטנת שנועדה למחקר חוקי סקיילינג ולאימונים ממוקדים. הגרסה המלאה גדולה פי עשרה ומכילה כ־8.16 מיליון דגימות המבוססות על כ־2.72 מיליון תמונות שונות.

איך טוענים

הנתונים הטקסטואליים מגיעים בקובצי JSONL ופרקט, עם שדות מזהה, שיחות ונתיבי תמונות. התמונות עצמן לא מגיעות מוטמעות אלא מפוצלות ל־93 קובצי ארכיון עצמאיים בגודל של כ־4 גיגה בייט כל אחד, כך שנדרשים מאות גיגה בייטים פנויים בדיסק. המאגר פתוח להורדה ישירה ללא טופס אישור, ויש סקריפטים מוכנים לחילוץ הארכיונים עבור לינוקס וחלונות שמסדרים את מבנה התיקיות הדרוש לטעינה.

from datasets import load_dataset

ds = load_dataset("sensenova/SenseNova-SI-800K")

הרישיון

המאגר מופץ תחת רישיון apache-2.0, שמאפשר שימוש מסחרי, שינוי והפצה של הנתונים, כולל אימון מודלים ללא חובת שיתוף באותו רישיון. נדרש רק לתת ייחוס מתאים למפרסמים ולצרף עותק של תנאי הרישיון והודעות זכויות היוצרים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗