GPT
V

visgym_data

קוד פתוח

VisGymapache-2.02026-01-05

  • agent
  • vision-language-models
  • reinforcement-learning
  • vlm
  • multimodal

מסלולי אינטראקציה ויזואליים מבוססי משימות מתמשכות עבור מודלי שפה ותמונה. המאגר מציע סביבות מגוונות שבהן המודל חייב להגיב על בסיס היסטוריית פעולות ותצפיות.

  • 14,482הורדות בחודש
  • 17לייקים

מה זה

המאגר מכיל מיליוני רשומות המייצגות רצפי פעולות ותצפיות אינטראקטיביות שנאספו ישירות מתוך שבע עשרה סביבות שונות של VisGym. הרעיון הוא לספק משימות מולטימודליות ארוכות טווח שבהן סוכן חזותי בוחר צעדים בהתאם למה שהוא עשה וראה קודם לכן, ולא רק מתאר תמונה בודדת. המבנה בפועל מחולק לתיקיות ייעודיות לכל משימה, כמו משימת צביעה שנמצאת במאגר, ובתוכן קבצי אימון שנשמרים במנות.

הנתונים מגיעים כרצפי אינטראקציה בקובצי jsonl יחד עם תיקיות נכסים חזותיים ומטא דאטה נלווים. לא מדובר בסריקה אקראית של הרשת אלא בסימולציות מוגדרות מראש שנועדו לבחון יכולת קבלת החלטות. כל סביבה נבנתה עם דרגות קושי משתנות והגדרות ויזואליות שונות שניתן להרחיב, במטרה לאפשר אימון והערכה של סוכנים אוטונומיים בתרחישים מורכבים.

מתאים ל

  • אימון סוכנים ויזואליים

    אימון מודלי תמונה ושפה לפעול ברצף של החלטות מול סביבה משתנה ולא רק להשיב על תמונות סטטיות.

  • מבחני ביצוע למודלים

    הערכה שיטתית של היכולת לזכור היסטוריית פעולות ותצפיות חזותיות במשימות הדורשות תכנון ארוך טווח.

  • למידת חיזוק רב-מודלית

    שימוש במסלולים המוכנים כבסיס לאימון מדיניות פעולה של סוכנים בסביבות מוגדרות וברות התאמה.

איפה זה נופל

הטקסט כולו באנגלית בלבד, ואין כאן שום ייצוג לעברית. בנוסף, מדובר בנתונים שנוצרו בסביבות מבוקרות ומלאכותיות של סימולטור, ולא באינטראקציות אמיתיות מהעולם הפיזי או ממשתמשים אנושיים. מי שמחפש לפתור בעיות ויזואליות בעולם האמיתי יצטרך לבדוק פער משמעותי בין משימות הסביבה הסינתטית לבין המציאות, במיוחד כשרוצים לשלב תוצרים במערכות ייצור.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, הרישיון הוא Apache 2.0 והוא מאפשר שימוש מסחרי מלא. צריך לוודא שאתם משאירים את הצהרת הרישיון וזכויות היוצרים של המפתחים המקוריים.

האם המאגר כולל עברית?

לא, כל המטא דאטה וההנחיות במאגר מופיעים באנגלית בלבד. אם המודל שלכם מיועד לעבוד בעברית, תצטרכו לתרגם את הרצפים או להתאים אותם עצמאית.

איך מורידים את כל הנתונים למחשב?

היוצרים ממליצים להשתמש בפקודת huggingface-cli דרך שורת הפקודה כדי למשוך את תיקיות הנכסים והמטא דאטה ישירות לתיקייה מקומית. שימו לב שיש במאגר מעל עשרים ושישה אלף קבצים.

מאיפה הנתונים האלה הגיעו?

הם הופקו מתוך שבע עשרה סביבות אינטראקטיביות שפותחו בפרויקט VisGym. הנתונים אינם סריקה של דפי אינטרנט אלא תוצאה של סימולציות משימה מובנות.

איך טוענים

אין צורך באישור גישה מיוחד כדי להוריד את הקבצים. במקום טעינה ישירה של שורה בודדת דרך הקוד, היוצרים מכוונים להורדה מקומית מלאה בעזרת huggingface-cli ישירות לתיקייה אצלכם, שמושכת פנימה את תיקיות ה־assets וה־metadata. המאגר כולל מעל עשרים ושישה אלף קבצים, ביניהם קובצי jsonl רבים המחולקים לפי מנות ומשימות, כך שמומלץ להיערך מראש עם נפח אחסון פנוי ותהליך קריאה מסודר למנות הקבצים.

from datasets import load_dataset

ds = load_dataset("VisGym/visgym_data")

הרישיון

המאגר מופץ תחת רישיון Apache 2.0. הרישיון הזה מתיר שימוש מסחרי חופשי, שינוי, הפצה ושילוב במחקר או במוצרים, בתנאי ששומרים על הודעת זכויות היוצרים והרישיון המקורי. הוא אינו כופה עליכם לשחרר מודלים שאומנו עליו תחת אותו רישיון בדיוק.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗