GPT
G

gaming-500-hours

קוד פתוח

markov-aiרישיון לא דווח2026-06-30

המאגר מרכז קרוב ל־500 שעות של הקלטות וידאו מסשנים של משחקי מחשב לצד תיעוד קלט מסונכרן ברמת הפריים. הוא פונה למי שמפתח סוכנים או מודלי ראייה שצריכים ללמוד פעולות שחקן מתוך מסך נקי.

  • 9,499הורדות בחודש
  • 254לייקים

מה זה

הנתונים מחולקים לפי 168 כותרים שונים ומכילים 776 סשנים של משחק בפועל. החומר עבר חיתוך ידני או אוטומטי שהסיר מסכי כניסה, שולחן עבודה ושידורים חיים, אך השאיר תפריטים, זמני טעינה וסרטוני מעבר ששייכים לזרימת המשחק הרגילה. כמעט כל התוכן הוקלט על גבי מערכת חלונות, עם נתח שולי בלבד של שעות ספורות ממק.

המבנה הפנימי מסודר בתיקיות לפי מזהה משחק ומזהה סשן. בכל תיקייה תמצאו קובץ וידאו בפורמט MP4 בקצב קבוע של 30 פריימים לשנייה, קובץ מטא-דאטה כללי, ושני קובצי אירועים בפורמט NDJSON שמצליבים את לחיצות השחקן והאירועים בחלון ביחס לציר הזמן של הסרטון וברמת הפריים הבודד.

מתאים ל

  • אימון סוכני משחק מבוססי ראייה

    לימוד חיקוי של פעולות מקלדת ועכבר ישירות מתוך תמונת המסך באמצעות קובצי האירועים המסונכרנים.

  • זיהוי אלמנטים בממשקי משתמש

    אימון מודלי זיהוי תמונה על תפריטים, זמני טעינה ומסכי בחירה שנשמרו ברצף הווידאו.

  • חיזוי פעולות שחקן בזמן אמת

    בניית מודלים שמנבאים את הצעד הבא על בסיס רצף פריימים קודם בפורמט CFR אחיד.

איפה זה נופל

ההטיה המרכזית בולטת בחלוקת הזמנים. המשחק Valorant לבדו תופס מעל 20% מכלל השעות במאגר, ויחד עם מיינקראפט ו־GTA V הם מהווים נתח עצום מכלל המידע. אם המטרה שלכם היא מודל שמכליל היטב למגוון סוגות, תצטרכו לדגום את המידע בצורה מבוקרת ולא להסתמך על החלוקה המקורית. בנוסף, אין במאגר תיעוד לשפות הממשק או השמע, כך שאי אפשר להסתמך עליו למשימות טקסט או הבנת שפה במשחקים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא מומלץ. לא פורסם רישיון לנתונים, מה שאומר שאין הרשאת שימוש רשמית, ובנוסף מדובר בקטעי וידאו מתוך משחקים מסחריים מוגנים בזכויות יוצרים.

כמה שטח אחסון נדרש כדי להוריד את כל המאגר?

הנתון המדויק בגיגה-בייטים לא פורסם, אך מדובר ב־3,108 קבצים שכוללים קרוב ל־500 שעות של וידאו באיכות 30fps. זה ידרוש מאות גיגה-בייטים של נפח אחסון מקומי.

האם המאגר כולל עברית?

הכרטיס לא מציין שפות ממשק, שמע או כתוביות. רוב המשחקים שם בינלאומיים ופועלים באנגלית כברירת מחדל, כך שלא כדאי לבנות על נוכחות של עברית.

איך סונכרנו הלחיצות של השחקן לסרטוני הווידאו?

הנתונים עברו עיבוד מחדש שמתאים את אירועי המקלדת והעכבר לציר הזמן של הסרטון. המידע זמין בקובצי frame_events שמשייכים את הקלט ישירות לכל פריים.

איך טוענים

אין צורך בהרשאה מיוחדת כדי לגשת לקבצים, אך מדובר באלפי פריטים כבדים שמצטברים למאות שעות וידאו מקודד H.264. עבודה ישירה מול הסטרימינג תהיה איטית מאוד, ולכן מומלץ להוריד רק את התיקיות של המשחקים הרלוונטיים עבורכם. הקישור בין הווידאו לפעולות נעשה ישירות דרך קובצי frame_events.json שממפים כל פריים לפעולת הקלט שהתרחשה בו.

from datasets import load_dataset

ds = load_dataset("markov-ai/gaming-500-hours")

הרישיון

היוצרים לא ציינו רישיון שימוש במאגר. מבחינה משפטית, היעדר רישיון אומר שזכויות היוצרים שמורות להם במלואן ואין אישור מפורש לשימוש מסחרי, הפצה מחדש או אימון מודלים. בנוסף, הווידאו מציג קניינים רוחניים של עשרות חברות משחקים מסחריות, מה שמציב סיכון משפטי ברור למי שמתכנן להוציא מזה מוצר.

הרישיון המלא ב־Hugging Face ↗