GPT
O

opencs2_dataset

קוד פתוח

blanchoncc-by-4.02026-05-08

  • opencs2
  • counter-strike-2
  • torchcodec
  • video
  • audio

אלפי שעות וידאו מסונכרנות מנקודת מבט של שחקני Counter-Strike 2, יחד עם קלט מקלדת, עכבר ומצב המשחק בכל טיק. נכס נדיר למי שמאמן סוכנים או מודלים רב-מודאליים על וידאו ופעולות בעולם תלת-ממדי.

  • 14,102הורדות בחודש
  • 35לייקים

מה זה

המאגר מכיל 165,270 סיבובי משחק מנקודת מבט אישית, שמצטברים ל־2974.2 שעות וידאו POV ו־528 שעות ציר זמן מסונכרן. הנתונים מגיעים מ־794 מפות ומשחקים מקצועיים שנלקחו כקובצי דמו של HLTV, ורונדרו מחדש באמצעות מקליט CS2 ללא ממשק גרפי. בכל סיבוב מתועדות עשר נקודות המבט של כל השחקנים בו-זמנית.

כל רשומת POV כוללת וידאו H.264 ברזולוציה של 1280x720 בקצב של 32 פריימים לשנייה, אודיו סטריאו מותאם למיקום השחקן, וקובץ Parquet מקומי שמפרט את כל הטיקים. בטיקים נרשמים קלטי מקלדת, תזוזות עכבר, זוויות מבט, חיים, שריון, מיקום תלת-ממדי, מהירות ונשק פעיל.

המבנה מחולק לתיקיות מדיה של סיבובים לפי מזהה משחק, מפה, סיבוב ושחקן, לצד אינדקסים מרכזיים בפורמט Parquet. האינדקסים כוללים טבלאות ייעודיות לסיבובים, משחקים, הריגות, קרבות יחיד מול יחיד, וחלונות סטטיסטיים מחושבים מראש לסינון קטעים.

מתאים ל

  • אימון סוכני RL במשחקי יריות

    למידת חיקוי וחיזוק מקלטי מקלדת, תנועת עכבר ומצבי שחקן מסונכרנים לווידאו מלא.

  • חילוץ רגעי שיא ואירועים

    זיהוי אוטומטי וסיווג של אירועי משחק מורכבים כמו צליפות 1 על 1 או הריגות מבעד לעשן.

  • מחקר חיזוי תנועה בווידאו

    אימון מודלי חיזוי פריים עוקב בעזרת צמדי תמונות ווקטורי מהירות ומיקום מדויקים.

איפה זה נופל

ההטיה המרכזית היא אופי הנתונים, מדובר במשחקים תחרותיים בלבד מתוך HLTV, כך שהתנהגות השחקנים משקפת רמה מקצועית ולא משחק חובבני ממוצע. בנוסף, קצב הווידאו הוא 32 פריימים לשנייה בעוד שקובצי הדמו המקוריים רצים ב־64 הרץ, כך שכל פריים וידאו מקביל לרוב לשני טיקים של נתוני משחק ולא לכיסוי מלא. זיהוי השחקנים מוצג כאינדקס מ־0 עד 9 ללא שמות או מזהי Steam. אין כאן טקסט בשפות שאינן אנגלית, והנתונים כבדים ודורשים מנגנון פענוח וידאו נקודתי כדי לא להיתקע בצווארי בקבוק.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט הזה למוצר מסחרי?

הרינדורים והטבלאות משוחררים ברישיון CC-BY-4.0 שמתיר שימוש מסחרי עם מתן קרדיט. יחד עם זאת, קובצי המשחק המקוריים מגיעים מ־HLTV וכפופים לתנאי הטורנירים והזכויות של Valve סביב המשחק עצמו. יש לקחת בחשבון את המגבלות הללו לפני שילוב ישיר במוצר מסחרי.

כמה המאגר הזה שוקל ואיך מורידים אותו?

המאגר כולל קרוב ל־3,000 שעות וידאו ברזולוציית 720p, כך שמדובר בנפח עצום שלא מורידים במלואו למחשב אישי. הטבלאות מכילות הפניות לקובצי המדיה ומידע על גודל הקבצים בבייטים. הגישה המומלצת היא להוריד את קובצי ה־Parquet, לסנן את הקטעים הרצויים עם DuckDB, ולהזרים רק את השניות הדרושות בווידאו.

האם יש במאגר עברית או טקסט רלוונטי לשפות אחרות?

אין במאגר עברית כלל, וכל המטא-דאטה, שמות המפות, שמות הנשקים והאירועים שמורים באנגלית. המאגר מיועד לעיבוד וידאו, שמע ונתוני פעולה של שחקנים, ולא למשימות עיבוד שפה טבעית.

איך הנתונים נאספו ונוצרו בפועל?

היוצר הריץ תוכנת הקלטה מבוססת CS2 שרצה ללא ממשק מסך וקראה קובצי דמו מ־HLTV. התוכנה שחזרה את כל עשר נקודות המבט של השחקנים בכל סיבוב, ייצאה וידאו ושמע תואמים באמצעות FFmpeg, ורשמה את כל נתוני הקלט והמיקום לקובצי Parquet נפרדים לכל שחקן.

איך טוענים

אין צורך באישור גישה כדי להתחיל לעבוד, אבל לא מורידים את כל המאגר בבת אחת. טבלאות האינדקס והאירועים מחזיקות רק נתיבים לקובצי המדיה ולא את הבייטים עצמם, כך שאפשר לתשאל אותן מרחוק עם DuckDB או Polars. מסננים את האירועים הרצויים לפי שדות כמו מזהה משחק, נשק או סוג הריגה, ואז מזרימים רק את קטעי הווידאו הרלוונטיים באמצעות ספריות כמו TorchCodec. לאימון בקנה מידה רחב עדיף להשתמש בגרסת ה־WebDataset שהיוצר מציע במאגר נפרד.

from datasets import load_dataset

ds = load_dataset("blanchon/opencs2_dataset")

הרישיון

הרינדורים, קובצי הווידאו וטבלאות המטא-דאטה מופצים תחת רישיון CC-BY-4.0, שמתיר שימוש מסחרי, שינוי והפצה כל עוד נותנים ייחוס מתאים ליוצר. עם זאת, קובצי המקור הם קובצי דמו שנלקחו מ־HLTV, ושימוש בהם כפוף לתנאים המקוריים של הטורנירים שבהם שוחקו. מבחינת מודל שאומן על הנתונים, הרישיון אינו כופה שיתוף באותו רישיון אך יש לוודא עמידה בתנאי המקור של משחקי CS2 ו־HLTV.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗