GPT
L

LARYBench

קוד פתוח

meituan-longcatcc-by-nc-sa-4.02026-04-09

  • Embodied-AI
  • Latent Action
  • Robotic manipulation

המאגר מרכז 1.2 מיליון סרטוני פעולה ומאות אלפי מסלולי תנועה של רובוטים ובני אדם. הוא מיועד למי שרוצה לבחון ייצוגי פעולה חבויים בלי לערבב אותם עם ביצועי המדיניות הסופית.

  • 5,763הורדות בחודש
  • 20לייקים

מה זה

הנתונים כוללים 1.2 מיליון סרטונים שאורכם המצטבר מגיע לאלף שעות, 620 אלף זוגות תמונות ו־595 אלף מסלולי תנועה. החלוקה הפנימית מפרידה בין משימות סיווג, שבודקות זיהוי של 151 סוגי פעולות ברמת הסמנטיקה, לבין משימות רגרסיה שמתמקדות בפענוח פקודות פיזיות עבור 11 גופי רובוטים שונים מזוויות גוף ראשון וגוף שלישי.

המקור של החומר אינו איסוף עצמאי מהשטח אלא עיבוד מחדש. הצוות לקח אחד עשר מאגרים פומביים קיימים, בהם CALVIN, EPIC-KITCHENS, LIBERO ו־Ego4D, והפעיל מנוע אוטומטי שחתך את המקטעים ותייג אותם מחדש כדי להתאים למבנה אחיד של הערכת פעולות.

מתאים ל

  • מבחן סמנטי למודלי וידאו

    אימון מסווג פשוט על גבי ייצוגים מוקפאים לזיהוי 151 פעולות מתוך סרטוני אדם ורובוט.

  • הערכת רגרסיית תנועה

    פענוח מסלולי שליטה ופרמטרים פיזיים של רובוטים מתוך זוגות תמונות במאמץ רציף.

  • בנצ'מרק השוואתי למודלים

    השוואה אחידה בין ארכיטקטורות חזותיות כלליות לבין מודלי ראייה-שפה-פעולה ייעודיים.

איפה זה נופל

החולשה העיקרית היא שאין כאן שום מידע חדש או ייחודי, אלא רק ארגון מחדש של מקורות ותיקים בעולם הרובוטיקה. מעבר לזה, הכרטיס מודה בפירוש ששחרור הדאטהסט המלא עדיין לא הושלם, ונכון לעכשיו פורסמו רק חלק מנתוני הוולידציה והאימון עקב מגבלות רישוי. טקסטים או תיוגים קיימים רק באנגלית ובסינית, כך שמי שמחפש בדיקות מקומיות או נתונים שלא עברו סינון דרך מודלים קודמים לא ימצא אותם פה.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

המאגר המלא מוגבל למחקר ולשימוש לא מסחרי בלבד בגלל תנאי הרישיון של EPIC-KITCHENS ו־AgiBotWorld-Beta. שימוש מסחרי מתאפשר רק אם מסננים ידנית מתוך המאגר את החלקים שמקורם ברישיונות מתירניים, כמו CALVIN או LIBERO שמפורסמים תחת רישיון MIT. שימוש בחבילה כולה בתוך מודל מסחרי חושף אתכם להפרת זכויות.

איך נאספו הרשומות במאגר?

הנתונים לא צולמו במיוחד עבור הפרויקט. הצוות יצר מנוע אוטומטי שחתך מחדש ותייג סרטונים ומסלולים מתוך אחד עשר מאגרים פומביים קיימים, בהם Ego4D, TACO ו־CALVIN. התוצאה היא האחדה של פורמט הנתונים ולא דאטה מקורי.

האם יש במאגר תמיכה בעברית?

אין במאגר עברית בכלל. הטקסטים והתיוגים מופיעים באנגלית ובסינית בלבד, בהתאם למקורות שממנו הוא הורכב ולצוות שפרסם אותו.

האם כל הדאטהסט זמין להורדה מלאה כרגע?

לא. לפי עמוד הפרויקט שוחררו רק חלקי האימון והוולידציה הראשוניים, והשחרור המלא טרם הסתיים עקב בדיקות והגבלות רישוי של תתי-המאגרים. המשמעות היא שמי שמוריד אותו עכשיו עובד מול תת-קבוצה ולא מול ההיקף השלם שמדווח במאמר.

איך טוענים

ההורדה מורכבת מ־932 קבצים, בעיקר ארכיוני tar.gz מפוצלים ומטא-דאטה בקובצי CSV שמגיעים ישירות בתיקיית הנתונים. כדי להריץ את הצינור בפועל, מגדירים משתני סביבה שמצביעים לתיקיית הדאטהסט, למודלים המאומנים ולנתיב שמירת ייצוגי הפעולה, ומפעילים את הסקריפטים דרך פקודת CLI ייעודית. התהליך עצמו מפוצל לפי סביבות עבודה שונות של Conda בהתאם למודל החזותי שבוחרים לפרוק, כמו DINOv2 או V-JEPA 2, תוך הפקת קובצי npz לכל חלוקה.

from datasets import load_dataset

ds = load_dataset("meituan-longcat/LARYBench")

הרישיון

המאגר בכללותו מוגדר תחת cc-by-nc-sa-4.0 בגלל החלקים שנלקחו מ־AgiBotWorld-Beta ומ־EPIC-KITCHENS. המשמעות היא איסור מוחלט על שימוש מסחרי מכל סוג, חובת מתן קרדיט מלא למקורות, וחובה לשתף כל תוצר או נגזרת תחת אותו הרישיון בדיוק. אימון מודל שמיועד למוצר מסחרי עלול להפר את תנאי המקורות הללו, אלא אם מבודדים ומשתמשים אך ורק בתתי-החלקים שמבוססים על רישיונות מתירניים כמו MIT או CC BY 4.0.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗