GPT
D

describe-anything-dataset

קוד פתוח

nvidiaרישיון לא דווח2025-04-22

  • image
  • video

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

המאגר כולל תיאורים מילוליים מפורטים לאזורים ספציפיים בתוך תמונות ווידאו. הוא מתאים למי שמאמן מודלים שצריכים להבין לא רק סצנה כללית אלא חלקים מוגדרים היטב בתוכה.

  • 2,146הורדות בחודש
  • 59לייקים

מה זה

הנתונים מחולקים לפי מקורות מוכרים מעולם הראייה הממוחשבת: COCO-Stuff, LVIS, Mapillary Vistas 2.0, Open Images V7, PACO, SAM וגרסת הווידאו SA-V. בכל אחד מהמקורות האלה המפתחים לקחו את המידע הוויזואלי המקורי ויצרו עבורו תיוגים מילוליים מקומיים, ששימשו לאימון משפחת המודלים Describe Anything.

בתוך המאגר יש מעל שלושת אלפים קבצים, שכוללים קובצי תמונות ארוזים וקובצי תיוג נלווים. המבנה מבוסס על תיקייה לכל מאגר מקור, כמו COCOStuff, ובתוכה קובץ annotations.json לצד קובצי ארכיון ממוספרים. במקום תיאור בודד לכל תמונה שלמה, הנתונים כאן מתמקדים באזורים ספציפיים ומספקים עבורם כיתוב ממוקד.

הכרטיס לא מפרט תהליכי סינון ידניים או מדדים כמותיים שהופעלו על הטקסטים שנוצרו. הוא מציג את האוסף כשלם שמחבר בין מאגרי סגמנטציה ידועים לבין יכולות כיתוב מפורטות בעזרת שילוב של תמונות, קטעי וידאו ותיוגים שנבנו עליהם.

מתאים ל

  • אימון מודלי ראייה ממוחשבת

    לימוד מודלים רב-מודאליים לייצר כיתוב מפורט ומדויק לאזורים מסומנים בתוך תמונות ווידאו.

  • מחקר אקדמי בהבנת סצנות

    ניתוח היכולת של רשתות לקשר בין גבולות סגמנטציה מורכבים לבין תיאור שפתי עשיר באנגלית.

  • בדיקת ביצועי מודלי שפה-ראייה

    שימוש בתיוגים המקומיים כבסיס להשוואה מול פלטים של מודלי VLM שונים על אותם אזורי עניין.

איפה זה נופל

הטקסטים במאגר קיימים באנגלית בלבד, ואין בו ייצוג לשפות אחרות או התאמה להקשר מקומי בישראל. בגלל שמדובר באוסף שמורכב ממקורות שונים כמו Mapillary, LVIS ו־SAM, ההטיות המקוריות של כל אחד מהמאגרים הללו נגררות פנימה ישירות, כולל פערי ייצוג גיאוגרפיים או עצמים נדירים. בנוסף, הכרטיס לא מספק פרטים טכניים מלאים על אופן הפקת הכיתובים או בדיקות סינון של איכות הטקסט, ולכן חובה לדגום את התיוגים ידנית לפני שמבססים עליהם מודל.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא. הכרטיס מציין במפורש רישיון לא מסחרי של אנבידיה והגדרת השימוש מיועדת למחקר בלבד. אסור להכניס אותו לשום מוצר שמייצר הכנסה או משרת לקוחות מסחריים.

האם הדאטהסט כולל תמיכה בעברית?

לא, הנתונים מתועדים באנגלית בלבד. אם המטרה היא להבין או לייצר תיאורי אזורים בעברית, תצטרכו לתרגם את קובצי ה־JSON באופן עצמאי או לאמן שלב נוסף.

איך הנתונים מאורגנים להורדה?

האוסף מחולק לפי מאגרי המקור שלו, כאשר התמונות נשמרות בארכיוני tar ממוספרים לצד קובץ annotations.json שמחבר בין האזורים לכיתובים. אפשר לצרוך אותם כ־WebDataset ישירות או לחלץ את הקבצים לכונן.

במה הוא שונה מדאטהסטים רגילים של כיתוב תמונות?

בניגוד למאגרים שנותנים משפט אחד שמתאר תמונה שלמה, כאן התיאורים מוצמדים לחלקים מוגדרים היטב בתוכה. השילוב של שבעה מקורות מידע שונים מייצר גיוון עצום ברמות הפירוט של העצמים.

איך טוענים

את הנתונים אפשר לטעון ישירות כפורמט WebDataset דרך קובצי ה־tar בלי לחלץ אותם מראש לכונן, מה שנוח לעבודה בצינורות אימון גדולים. מי שמעדיף גישה רגילה יכול לפתוח את ארכיוני ה־tar ידנית ולקרוא את קובצי התמונות מול מזהי המטרות שמופיעים בקובץ ה־annotations.json בכל תיקיית מקור.

המאגר מכיל 3,070 קבצים, כך שמדובר בהורדה מסיבית שדורשת נפח אחסון משמעותי וחיבור רשת יציב. אין צורך באישור גישה מיוחד כדי להוריד את הקבצים. קובץ ה־JSON המרכזי מכיל את הקשר בין חלקי התמונה לבין הטקסטים המתאימים להם, וזהו השדה הקריטי לעיבוד לפני שמתחילים לאמן.

from datasets import load_dataset

ds = load_dataset("nvidia/describe-anything-dataset")

הרישיון

הרישיון שהוגדר בטקסט הכרטיס הוא רישיון לא מסחרי של אנבידיה, NVIDIA Noncommercial License, למרות שבשדה הרישיון הרשמי של העמוד לא דווח ערך. המשמעות ברורה ופשוטה: השימוש מוגבל למחקר ולהדגמות בלבד. אסור לשלב את הנתונים במוצר מסחרי, ואימון של מודל על המאגר הזה פוסל אותו משימוש בעסק או במערכת מסחרית.

הרישיון המלא ב־Hugging Face ↗