GPT
L

LocateAnything-Data

קוד פתוח

NVEagleרישיון לא דווח2026-07-26

  • visual-grounding
  • pointing
  • document-layout-analysis
  • gui-grounding
  • megatron-energon

המאגר מאחד עשרות סטים של זיהוי אובייקטים, הצבעה וטקסט תחת פורמט גיאומטרי אחיד. הוא מתאים למי שמאמן מודלים של ראייה ושפה וצריך קישור מדויק בין מילים למיקום בתמונה.

  • 9,660הורדות בחודש
  • 31לייקים

מה זה

המאגר מאגד מגוון רחב של מקורות ציבוריים מוכרים כדי לאמן מודלים על משימות חיזוי מרחבי. הנתונים מחולקים לפי תחומים כמו זיהוי כללי, צפיפות גבוהה של עצמים, נהיגה אוטונומית, ממשקי משתמש, זיהוי טקסט וניתוח מסמכים וטבלאות. בין המקורות נכללים סטים כמו COCO, BDD100K, Objects365 ו־DocLayNet.

כל שורת אימון בפורמט JSONL מחזיקה זיהוי מקור, הפניה לקובץ התמונה, סוג משימה של זיהוי תיחום או נקודה, ושאילתה שממפה טקסט לקואורדינטות מנורמלות בטווח של אפס עד אלף. התמונות ארוזות בקובצי TAR עם אינדקס לקריאה מהירה, ויש קובצי Parquet שממפים כל דוגמה לשם הקובץ וההאש המקוריים שלה.

חלוקת המידע מתבססת על תצוגות שונות עבור אותו מקור מדיה, למשל זיהוי רגיל לעומת ביטויים מכוונים על בסיס אותן תמונות. חלק ממאגרי המקור מגיעים עם התמונות בתוך המאגר, בעוד שאחרים דורשים הורדה נפרדת מהאתר המקורי.

מתאים ל

  • אימון זיהוי מונחה טקסט

    אימון מודלי ראייה שמקבלים ביטוי מילולי חופשי ומחזירים תיחום מדויק סביב העצם המתאים בתמונה.

  • איתור אלמנטים בממשקי מחשב

    זיהוי כפתורים ושדות במסכי מערכות הפעלה לפי תיאור הפעולה הנדרשת באמצעות הנתונים מתחום ה־GUI.

  • זיהוי מיקום טקסט במסמכים

    איתור אזורי טקסט, טבלאות ופסקאות בתוך סריקות של מסמכים וקבלות לפי תיאור מבני.

  • מיקום נקודתי לרובוטיקה

    חיזוי קואורדינטות של נקודה בודדת עבור אחיזה או אינטראקציה של סוכן בעולם פיזי.

איפה זה נופל

החיסרון המרכזי הוא התלות במקורות חיצוניים עבור חלק ניכר מתמונות הצפיפות והאובייקטים, כשעבור Unsplash אין אפילו תהליך שחזור יציב של התמונות המקוריות. בנוסף, המאגר מיועד למחקר אקדמי בלבד לפי הצהרת היוצרים, ומבוסס על שילוב של סטים שונים עם תנאי שימוש נפרדים שלא נבדקו תחת רישיון אחיד. השפה המרכזית בתיעוד ובשאילתות היא אנגלית וסינית, ואין פה ייצוג מתועד של טקסט או ממשקים בעברית.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא מומלץ להשתמש בו למוצר מסחרי כמקשה אחת. המאגר מוגדר על ידי המפרסמים כמיועד למחקר אקדמי, ואין לו רישיון אחיד. כל מקור שומר על תנאי השימוש המקוריים שלו, כך שתצטרכו לסנן ידנית רק מקורות שמתירים שימוש מסחרי.

האם כל התמונות יורדות באופן אוטומטי?

לא. שבעה מאגרים, בהם CrowdHuman, Objects365 ו־Flickr30K, דורשים שתורידו את התמונות ישירות מהאתרים המקוריים שלהם. רק לאחר ההורדה החיצונית תצטרכו להריץ סקריפט פנימי כדי לשלב אותן במאגר המקומי.

האם המאגר כולל נתונים בעברית?

לא דווח על נתונים בעברית. השאילתות, התיוגים ותחומי הטקסט מתבססים על מאגרים סטנדרטיים באנגלית ובשפות אחרות כמו סינית, כך שאם אתם בונים מערכת לזיהוי שלטי רחוב או מסמכים מקומיים תצטרכו לאסוף נתונים משלכם.

איך ניגשים לדוגמאות בלי לפרוק את כל קובצי המדיה?

המאגר בנוי עם קובצי TAR שמלווים באינדקסים מיוחדים. שימוש בספריית megatron-energon בגרסה 7.4.0 מאפשר לקרוא דוגמאות בודדות ובייט של תמונות ישירות מתוך הארכיון לפי מיקום השורה, בלי לחלץ מיליוני קבצים לדיסק.

איך טוענים

טוענים את המאגר באמצעות שורת הפקודה של Hugging Face או בעזרת סקריפט ייעודי שמוריד רק תתי־קבוצות מבוקשות. המאגר מכיל 1,641 קבצים ודורש את ספריית megatron-energon בגרסה 7.4.0 יחד עם Pillow כדי לפענח את התמונות מקובצי ה־TAR בלי לחלץ אותן לדיסק. קובצי ה־JSONL מכילים אינדקסים ייעודיים לשליפת שורות לפי מיקום בבייטים. עבור שבעה מאגרי מקור, כמו CrowdHuman או Objects365, המדיה לא כלולה ותצטרכו להוריד אותה עצמאית ולהריץ סקריפט מקומי כדי לבנות את האינדקסים.

from datasets import load_dataset

ds = load_dataset("NVEagle/LocateAnything-Data")

הרישיון

למאגר עצמו לא הוגדר רישיון רשמי בעמוד. היוצרים מבהירים במפורש שהוא מיועד למחקר אקדמי ושהם לא מעניקים שום זכויות נוספות על התמונות. כל תת־מאגר כפוף לרישיון המקורי שלו, ולכן שימוש מסחרי במאגר המלא או במודל שאומן עליו הוא סיכון משפטי ברור, לפחות עד שתבדקו ותבודדו רק את המקורות שמתירים זאת.

הרישיון המלא ב־Hugging Face ↗