GPT
V

VisionArena-Chat

קוד פתוח

lmarena-aiרישיון לא דווח2025-01-14

המאגר כולל 200K שיחות אמיתיות של משתמשים עם 45 מודלי ראייה שונים. הנתונים מתאימים למי שצריך לראות איך מודלי ראייה מתמודדים עם פרומפטים ותמונות מהעולם האמיתי.

  • 4,618הורדות בחודש
  • 15לייקים

מה זה

המאגר מכיל 200,000 שיחות של משתמשים מול מודלי ראייה, עם סבב יחיד או מספר סבבים, שנאספו בפלטפורמת Chatbot Arena בין פברואר 2024 לספטמבר 2024. המשתמשים אישרו מראש את שיתוף השיחות שלהם, והאינטראקציות מתפרסות על פני 138 שפות עם כ־43k תמונות ייחודיות. כל שיחה מתמקדת בתמונה בודדת בלבד, לצד מזהה המודל, מזהה משתמש מוצפן שמבוסס על כתובת IP, חותמת זמן, מספר סבבי השיחה ותגיות קטגוריה כמו OCR, תיאור תמונה, זיהוי ישויות, תכנות, שיעורי בית, דיאגרמות, הומור, כתיבה יצירתית וסירוב.

התמונות מגיעות מהעלאות ישירות של משתמשים או ממאגרים מוכנים מראש בעקבות לחיצה על כפתור תמונה אקראית, ביניהם TextVQA, ChartQA, DocQA, WikiArt, NewYorker ו־realworldqa. לפני הפרסום הופעלו כלי סינון לזיהוי והסרת תוכן בלתי הולם, כולל זיהוי פנים, פרטי זיהוי אישי בטקסט ובתמונה, וכן כלי סינון לתכנים בוטים ובלתי חוקיים. החוקרים מציינים שהכלים האלה אינם מושלמים, ולכן תמונות בעייתיות או פנים אנושיות עדיין עשויות להופיע בנתונים.

מתאים ל

  • אימון מודלי ראייה

    כוונון מודלים על 200,000 שיחות רב-סבביות מול תמונה בודדת במגוון משימות.

  • הערכת ביצועי OCR ודיאגרמות

    בדיקת יכולות פענוח טקסט וגרפים על שאלות משתמשים אמיתיות מתוך משימות STEM.

  • ניתוח סירובים ובטיחות

    בחינת תגובות מודלים והתנהגות מנגנוני סירוב על בסיס התיוגים הייעודיים במאגר.

איפה זה נופל

הנתונים מוטים מאוד לתחומי STEM, משימות OCR ותיאור תמונות כללי. יש פה מעט מאוד שאלות מתחומים מקצועיים מחוץ למדעים המדויקים. בנוסף, מנגנוני הסינון לא חסינים הרמטית, ועלולות להסתנן תמונות פוגעניות, תוכן לא הולם או פנים של אנשים. השיחות נאספו בין פברואר לספטמבר 2024 בלבד, וכל שיחה מוגבלת לתמונה אחת, ללא תמיכה בהקשר של מספר תמונות במקביל.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

ההסכם מתיר שימוש למטרות מחקר ומסחר לצורך שיפור מודלים ותוכנה. יחד עם זאת, אסור להפיץ או להעביר את הנתונים עצמם לצד שלישי, והיוצרים רשאים לדרוש מכם למחוק את כל העותקים שברשותכם בכל רגע.

האם הדאטהסט מכיל שאלות ותשובות בעברית?

המאגר כולל שיחות ב־138 שפות שנאספו ממשתמשי האתר. הכרטיס לא מפרט את ההתפלגות המדויקת של כל שפה, ולכן כדאי לסנן את הטקסט לפי שפה לפני שמתחילים לעבוד.

מה מקור התמונות שנמצאות בשיחות?

חלק מהתמונות הועלו ישירות על ידי המשתמשים, וחלקן הגיעו ממאגרים קיימים כמו TextVQA, ChartQA, DocQA ו־WikiArt דרך כפתור התמונה האקראית. העמודות is_preset ו־dataset_preset מאפשרות לזהות מאיזה מקור כל תמונה הגיעה.

איך טוענים

הנתונים מחולקים ל־44 קובצי parquet שונים בספריית data, החל מ־train-00000-of-00043 ועד train-00043-of-00043, לצד קובץ README. התמונות שמורות ישירות בתוך הקבצים כמערך בתים, וטוענים אותן בעזרת Image.open על BytesIO של שדה הבתים. העמודה images מחזיקה את התמונה, העמודה conversation מכילה את חילופי הדברים, והשדות is_preset ו־dataset_preset מציינים אם התמונה הגיעה ממשתמש או ממאגר קיים.

from datasets import load_dataset

ds = load_dataset("lmarena-ai/VisionArena-Chat")

הרישיון

הסכם הרישיון המצורף מתיר שימוש למחקר וגם לפיתוח ושיפור מסחרי של תוכנה ומודלים, אבל אוסר להעביר, להפיץ, להטמיע או לשתף את הדאטהסט עצמו לצד שלישי. היוצרים שומרים לעצמם את הזכות לדרוש מחיקה מלאה ומיידית של הנתונים בכל עת, מה שיוצר סיכון משפטי ברור למי שמבסס עליו תהליכי אימון.

הרישיון המלא ב־Hugging Face ↗