GPT
R

R1-Onevision

קוד פתוח

Fancy-MLLMapache-2.02025-02-01

מאגר שמחבר שאלות ותשובות ויזואליות עם שרשראות חשיבה מפורטות לפתרון בעיות מורכבות. הוא מיועד למי שרוצה לאמן מודל רב-מודאלי שמסוגל לנמק צעד אחר צעד על גבי תמונות, ולא רק לזרוק תשובה קצרה.

  • 1,471הורדות בחודש
  • 46לייקים

מה זה

הרשומות בנויות במבנה שיחה שבו מוצגת שאלה לצד שרשרת חשיבה מלאה של עוזר. המאגר מכיל בין מאה אלף למיליון דוגמאות שמחולקות לפי תחומים כמו גיאומטריה, תרשימים, מסמכים ותמונות טבעיות. הנתונים מתבססים על שילוב של LLaVA-OneVision עם מקורות מוכרים כמו Geometry3K, IconQA, VizWiz, DocVQA ותרשימים.

תהליך הייצור הסתמך על תיאור מפורט של התמונות באמצעות שילוב של GPT-4o עם EasyOCR ו־Grounding DINO. תרשימים הומרו לקוד כמו PlantUML או HTML כדי לשמר מבנה, ותמונות טבע נותחו לרמת מיקום האלמנטים. לאחר מכן יוצרו שרשראות החשיבה באמצעות משחק תפקידים שבוחן שוב ושוב את הוויזואליה, כשבסוף התהליך GPT-4 שימש כמסנן שזרק שלבי נימוק שגויים או לא רלוונטיים.

מתאים ל

  • אימון מודל רב מודאלי

    לימוד מודל תמונה-טקסט להסביר את צעדי ההיגיון שלו לפני מתן תשובה סופית.

  • ניתוח תרשימים וגרפים

    אימון יכולות הבנה וקריאה של דיאגרמות מורכבות שהומרו למבנה לוגי מוגדר.

  • פתרון בעיות הנדסה וחשבון

    כוונון המודל על משימות גיאומטריה ומתמטיקה ויזואלית שדורשות חשיבה רב-שלבית.

איפה זה נופל

חלק גדול מהתוכן נוצר וסונן באמצעות מודלים של OpenAI, כך שהמאגר כולל הזיות סינתטיות אופייניות ואינו מבוסס כולו על תיוג אנושי שנבדק ידנית. אין שום תיעוד לתמיכה בעברית, והטקסטים מגיעים כולם באנגלית מתוך המקורות המקוריים. בנוסף, אם המוצר שלכם צריך להתמודד עם צילומים ישראליים אמיתיים או ממשקים מקומיים, הייצוג שלהם כאן פשוט לא קיים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

הרישיון המוגדר הוא Apache 2.0 והוא מאפשר שימוש מסחרי חופשי. העניין היחיד שדורש זהירות הוא שהטקסטים ושרשראות החשיבה הופקו בעזרת שירותי OpenAI, שתנאי השימוש שלהם אוסרים לעיתים אימון מודלים שמטרתם להתחרות בהם ישירות.

האם הדאטהסט כולל שאלות או מסמכים בעברית?

לא, הנתונים מבוססים על מאגרי מקור באנגלית כמו DocVQA ו־IconQA. כל תהליכי ה־OCR ושרשראות החשיבה שנוצרו עם GPT-4o מנוסחים באנגלית בלבד, ואין שם ייצוג לטקסט מקומי.

איך נשמרות התמונות בתוך הקבצים?

התמונות אינן מקושרות לקישורים חיצוניים ברשת אלא שמורות ישירות כטקסט בקידוד base64 בתוך שורות ה־parquet. זה מבטיח שהמידע לא ייעלם עם הזמן, אך גורם לקבצים להיות כבדים יותר לטעינה ולעיבוד ראשוני.

במה הוא שונה מ־LLaVA-OneVision הרגיל?

היוצרים לקחו חלקים מ־LLaVA-OneVision, שילבו מקורות ממוקדים נוספים, והעבירו את הכל תהליך שמוסיף שרשראות חשיבה עמוקות ומפורטות. במקום להסתפק בהוראות פשוטות, הם הדגישו פתרון צעד-אחר-צעד עם בדיקת איכות של GPT-4.

איך טוענים

המאגר ציבורי לחלוטין ואין צורך לבקש אישור גישה מראש. הוא מפוצל ל־32 קובצי parquet לפי המקורות השונים. בכל שורה יש מזהה ייחודי, התמונה עצמה מקודדת במחרוזת base64, ומערך שיחות שמכיל את שאלת המשתמש ואת שרשרת החשיבה של העוזר. שימו לב שהתמונות יושבות ישירות בתוך הקבצים, מה שמנפח את משקל הקריאה בזיכרון בזמן הטעינה.

from datasets import load_dataset

ds = load_dataset("Fancy-MLLM/R1-Onevision")

הרישיון

הרישיון המדווח הוא Apache 2.0 שמתיר שימוש מסחרי, שינוי והפצה, כל עוד אתם משמרים את הודעת הרישיון וקרדיט ליוצרים. המודלים שמאומנים על הדאטהסט אינם מחויבים לפתיחת קוד. יחד עם זאת, יש לזכור שהנתונים נוצרו בסיוע GPT-4o, ולכן יש לבדוק את תנאי השימוש של OpenAI בנוגע לאימון מודלים מתחרים לפני שמכניסים את התוצרים לליבת המוצר.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗