GPT
H

Honey-Data-15M

קוד פתוח

Open-Beeרישיון לא דווח2025-10-16

  • Bee-8B
  • Honey-Data-15M

בערך 15 מיליון דוגמאות לאימון מודלי ראייה שפה, שכוללות תהליכי חשיבה מובנים בשתי רמות עומק. הוא פונה למי שרוצה לשפר יכולות היסק רב מודליות בלי להסתמך על נתונים גולמיים ורועשים.

  • 47,081הורדות בחודש
  • 120לייקים

מה זה

המאגר כולל כ־15 מיליון רשומות המיועדות לאימון מונחה של מודלים מולטימודליים, מסוג תמונה וטקסט לטקסט. התשובות עברו סינון וניקוי רעשים באמצעות צינור עיבוד בשם HoneyPipe, וחולקו לשתי רמות של שרשראות חשיבה. כ־12.2 מיליון דוגמאות מכילות חשיבה קצרה להסבר לוגי בסיסי של צעד אחר צעד, וכ־2.7 מיליון דוגמאות מציגות חשיבה ארוכה לפתרון בעיות מורכבות שמצריכות עיבוד מעמיק.

מבחינת תיוג, כל תשובה עטופה בתגיות חשיבה ייעודיות, כאשר בחשיבה ארוכה התוכן נמצא בתוך תגית המחשבה ובחשיבה קצרה המענה מופיע מיד לאחריה. התוכן עצמו נאסף ממאגרים ציבוריים מוכרים בתחום, כולל LLaVA OneVision, MAmmoTH VL, נתוני מסמכים מבוססי ArXiv OCR, נתונים סינתטיים מ־CoSyn, נתוני רשת מ־VisualWebInstruct, אוסף PixMo ומקורות נוספים כמו Cauldron ו־Cambrian, לצד כיתובים מעובדים כמו COYO Recaption.

מתאים ל

  • אימון מודלי שפה וראייה

    כוונון עדין של מודלים מולטימודליים לביצוע משימות הבנת תמונה ומענה טקסטואלי.

  • פיתוח יכולות חשיבה

    לימוד מודלים לפרק בעיות ראייה מורכבות לשלבים באמצעות דוגמאות מובנות של שרשרת חשיבה.

  • מחקר אקדמי ברב מודליות

    בחינת השפעת איכות הנתונים וסינון רעשים על ביצועי מודלים פתוחים בהשוואה לסגורים.

איפה זה נופל

הנתונים מוגבלים לשפה האנגלית בלבד, ואין כאן שום ייצוג לעברית. בנוסף, מדובר באוסף שמבוסס על שלל מקורות חיצוניים קיימים שעברו עיבוד וסינון מחדש, כך שהתוכן חשוף להטיות המקוריות של אותם מאגרי בסיס ולאי דיוקים שנובעים מיצירה אוטומטית של שרשראות חשיבה. מי שבונה מודל ייעודי יצטרך לבדוק מדגמית את איכות ההסברים בתוך התגיות ולוודא שהתמונות מתאימות לתרחישי השימוש שלו.

אותה משפחה

Honey-Data יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא. התוספות של הפרויקט שוחררו תחת רישיון לא מסחרי, וחלק מתתי המאגרים שנאספו פנימה מחזיקים במגבלות משלהם. השימוש מיועד למחקר בלבד.

כמה מקום אחסון צריך כדי להוריד אותו?

המאגר שוקל 4.71 טרה בייט. תצוגת הדפדפן בהאגינג פייס מציגה גודל שגוי בגלל באג, לכן חשוב לפנות מראש נפח דיסק ייעודי וגדול.

האם יש במאגר תמיכה בעברית?

לא, הנתונים מתועדים באנגלית בלבד. אם המטרה היא לאמן מודל שיבין או ייצר עברית סביב תמונות, תצטרכו להביא מקורות נתונים אחרים.

מה מייחד אותו מדאטהסטים אחרים לתמונות וטקסט?

הוא מתמקד בסינון רעשים ומשלב תגיות של שרשראות חשיבה קצרות וארוכות בתוך התשובות. המבנה הזה עוזר ללמד את המודל איך להסיק מסקנות ולא רק לתת כיתוב יבש.

איך טוענים

המשקל הכולל מגיע ל־4.71 טרה בייט, שמחולקים ליותר מ־2,100 קבצים, רובם בפורמט Parquet לפי תיקיות של מקורות המידע השונים. הגישה למאגר פתוחה לחלוטין ואין צורך בבקשת אישור. תצוגת הנתונים המובנית בהאגינג פייס מציגה מספרים שגויים עקב תקלה, כך שחשוב להיערך עם נפח אחסון מקומי משמעותי ותעבורת רשת רחבה לפני שמתחילים למשוך את המידע. בעבודה עם הקבצים, השדות המרכזיים כוללים את נתוני התמונה ואת הטקסט המכיל את תגיות החשיבה הספציפיות שמובילות לתשובה הסופית.

from datasets import load_dataset

ds = load_dataset("Open-Bee/Honey-Data-15M")

הרישיון

בדף הראשי לא מוגדר רישיון אחיד, אך המפרסמים מבהירים שמדובר באוסף למטרות מחקר אקדמי. ההנחיות והתשובות שנוצרו עבור הפרויקט שוחררו תחת רישיון CC BY NC 4.0 שאוסר שימוש מסחרי באופן מפורש. יתרה מזאת, כל תת מאגר שנאסף פנימה כפוף לרישיון המקורי שלו. אי אפשר לקחת את הדאטהסט הזה ולאמן עליו מודל מסחרי לחברה שלכם בלי להסתכן בהפרת זכויות.

הרישיון המלא ב־Hugging Face ↗