GPT
S

S1-MMAlign

קוד פתוח

ScienceOne-AIcc-by-nc-4.02025-12-03

  • science
  • multimodal
  • physics
  • biology
  • chemistry

מעל 15.5 מיליון צמדי תמונה וטקסט מדעיים ממאמרי גישה פתוחה, עם תיאורים שהורחבו באמצעות מודל חזותי. המאגר מיועד לאימון מודלים שצריכים להבין תרשימים, ניסויים ומפות חום ברמה אקדמית.

  • 3,727הורדות בחודש
  • 106לייקים

מה זה

המאגר כולל יותר מ־15.5 מיליון תמונות שחולצו מכ־2.5 מיליון מאמרים מדעיים פתוחים, בעיקר מ־arXiv. התמונות מכסות תשעה תחומי מדע מדויק, ביניהם מתמטיקה, פיזיקה, כימיה, ביולוגיה, רפואה ומדעי המחשב. הוויזואליה מגוונת מאוד וכוללת מערכי ניסוי, צילומי מיקרוסקופ, מפות חום וגרפים מורכבים.

הבעיה העיקרית בתמונות מדעיות היא שהכיתוב המקורי לעיתים קצר, סתום ומניח שהקורא כבר בקיא במאמר. כדי לפתור את זה, החוקרים העבירו את הנתונים דרך מודל Qwen-VL, שיצר כיתוב מורחב על בסיס תקציר המאמר וההקשר שבו התמונה צוטטה. כל רשומה כוללת את נתיב התמונה, הכיתוב המקורי, הכיתוב המועשר ומטא-דאטה עם מזהה המאמר והכותרת.

מתאים ל

  • אימון מודלי ראייה-שפה

    לימוד מודלים רב-מודאליים להבין תרשימים מדעיים, נוסחאות ומבנים מורכבים.

  • מענה על שאלות חזותיות

    פיתוח מערכות שיודעות לנתח איורים במאמרים ולענות על שאלות מחקר מבוססות תמונה.

  • חילוץ מאפיינים מדעיים

    הפקת ייצוגים וקטוריים מתמונות ניסוי, מפות חום ומיקרוסקופיה לצורכי אחזור.

איפה זה נופל

הטקסט כולו באנגלית בלבד, ואין כאן שום ייצוג לעברית או לשפות אחרות. הכיתובים המועשרים נוצרו על ידי בינה מלאכותית, מה שאומר שהם עלולים להכיל הזיות או אי-דיוקים מדעיים שהמודל המייצר המציא על דעת עצמו. בנוסף, זכויות היוצרים על התמונות עצמן שייכות ליוצרי המאמרים המקוריים, כך שהאחריות המשפטית לשימוש בהן נשארת אצלכם.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

לא. הרישיון הוא CC BY-NC 4.0, והוא אוסר כל שימוש מסחרי במאגר או בתמונות שבו. הוא מיועד למחקר ולמטרות לא מסחריות בלבד.

האם הדאטהסט כולל תוכן בעברית?

לא, המאגר מוגדר כמאגר באנגלית בלבד. כל המאמרים והכיתובים, כולל אלה שנוצרו על ידי המודל, הם באנגלית.

באיזה שדה כדאי להשתמש לאימון מודלים?

היוצרים ממליצים להשתמש בשדה recaption. זהו כיתוב שנוצר על ידי מודל Qwen-VL ומשלב את תקציר המאמר וציטוטי התמונה, ולפי הבדיקות שלהם הוא מציג שיפור משמעותי בהתאמה לתמונה לעומת הכיתוב המקורי.

איך מחלצים את הקבצים בלי לשבור את הקישורים?

המאגר בנוי מארכיונים דחוסים עם חלוקה לפי שנים וחלקים. קובץ ה־jsonl מסתמך על נתיבים יחסיים מדויקים, ולכן אסור לשטח את מבנה התיקיות בעת הפריסה.

איך טוענים

המאגר מחולק לקבצי ארכיון דחוסים לפי שנים, חלקם מפוצלים לחלקים קטנים יותר, ובסך הכל יש 145 קבצים במאגר. הנתונים עצמם מגיעים בקובץ jsonl שמפנה לנתיבים יחסיים של התמונות. הנקודה הקריטית כאן היא שאסור לשטח את מבנה התיקיות בעת החילוץ, אחרת הנתיבים במטא-דאטה יישברו. המפרסמים ממליצים במפורש להשתמש בשדה recaption לאימון ולא בטקסט המקורי, כדי ליהנות מהיישור המשופר.

from datasets import load_dataset

ds = load_dataset("ScienceOne-AI/S1-MMAlign")

הרישיון

הרישיון הוא CC BY-NC 4.0, מה שאומר איסור מוחלט על שימוש מסחרי. מותר להשתמש במאגר למחקר, להערכה ולפיתוח אישי, תוך מתן קרדיט מתאים ליוצרים. אם המטרה היא לבנות מוצר מסחרי או לאמן מודל שיניב הכנסות, הדאטהסט הזה פשוט לא בא בחשבון.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗