GPT
P

pubmed-ocr

קוד פתוח

bevayaother2026-01-16

  • biology
  • medical
  • ocr
  • multimodal

המאגר מרכז כמיליון וחצי עמודי מאמרים מדעיים מרונדרים עם תיוגי מיקום מדויקים של מילים ופסקאות. הוא מיועד למי שמאמן מודלי ראייה ושפה ומחפש התאמה חזקה בין טקסט למיקום שלו במסמך.

  • 3,834הורדות בחודש
  • 72לייקים

מה זה

הנתונים מגיעים מקובצי PDF של כמאתיים ועשרה אלף מאמרים מתוך מאגר PubMed Central Open Access. כל שורה במאגר מייצגת עמוד PDF בודד שרונדר לתמונה ברזולוציה של 150 DPI ועבר זיהוי באמצעות Google Cloud Vision OCR.

הפלט נשמר כמחרוזת JSON עם קואורדינטות של תיבות תוחמות ברמת המילה, השורה והפסקה לפיקסלים של התמונה. בנוסף, כל רשומה כוללת מזהי מאמר כמו PMID, שדה ציטוט, סוג הרישיון המקורי ובחלק מהמקרים גם את הבייטים הגולמיים של ה־PDF המקורי אם הרישיון אפשר זאת. המאגר מכיל רק פיצול אחד של train, ללא חלוקה מובנית למבחן.

מתאים ל

  • אימון מודלי ראיית מסמכים

    לימוד ייצוגים של סידור עמוד ומיקומי טקסט במאמרים מדעיים צפופים.

  • שאלות ותשובות מבוססות מיקום

    פיתוח מודלים שצריכים להחזיר ציטוט מדויק יחד עם תיבת המיקום שלו בעמוד.

  • בדיקת חוסן למערכות OCR

    הערכת ביצועי צינורות שליפת מידע מול טקסט שמכיל שגיאות זיהוי מובנות.

איפה זה נופל

הטקסט אינו אמת מידה מושלמת אלא פלט מכונה של גוגל, ולכן הוא כולל שגיאות זיהוי של מילים מורכבות. שחזור השורות נעשה באמצעות היוריסטיקה של יישור אנכי, מה שמוביל לטעויות קשות בסדר הקריאה בעמודים עם עמודות מרובות, טבלאות או נוסחאות מתמטיות. התוכן כולו באנגלית ומגיע מעולם הרפואה והמדע, כך שהוא לא מייצג מסמכים משרדיים, קבלות או שפות אחרות. לא הייתי בונה על הטקסט הזה כמקור מידע קליני ישיר או כבסיס לקריאת מבנה של טבלאות.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מודל מסחרי?

רק בחלק ממנו. כל עמוד יורש את רישיון המאמר המקורי שלו, שמצוין מפורשות ברשומה, וישנם מאמרים עם מגבלות לשימוש לא מסחרי. עליכם לפלטר את המאגר לפי שדה הרישיון לפני האימון.

האם יש במאגר טקסט בעברית?

לא. המאגר מבוסס על מאמרים מדעיים מ־PubMed Central ומוגדר באנגלית בלבד. הוא אינו מתאים למי שמחפש אימון OCR או עיבוד מסמכים בעברית.

כיצד הופקו המיקומים של השורות והפסקאות?

מנוע Google Cloud Vision הפיק תיבות ברמת מילים ופסקאות, ופוליגוני הזיהוי עוגלו למלבנים ישרים. תיבות השורות שוחזרו בצורה היוריסטית לפי גובה ויישור המילים, ולכן הן עלולות להיות לא מדויקות בטקסט רב-עמודתי.

האם הדאטהסט מגיע מחולק לסט אימון ובדיקה?

לא, כל הרשומות מוגשות תחת פיצול train יחיד. מי שרוצה לבצע הערכה צריך לייצר חלוקה עצמאית, ומומלץ לבצע אותה ברמת מאמרים או כתבי עת נפרדים כדי למנוע זליגת מידע.

איך טוענים

המאגר מחולק למאות קובצי Parquet וכולל כמיליון וחצי רשומות, כך שהורדה מלאה שלו דורשת נפח אחסון משמעותי. הטעינה נעשית ישירות דרך ספריית datasets בפייתון ללא צורך בהרשאת גישה מיוחדת, כאשר עבודה עם streaming מומלצת כדי להימנע מקריסת זיכרון. השדה החשוב ביותר הוא ocr_json, שמחייב פענוח של מחרוזת ה־JSON כדי לחלץ את הטקסט והתיבות התוחמות.

from datasets import load_dataset

ds = load_dataset("bevaya/pubmed-ocr")

הרישיון

הרישיון מוגדר כ־other מכיוון שכל רשומה מקבלת את הרישיון של המאמר המקורי שממנו הופקה, כגון CC BY או גרסאות לא מסחריות. המשמעות היא שאין אישור גורף לשימוש מסחרי, ומי שרוצה לאמן מודל למוצר מסחרי חייב לסנן את הדאטהסט לפי שדה ה־license בכל שורה.

הרישיון המלא ב־Hugging Face ↗