GPT
B

big_patent

קוד פתוח

NortheasternUniversitycc-by-4.02022-03-02

  • patent-summarization

מאגר ענק של מסמכי פטנטים אמריקאיים עם תקצירים שנכתבו בידי אדם. הוא מיועד למי שמאמן מודלים לתקצור טקסטים טכניים ארוכים ומורכבים במיוחד.

  • 5,885הורדות בחודש
  • 72לייקים

מה זה

המאגר מכיל 1.3 מיליון רשומות שמבוססות על בקשות פטנט מארצות הברית. כל רשומה כוללת שני שדות טקסט בלבד, תיאור הפטנט המלא מתוך גוף המסמך ותקציר הפטנט שנכתב על ידי מגישי הבקשה. הנתונים מחולקים לתשע קטגוריות סיווג רשמיות של משרד הפטנטים, שמסומנות באותיות a עד y, ומכסות תחומים שנעים בין כימיה, הנדסת מכונות וטקסטיל ועד חשמל, פיזיקה וצרכים אנושיים.

הכרטיס לא מפרט את הליך האיסוף, את אופן הנירמול או אילו סינונים בוצעו על הטקסט מעבר לחילוץ השדות. החלוקה הפנימית מציעה סט אימון כולל של 1,207,222 מסמכים, לצד סטים של ולידציה ובדיקה שמכילים 67,068 ו־67,072 רשומות בהתאמה. ניתן למשוך את כל הנתונים יחד או לבחור קטגוריית סיווג ספציפית בהתאם לתחום הטכנולוגי שמעניין אתכם.

מתאים ל

  • תקצור מסמכים טכניים

    אימון מודלים שמסוגלים לקרוא מפרטים הנדסיים ארוכים ולייצר מהם תקציר תמציתי.

  • הערכת ביצועי מודלים

    בדיקת יכולת התמודדות של מודלי שפה קיימים עם טקסט משפטי מורכב על סט המבחן.

  • ניתוח פטנטים לפי תחום

    אימון ממוקד על קטגוריית סיווג בודדת, כמו חשמל או כימיה, לעבודה בענף ספציפי.

איפה זה נופל

הכרטיס לא מפרסם מידע על הטיות, סיכונים או הליך הניקוי, והשדות האלה פשוט ריקים. הטקסטים כולם באנגלית ומנוסחים בשפה משפטית וטכנית כבדה מאוד, שלא דומה לשום שפה יומיומית או עיתונאית. אם המטרה שלכם היא מודל תקצור כללי, הדאטהסט הזה ירגיל אותו למבנים מסורבלים ולטרמינולוגיה שלא מתאימה לרוב המוצרים. בנוסף, אין תמיכה בעברית כלל, וטווח השנים שבו נרשמו הפטנטים אינו מצוין בתיעוד.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט לפיתוח מסחרי?

כן. רישיון CC-BY-4.0 מתיר שימוש מסחרי מלא, כולל אימון מודלים שמיועדים למכירה. החובה היחידה שלכם היא לתת ייחוס ליוצרי המאגר.

האם יש במאגר טקסטים בעברית?

לא. כל הנתונים מבוססים על פטנטים שנרשמו בארצות הברית והשפה היחידה במאגר היא אנגלית.

איך אפשר לטעון רק תחום טכנולוגי מסוים ולא את הכל?

אפשר להעביר את קוד הסיווג הרצוי, למשל c לכימיה או h לחשמל, ישירות לפקודת הטעינה בקוד. בצורה הזו נמנעים מהורדה של כל 1.3 מיליון המסמכים ומקבלים רק את החלק הרלוונטי.

מאיפה הגיעו התקצירים של הפטנטים?

התקצירים מגיעים מתוך שדה התקציר המקורי של בקשת הפטנט כפי שהוגשה למשרד הפטנטים האמריקאי. מדובר בטקסט שנכתב במקור על ידי בני אדם, לרוב עורכי פטנטים או הממציאים עצמם.

איך טוענים

טוענים את הנתונים דרך ספריית datasets באמצעות פקודת load_dataset עם המזהה big_patent. ברירת המחדל מושכת את גרסה 2.1.2 שכוללת אותיות גדולות וקטנות כמחרוזות גולמיות, עבור כל הקטגוריות יחד, אך אפשר להעביר אות סיווג ספציפית כדי לקבל רק תחום מסוים. המאגר מאוחסן בפורמט פרקט שמחולק ל־189 קבצים, והגישה אליו חופשית לגמרי ללא צורך באישור מוקדם או בהתחברות לחשבון.

from datasets import load_dataset

ds = load_dataset("NortheasternUniversity/big_patent")

הרישיון

הרישיון המדווח הוא CC-BY-4.0. המשמעות היא שמותר להשתמש במידע למטרות מחקר וגם למוצרים מסחריים, ואפשר לשנות את הנתונים ולאמן עליהם מודלים בחופשיות. התנאי היחיד שהרישיון דורש הוא מתן קרדיט ברור למפרסמים המקוריים.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗