GPT
G

govreport-summarization

קוד פתוח

ccdvרישיון לא דווח2022-03-02

  • conditional-text-generation

דוחות ממשלתיים ארוכים עם תקצירים תואמים באנגלית, שנועדו לבחון מודלים על טקסט באורך מלא. מי שמחפש לתרגל תמצות של מסמכים מורכבים מעבר לפסקאות בודדות ימצא כאן בדיוק את זה.

  • 6,786הורדות בחודש
  • 61לייקים

מה זה

המאגר מיועד למשימות תמצות של מסמכים ארוכים, ומבוסס על קוד ומחקר של לויאנג הואנג ושותפיו משנת 2021 שעסק במנגנוני קשב יעילים. כל רשומה כוללת שלושה שדות פשוטים: מזהה מסמך, גוף הדוח המלא, ותקציר קיים שמיועד לשמש כתווית יעד. הטקסטים נשענים על דוחות רשמיים, מה שאומר ניסוחים כבדים ומבנה פורמלי.

החלוקה הפנימית מוגדרת מראש לשלושה חלקים מוכנים. קבוצת האימון כוללת 17,517 דוחות, קבוצת האימות כוללת 973 דוחות, וקבוצת המבחן כוללת גם היא 973 דוחות. לפי הבדיקות של יוצרי המאגר עם טוקנייזר של רוברטה, הדוחות מגיעים בממוצע לפחות מ־9,000 טוקנים, בזמן שהתקצירים עומדים על פחות מ־500 טוקנים.

מתאים ל

  • אימון לתמצות מסמכים ארוכים

    לימוד מודלים איך לקרוא אלפי מילים ולהפיק תקציר ממוקד של כמה פסקאות.

  • הערכת חלונות הקשר רחבים

    בדיקת ביצועים של מודלי שפה על טקסט עמוס בפרטים שמגיע לאלפי טוקנים.

  • מחקר על מנגנוני קשב

    בחינת ארכיטקטורות שמנסות להתמודד עם זיכרון ועיבוד יעיל של דוחות כבדים.

איפה זה נופל

אין כאן מילה אחת בעברית. כל הדוחות והתקצירים כתובים באנגלית בלבד, ומגיעים מעולם התוכן של ממשל ומדיניות ציבורית. מי שבונה מודל לשיחות יומיומיות, לטקסטים קצרים או לעולם המשפטי הישראלי יקבל נתונים לא רלוונטיים במבנה שלהם. בנוסף, המסמכים ארוכים מאוד ודורשים משאבי מחשוב כבדים וחלונות הקשר רחבים, כך שאי אפשר להריץ אותם על חומרה חלשה בלי לחתוך חלק גדול מהטקסט.

שאלות
נפוצות

האם מותר להשתמש במאגר למוצר מסחרי?

לא מומלץ בכלל. יוצרי המאגר לא הגדירו רישיון בכרטיס, ובהיעדר היתר שימוש מפורש יש סיכון משפטי באימון מודל שמיועד למכירה או לשירות מסחרי.

האם הדאטהסט כולל טקסטים בעברית?

לא. כל הנתונים מבוססים על דוחות באנגלית בלבד, ואינם מכילים שפות נוספות.

באיזה פורמט הקבצים מגיעים?

הנתונים מחולקים לקובצי פרקט לפי קבוצות של אימון, בדיקה ואימות. אפשר לטעון אותם בקלות בסביבות פייתון סטנדרטיות.

מה מבדיל אותו ממאגרי תמצות אחרים?

אורך הטקסט. בזמן שרוב המאגרים מציעים ידיעות חדשותיות קצרות, כאן מדובר בדוחות ממשלתיים שמגיעים לאלפי טוקנים מול תקציר של מאות בודדות.

איך טוענים

טוענים את המאגר ישירות דרך ספריית הדאטהסטס הרגילה בפורמט פרקט, בלי צורך בטופסי גישה או אישורים מיוחדים. המאגר מכיל שישה קבצים, כולל קובצי פרקט שמחלקים את קבוצת האימון לשני חלקים לצד קבצים בודדים לאימות ולמבחן. כדי להריץ עליו סקריפטים סטנדרטיים של האגינג פייס, צריך רק למפות את שמות העמודות לקלט ולפלט, כלומר לקשר בין שדה הדוח לטקסט המקור ובין שדה התקציר לתוצאה המבוקשת.

from datasets import load_dataset

ds = load_dataset("ccdv/govreport-summarization")

הרישיון

היוצרים לא ציינו רישיון מפורש במאגר. מצב כזה משאיר את השימוש המסחרי באזור אפור ומסוכן משפטית, כי אין היתר כתוב להפיץ או לאמן מוצר מסחרי על הנתונים. לצורכי מחקר והערכה אקדמית אפשר לעבוד איתו תוך מתן ציטוט למאמר המקורי מ־2021, אבל לחברות וסטארטאפים עדיף לחפש חלופה עם רישיון ברור.

הרישיון המלא ב־Hugging Face ↗