GPT
F

financial_phrasebank

קוד פתוח

takalacc-by-nc-sa-3.02022-03-02

  • finance

המאגר כולל אלפי משפטים מחדשות פיננסיות שמסווגים לפי סנטימנט מנקודת מבט של משקיע. הוא שימושי למי שרוצה לבחון מודל על טקסט כלכלי אמיתי עם תוויות שנקבעו בידי כמה מעריכים במקביל.

  • 5,684הורדות בחודש
  • 273לייקים

מה זה

הרשומות מורכבות ממשפטים בודדים בשפה האנגלית, כאשר לכל משפט מוצמד סנטימנט מסוג חיובי, שלילי או ניטרלי. הנתונים נלקחו מתוך עשרת אלפים כתבות חדשותיות על חברות שנסחרו במדד OMX Helsinki, אשר הורדו ממאגר LexisNexis בעזרת סקרייפר. מתוכן בודדו רק משפטים שהכילו ישויות מתוך לקסיקון ייעודי, ומתוכם נדגמו כחמשת אלפים משפטים סופיים.

התיוג נעשה על ידי 16 אנשים, מתוכם שלושה חוקרים ו־13 סטודנטים לתואר שני בכלכלה ומנהל עסקים. כל משפט קיבל בין חמישה לשמונה תיוגים עצמאיים. במקום חלוקה רגילה לאימון ומבחן, המאגר מחולק לארבע תצורות לפי רמת ההסכמה בין המתייגים: הסכמה של לפחות 50 אחוז עם 4,846 רשומות, 66 אחוז עם 4,217 רשומות, 75 אחוז עם 3,453 רשומות, וקבוצה של 2,264 רשומות שבהן הייתה הסכמה מלאה של מאה אחוז בין כולם.

מתאים ל

  • בנצ'מרק לסנטימנט פיננסי

    בדיקת דיוק של מודלי שפה על טקסט כלכלי בעזרת תצורת ההסכמה המלאה.

  • אימון מסווג ייעודי למניות

    אימון מודל קל לסיווג כותרות חדשותיות להשפעה חיובית או שלילית על מחיר מניה.

  • מחקר על עקביות תיוג

    השוואת ביצועי מודל על פני רמות שונות של הסכמה בין מעריכים אנושיים.

איפה זה נופל

ההטיה המרכזית נובעת מכך שכל 16 המתייגים הגיעו מאותו מוסד אקדמי, בית הספר למנהל עסקים של אוניברסיטת Aalto, מה שעלול ליצור תפיסה אחידה מדי של השוק. בנוסף, הטקסטים מוגבלים לחברות שנסחרו בבורסת הלסינקי ולחדשות באנגלית בלבד. אין כאן נתונים בעברית, ואין חלוקה מובנית לסט מבחן חיצוני, כך שחובה להקפיד על אסטרטגיית חלוקה נכונה כדי למנוע דליפת מידע.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא. הרישיון הוא CC BY-NC-SA 3.0 והוא אוסר במפורש שימוש מסחרי. מי שמעוניין להשתמש בנתונים במוצר מסחרי נדרש ליצור קשר במייל עם יוצרי המאגר כדי להסדיר רישיון מתאים.

האם יש במאגר טקסטים בעברית?

לא. כל הנתונים נאספו מדיווחים ומאמרים בשפה האנגלית בלבד, מתוך מאגר חדשות על חברות הרשומות בפינלנד.

איך מחולק הדאטהסט לאימון ובדיקה?

אין חלוקה מובנית ל־train, validation או test. כל הנתונים יושבים תחת מפתח יחיד, ותצטרכו לבצע את הפיצול בעצמכם בקוד לפני האימון.

באיזו תצורה כדאי להשתמש?

התצורה תלויה בצורך. אם רוצים נתונים נקיים לחלוטין לבדיקה מדויקת, תצורת sentences_allagree מתאימה כי כל המתייגים הסכימו בה. אם מחפשים כמות גדולה יותר של דוגמאות לאימון, תצורת sentences_50agree מספקת את הנפח המרבי.

איך טוענים

טוענים את המאגר ישירות בספריית datasets עם הפקודה load_dataset, בלי צורך בבקשת גישה מיוחדת. צריך לציין את התצורה הרצויה, למשל sentences_allagree להסכמה מלאה או sentences_50agree למאגר הרחב יותר. המבנה פשוט מאוד ומכיל רק שני שדות: sentence שמכיל את הטקסט, ו־label שמכיל מחרוזת עם הסיווג. כל הנתונים מגיעים תחת ספליט יחיד של train, ולכן אתם צריכים לפצל בעצמכם את הנתונים לסט אימון, ולידציה ובדיקה לפני תחילת העבודה.

from datasets import load_dataset

ds = load_dataset("takala/financial_phrasebank")

הרישיון

המאגר מופץ תחת רישיון CC BY-NC-SA 3.0. אסור להשתמש בו לצרכים מסחריים מכל סוג ללא קבלת אישור ורכישת רישיון מול יוצרי המאגר. בנוסף, חובה לתת ייחוס ליוצרים, וכל נגזרת של המאגר או תוצר שמבוסס עליו חייב להיות מופץ תחת אותו רישיון בדיוק.

הרישיון המלא ב־Hugging Face ↗