GPT
S

Sujet-Finance-Instruct-177k

קוד פתוח

sujet-aiapache-2.02024-04-01

  • finance

אוסף של כמעט 178 אלף הוראות פיננסיות מנופות מכפילויות, שנועד לאימון מודלים על משימות שוק ההון. הוא מאחד 18 מקורות שונים למבנה אחיד של שאלות, תשובות ופרומפטים.

  • 1,235הורדות בחודש
  • 84לייקים

מה זה

המאגר מאגד 177,597 רשומות מתוך 18 מאגרי מידע שונים בהאגינג פייס, כשהמקור הבולט ביותר הוא finance-alpaca עם מעל 58 אלף דוגמאות. הנתונים מחולקים לשבע משימות מרכזיות, ביניהן ניתוח סנטימנט פיננסי שכולל מעל 44 אלף רשומות, מענה לשאלות עם ובלי הקשר עם קרוב ל־80 אלף רשומות יחד, שאלות כן ולא, וסיווג נושאים.

כל שורה כוללת את הפרומפט המוכן לאימון עם הוראת מערכת מותאמת, את התשובה הצפויה, את הטקסט המקורי של המשתמש, ואת שם המאגר שממנו הגיע המידע. בחלק משיחות ה־QA מתווספים מזהה שיחה ואינדקס שלבים כדי לאפשר אימון על היסטוריה מתגלגלת. בתהליך ההכנה המפתחים הסירו מעל 60 אלף כפילויות וניקו תווים שאינם תווי Ascii.

מתאים ל

  • אימון צ׳אט פיננסי

    כוונון מודלי שפה למתן תשובות על שאלות כלכליות וניהול שיחה רב שלבית בהקשר פיננסי.

  • ניתוח סנטימנט לשוק ההון

    זיהוי מגמות שוריות או דוביות בטקסטים וחדשות כלכליות בעזרת עשרות אלפי דוגמאות מתויגות.

  • סיווג טקסטים ומאמרים

    חלוקה אוטומטית של פוסטים וידיעות כלכליות לקטגוריות נושאיות רלוונטיות לפי משימות המאגר.

איפה זה נופל

הנתונים קיימים באנגלית בלבד. כחלק מתהליך הניקוי הוסרו כל תווי ה־non-Ascii, כך שאם יש לכם כוונה לעבוד על דוחות או מושגים פיננסיים בשפות אחרות, כולל עברית, המאגר הזה לא ייתן לכם מענה. בנוסף, חלוקת המשימות אינה שווה, כאשר זיהוי ישויות וסנטימנט ברמת ישות כולל פחות מאלף דוגמאות בלבד. חלק מהמקורות מבוססים על נתוני טוויטר וחדשות ישנות, ולכן חובה לבדוק איכות והתאמה לפני שמשלבים מודל כזה במערכת שמקבלת החלטות השקעה.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן. הדאטהסט מוגדר תחת רישיון apache-2.0 שמתיר שימוש מסחרי מלא, כולל אימון מודלים סגורים. עליכם רק לשמור על הקרדיט ונוסח הרישיון המקורי.

האם הדאטהסט מתאים לעבודה בעברית?

לא. כל הנתונים במאגר הם באנגלית בלבד, ויוצרי המאגר אף ניקו ממנו באופן יזום כל תו שאינו Ascii, כך שאין בו שום תמיכה בשפות אחרות.

איך נאסף המידע שבמאגר?

היוצרים איחדו נתונים מתוך 18 מאגרים פיננסיים קיימים בהאגינג פייס. לאחר האיחוד הם ביצעו ניפוי והסירו מעל 60 אלף כפילויות, בנו פרומפטים מותאמים לכל סוג משימה וארגנו הכל בפורמט אחיד.

איך טוענים

הנתונים יושבים בקובץ CSV יחיד בשם Sujet-Finance-Instruct-177k.csv, ללא צורך באישור גישה או הרשמה מיוחדת. אפשר למשוך אותו ישירות דרך ספריית datasets הרגילה של האגינג פייס. בעבודה מולו תשתמשו בעיקר בעמודת inputs שמרכזת את ההוראה יחד עם ה־system prompt, ובעמודת answer שמשמשת כלייבל. אם תרצו לאמן רק על משימות ספציפיות כמו סנטימנט או שאלות הקשר, עמודת task_type מאפשרת לכם לסנן את השורות הרלוונטיות בלי לפרק את הטקסט ידנית.

from datasets import load_dataset

ds = load_dataset("sujet-ai/Sujet-Finance-Instruct-177k")

הרישיון

המאגר מופץ תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי חופשי, שינוי של הנתונים, הפצה שלהם, ושילוב במודלים מסחריים בלי חובה לשתף את הקוד או את המודל המאומן באותו רישיון. התנאי העיקרי הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי בקבצים שתפיצו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗