GPT
F

Finance-Instruct-500k

קוד פתוח

Josephgflowersapache-2.02025-01-10

  • finance
  • fine-tuning
  • conversational-ai
  • named-entity-recognition
  • sentiment-analysis

אוסף של מעל חצי מיליון הוראות ושיחות בעולם הפיננסי לאימון מודלי שפה. הוא מאחד 37 מקורות שונים למבנה אחיד של מערכת, משתמש ועוזר.

  • 687הורדות בחודש
  • 239לייקים

מה זה

המאגר מכיל מעל 500,000 רשומות שמחולקות לשלושה שדות קבועים: system, user ו־assistant. המבנה מיועד לשיחות רב-שלביות, שאלות ותשובות, ניתוח סנטימנט פיננסי, תיוג ישויות ותיוג XBRL. במשימות RAG, ההקשר החיצוני מוצמד ישירות לתחילת השדה של המשתמש. אין כאן חלוקה מובנית לחלקי אימון ומבחן, אלא קובץ יחיד בשם train.json לצד התיעוד.

התוכן נאסף ממיזוג של 37 מאגרים שונים שעברו סינון לנושאים פיננסיים, ביניהם Sujet-Finance-Instruct-177k, BAAI, AdaptLLM, מאגרי טוויטר ומאגרים כלליים כמו Open-Orca, Aya ו־Cosmopedia. תהליך העיבוד כלל הסרת מעל 60,000 כפילויות, ניקוי תווים שאינם אסקי, תיקוני פיסוק והאחדה לפורמט השיחה, לצד הערה של היוצר שתגיות מטא-דאטה מסוימות אבדו בתהליך הניקוי.

מתאים ל

  • אימון עוזר פיננסי

    כוונון מודלי שיחה לשאלות ותשובות, הסבר מושגים כלכליים וסימולציות מסחר באנגלית.

  • חילוץ ישויות ותיוג XBRL

    זיהוי מונחים, סיווג כתובות פיננסיות וסימון ישויות מתוך דוחות ומסמכים מובנים.

  • ניתוח סנטימנט בשוק

    סיווג טקסטים וחדשות כלכליות להגדרות חיובי, שלילי, ניטרלי, שורי או דובי.

איפה זה נופל

היוצר מציין בגלוי שהמאגר מכיל רעש. יש בו רשומות שאינן פיננסיות, מקטעים שבורים במבנה השיחה, וטקסטים שהגיעו ממאגרי אימון מקדים כמו Cosmopedia בלי התאמה מלאה להוראות. בנוסף, קיימות רשומות RAG סינתטיות שנוצרו ללא המסמכים המקוריים שאליהם הן מתייחסות. מבחינת שפות, המאגר ממוקד בעיקר באנגלית עם כיסוי מסוים לסינית, ואין בו שום התייחסות לעברית או לשוק המקומי בישראל. אסור להכניס מודל שאומן עליו למוצר שנותן ייעוץ אמיתי בלי סינון ידני מקדים ובדיקת עובדות קפדנית.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, הרישיון המוצהר הוא apache-2.0, והוא מאפשר שימוש מסחרי מלא ואימון מודלים סגורים. יחד עם זאת, המאגר הוא מיזוג של 37 מקורות שונים, ולכן לפני השקעה גדולה כדאי לבדוק שלא השתרבב פנימה מקור עם רישיון מגביל יותר.

האם המאגר כולל עברית או רגולציה ישראלית?

לא. המאגר מתרכז באנגלית, עם תוספת של סינית ממקור של BAAI ומעט נתונים רב-לשוניים כלליים. הוא אינו כולל נתונים על שוק ההון הישראלי, מונחים בעברית או דיווחים מקומיים.

מאיפה הנתונים הגיעו ואיך הם נאספו?

היוצר חיבר יחד 37 מאגרים קיימים, חלקם ייעודיים לכלכלה כמו Sujet-Finance ו־Financial-NER, וחלקם כלליים כמו Open-Orca ו־Aya. הוא סינן את התוכן, הסיר מעל 60,000 כפילויות, ואיחד את הכל לפורמט שיחה יחיד.

האם הנתונים נקיים ומוכנים לאימון מידי?

לא לגמרי. הכרטיס מציין שיש במאגר רעש, טקסטים לא פיננסיים, מקטעי שיחה שבורים ושאילתות RAG שחסר בהן המסמך המקורי. מומלץ לבצע סינון נוסף משלכם לפני שמתחילים ריצת אימון יקרה.

איך טוענים

טוענים את המאגר ישירות עם ספריית datasets של Hugging Face בפקודה load_dataset לתוך המזהה Josephgflowers/Finance-Instruct-500k. אין צורך באישור גישה או במפתח מיוחד. הקובץ המרכזי מגיע בפורמט json, ובפועל צריך לקרוא רק את שלושת השדות הבסיסיים system, user ו־assistant כדי להזין אותם לתהליך הכוונון של המודל.

from datasets import load_dataset

ds = load_dataset("Josephgflowers/Finance-Instruct-500k")

הרישיון

המאגר מופץ ברישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי חופשי, שינוי של המידע ואימון מודלים ללא תשלום תמלוגים. אתם מחויבים לתת קרדיט למפרסם ולצרף עותק של הרישיון המקורי. אין כאן דרישה של שיתוף זהה, כך שמותר לסגור את הקוד או המודל שתאמנו עליו, אך כדאי לזכור שחלק מ־37 המקורות המקוריים עשויים להחזיק תנאים משלהם מעבר להצהרה בכרטיס.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗