GPT
F

finance-embeddings-investopedia

קוד פתוח

FinLangcc-by-nc-4.02024-04-22

  • sentence-transformers
  • safetensors
  • bert
  • feature-extraction
  • sentence-similarity

מודל שיודע לחלץ וקטורים ייעודיים למונחים פיננסיים על בסיס התוכן של אינווסטופדיה. הוא מתאים למי שבונה חיפוש סמנטי או RAG באנגלית ורוצה הבנה של מושגי שוק ההון.

  • 109Mפרמטרים
  • 512טוקנים בהקשר
  • 419 MBמשקל הקבצים
  • 12,234הורדות בחודש

מה זה

מדובר בהתאמה של המודל BAAI/bge-base-en-v1.5, שעבר אימון ייעודי על מאגר נתונים פתוח של אינווסטופדיה כדי לטפל בדקויות של שוק ההון. הוא מייצר וקטורים של 768 ממדים מתוך טקסטים ומיועד בעיקר לצימוד של שאלות ותשובות, קלאסטרינג או חיפוש מסמכים פיננסיים.

בניגוד למודלי שפה כלליים בגודל הזה שעלולים לפספס הקשרים כלכליים ספציפיים, הוא מנסה לתפוס קשרים בין מושגים פיננסיים מורכבים כמו ארנקי קריפטו או מניות. המפתחים בדקו אותו מול זוגות משפטים של אינווסטופדיה כדי לוודא דיוק פיננסי, ובמקביל הריצו מבחנים על מאגרים כמו MSMARCO ו־Yahoo Answers כדי לוודא שהוא לא שכח אנגלית כללית, אם כי הם לא פרסמו ציונים מספריים סופיים בכרטיס.

מתאים ל

  • חיפוש סמנטי בדוחות באנגלית

    מאתר פסקאות רלוונטיות לפי מושגים פיננסיים מורכבים ולא רק לפי התאמת מילים יבשה.

  • סינון מסמכים ב־RAG פיננסי

    שליפת הקטעים המדויקים מתוך אינדקס טקסטים כלכליים לפני שמזינים אותם למודל שפה.

  • חלוקת שאילתות לקבוצות

    קיבוץ של שאלות משתמשים בנושאי השקעות וחסכונות לפי דמיון סמנטי.

איפה זה נופל

הבעיה המרכזית היא היעדר ציוני ביצועים מדויקים בכרטיס, כך שאי אפשר לדעת מראש כמה הוא באמת עדיף על מודל הבסיס של BGE בלי לבדוק לבד. מעבר לזה, חלון ההקשר מוגבל ל־512 טוקנים בלבד, מה שמחייב לחתוך מסמכים ארוכים כמו דוחות כספיים לקטעים קטנים מאוד. המודל אומן על אנגלית בלבד ולא יזהה מסמכים פיננסיים בעברית.

שאלות
נפוצות

אפשר להשתמש בו לחיפוש דוחות של חברות מהבורסה בתל אביב?

לא אם הדוחות בעברית. המודל אומן כולו על נתונים באנגלית של אינווסטופדיה, ולא יבין טקסטים או מונחים מקומיים בשפה העברית.

האם הוא מתאים למוצר מסחרי שפתוח למשתמשים בתשלום?

ממש לא. המפתחים הגדירו רישיון לא מסחרי בגלל הדאטה שעליו הוא אומן, כך שאפשר להריץ אותו רק בסביבות מחקר ופיתוח פנימיות.

איך מריצים

בגלל המשקל הקל של 419 מגה בייט ופחות מ־110 מיליון פרמטרים, קל מאוד להריץ אותו ישירות על מעבד מקומי או בכל שרת בסיסי בלי לפתוח כרטיס מסך יקר. טוענים אותו ישירות דרך ספריית sentence-transformers או דרך LlamaIndex בכמה שורות פשוטות של פייתון.

אין סיבה אמיתית לשלם על שירות ענן חיצוני בשביל מודל כזה קטן. אתם פשוט מריצים אותו מקומית בתהליך העיבוד של המסמכים וחוסכים תלות ברשת ועלויות קריאה לשירותים חיצוניים.

from sentence_transformers import SentenceTransformer

m = SentenceTransformer("FinLang/finance-embeddings-investopedia")
v = m.encode(["שלום עולם"])

הרישיון

הרישיון הוא cc-by-nc-4.0. זה אומר במילים ברורות שמותר להשתמש במודל למחקר או לפרויקטים אישיים, אבל אסור לחלוטין לשלב אותו במוצר מסחרי, באפליקציה בתשלום או במערכת של חברה.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗