GPT
L

Llama-3-8B-Instruct-Finance-RAG-GGUF

קוד פתוח

QuantFactoryllama32024-10-20

  • transformers
  • gguf
  • finance
  • text-generation
  • en

גרסה מכווצת של למה 3 שאימנו ספציפית לענות על שאלות מתוך דוחות כספיים. מתאים למי שרוצה לחבר מודל מקומי לצ'אט על מסמכי 10-K בלי להסתמך על ענן.

  • 67.7 GBמשקל הקבצים
  • 1,205הורדות בחודש
  • 64לייקים

מה זה

מדובר בהסבה לפורמט GGUF של מודל שעבר כוונון עדין על בסיס למה 3 שמונה מיליארד פרמטרים. האימון המקורי התבסס על ארבעת אלפים דוגמאות מתוך מאגר שאלות ותשובות של דוחות 10-K אמריקאיים, באמצעות מתאם לורה. המטרה המוגדרת שלו היא שליפת נתונים מתוך קונטקסט נתון, כלומר עבודה בתוך ארכיטקטורת RAG פיננסית.

בניגוד למודל הבסיס הכללי, הכוונון כאן מכריח אותו להיצמד למידע שמופיע בקטע המצורף ולחלץ תשובות קצרות, כמו מספרים מדויקים של רווח נקי או הכנסות, במקום לנסח פסקאות ארוכות. הכרטיס לא כולל מבחני ביצועים כמותיים או ציונים רשמיים, אלא רק מציג דוגמת שימוש שמראה חילוץ של ערך דולרי מדויק מתוך טקסט קצר. אין פה ידע פיננסי עצמאי עמוק, אלא אימון על ציות להוראות מבוססות הקשר פיננסי באנגלית בלבד.

מתאים ל

  • חילוץ נתונים מדוחות 10-K

    שליפת מדדים ומספרים מתוך פסקאות של דוחות אמריקאיים ישירות לתוך שדות מוגדרים.

  • בוט מסמכים פיננסיים מקומי

    מענה על שאלות עובדים מתוך קבצי מאזן באנגלית בלי להוציא מידע רגיש לרשת.

  • בדיקת נאותות על טקסט קיים

    הצלבת שאלות מול פסקאות של הצהרות פיננסיות לווידוא תאימות נתונים.

איפה זה נופל

המודל אומן על ארבעת אלפים דוגמאות בלבד, שזה מאגר קטן מאוד לתחום רחב כמו פיננסים. הוא מוגדר אך ורק לאנגלית, ולכן לא שווה לנסות להריץ עליו דוחות כספיים בעברית של חברות מהבורסה בתל אביב. בנוסף, הוא מוגבל למבנה פרומפט קשיח שמחייב קונטקסט ברור. אם תשאלו אותו שאלה בלי לספק את הנתונים בגוף הפנייה, אין שום ערובה שהוא ידע את התשובה או שהוא לא ימציא מספרים שנשמעים הגיוניים.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה לניתוח חברות ישראליות בעברית?

לא כדאי. המודל אומן על דוחות באנגלית ובמתכונת אמריקאית של רשות ניירות הערך שם. הוא לא מותאם למונחים החשבונאיים בעברית ויחזיר תוצאות מקוטעות או שגויות.

האם המודל יודע לחשב מכפילים או להסיק מסקנות שלא כתובות בדוח?

הוא לא בנוי לזה. הכוונון הספציפי שעשו לו מלמד אותו לחלץ עובדות קיימות מתוך קטע שסופק לו, לא לבצע הערכות שווי או ניתוחים כלכליים מורכבים.

למה להשתמש בזה ולא במודל למה 3 הרגיל?

האימון הנוסף מכריח אותו לספק תשובות תמציתיות ומדויקות לפי ההקשר, בלי הקדמות ובלי ניסוחים מיותרים, מה שמקל על בניית צינור RAG יציב.

איך מריצים

המודל מגיע כקובצי GGUF ומיועד להרצה דרך llama.cpp, מה שאומר שאפשר להריץ אותו ישירות על מעבד ומאיץ גרפי ביתי. שמונה מיליארד פרמטרים בכימות סטנדרטי תופסים בין ארבעה לשמונה גיגה זיכרון וידאו, תלוי ברמת הדחיסה של הקובץ הבודד שבוחרים להוריד מתוך המאגר, כך שהוא רץ בקלות על כרטיס מסך פשוט או על מחשבי מק עם זיכרון אחוד.

אם כל מה שצריך זה לבדוק כמה דוחות פעם ביום, שווה להרים אותו מקומית על המחשב. אבל אם צריך לנתח מאות מסמכים במקביל בעומס משתנה, להחזיק שרת ייעודי בשבילו יהיה יקר ומסורבל יותר מקריאה ישירה למודל גדול דרך ספק צד שלישי.

ollama run hf.co/QuantFactory/Llama-3-8B-Instruct-Finance-RAG-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא רישיון למה 3 המקורי של מטא. הוא מאפשר שימוש מסחרי חופשי לרוב החברות, כל עוד מספר המשתמשים החודשיים הפעילים לא חוצה את רף שבע מאות המיליון. צריך לשמור על תנאי השימוש המקובלים של מטא ולא להשתמש בפלט כדי לאמן מודלים מתחרים.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗