GPT
L

Llama3-ChatQA-1.5-8B

קוד פתוח

nvidiallama32024-04-28

  • transformers
  • safetensors
  • llama
  • text-generation
  • nvidia

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

גרסה מכווננת של לאמה 3 שמיועדת למענה על שאלות מתוך מסמכים ושיחות מרובות תורות. היא נבנתה במיוחד למערכות אחזור מידע שדורשות ניתוח נתונים וטבלאות.

  • 8Bפרמטרים
  • 8,192טוקנים בהקשר
  • 15.0 GBמשקל הקבצים
  • 10,365הורדות בחודש

מה זה

מדובר בהתאמה של אנבידיה על גבי מודל הבסיס Llama 3 8B, שמתמקדת כולה בתרחישי שיחה סביב הקשר ומסמכים. צוות הפיתוח הוסיף נתוני אימון לשיפור יכולות חישוב וקריאת טבלאות, תחום שבו מודלים קטנים נוטים להסתבך בו בקלות.

במדד ChatRAG Bench המודל עוקף מודלים גדולים ממנו בהרבה בממוצע הכללי, עם ציון של 55.17 לעומת 54.03 של GPT-4-Turbo וציון של 52.52 לגרסת 70B של לאמה 3. כשמנטרלים מבחן ספציפי שהופיע בנתוני האימון שלו, הממוצע יורד ל־53.99, שזה עדיין צמוד מאוד ל־GPT-4. במבחנים של ניתוח פיננסי או שיחות סביב מסמך בודד הוא מפגין דיוק שחוסך מעבר למודלים כבדים ויקרים.

מתאים ל

  • בוט מסמכים פיננסיים

    הוא מצטיין בטבלאות ובמבחני ConvFinQA מורכבים ביחס לגודלו.

  • מענה שאלות ממאגר ידע

    האימון שלו מותאם לשליפת תשובות מדויקות מקטעי טקסט חיצוניים.

  • שירות לקוחות רב שלבי

    שומר על הקשר השיחה והשאלות הקודמות מול מסמכי מדיניות.

איפה זה נופל

המודל הזה אומן סביב הקשר נתון, ובלי מסמך ברקע הביצועים שלו צונחים והוא לא מיועד לשיחה כללית חופשית. בנוסף, חלון ההקשר שלו מוגבל ל־8,192 טוקנים, מה שאומר שאי אפשר לדחוף לתוכו ספרים שלמים אלא חייבים להשתמש במנגנון אחזור שמפרק טקסט לחלקים קטנים. החיסרון המשמעותי למשתמש ישראלי הוא היעדר תמיכה רשמית בעברית, שכן המודל מוגדר ומכוונן לאנגלית בלבד, כך שבשפות אחרות התוצאות לא מובטחות וידרשו בדיקה יסודית.

אותה משפחה

Llama3-ChatQA-1.5 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל יודע לקרוא עברית?

המודל מוגדר רשמית לאנגלית בלבד. מודל הבסיס של מטא כולל מעט ידע בשפות נוספות, אבל הכוונון הספציפי למסמכים ולטבלאות נעשה באנגלית, ולכן מענה בעברית צפוי להיות חלש ומקוטע.

איך דוחפים לו קבצים ארוכים עם חלון של 8K?

לא מעלים מסמכים שלמים בבת אחת. משתמשים במודל אחזור כמו Dragon של אנבידיה שמחפש בקבצים, ומעבירים לפרומפט רק את הפסקאות הרלוונטיות ביותר לשאלת המשתמש.

איך מריצים

המשקל הכולל של הקבצים עומד על 15 גיגה בייט בפורמט float16, כך שצריך כרטיס מסך עם לפחות 16 עד 24 גיגה בייט של זיכרון כדי לטעון אותו ולהריץ הסקה בצורה חלקה. הוא רץ דרך ספריית transformers הרגילה, אבל חובה להקפיד על מבנה הפרומפט המדויק שאנבידיה הגדירה, שכולל תפקיד מערכת ייעודי להפרדה בין ההקשר לשאלה.

אם יש לכם שרת מקומי מתאים, שווה להריץ אותו ישירות כדי לחסוך עלויות שוטפות ולשמור על פרטיות המסמכים. אם אתם צריכים רק שאילתות בודדות ביום או שאין לכם חומרה מתאימה, עדיף להשתמש ב־API חיצוני שמארח את לאמה 3 מאשר להחזיק שרת יקר ייעודי.

from transformers import pipeline

pipe = pipeline("text-generation", model="nvidia/Llama3-ChatQA-1.5-8B")
print(pipe("שלום"))

הרישיון

השימוש כפוף לרישיון הקהילתי של מטא עבור לאמה 3. הרישיון מאפשר שימוש מסחרי חופשי לרוב החברות, כל עוד מספר המשתמשים החודשי של המוצר שלכם לא חוצה את רף 700 המיליון בעת ההשקה. אם אתם מתכננים להפיץ מוצר מסחרי קטן או בינוני, אפשר להשתמש בו ישירות.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗