GPT
L

Llama3-ChatQA-1.5-70B

קוד פתוח

nvidiallama32024-04-28

  • transformers
  • safetensors
  • llama
  • text-generation
  • nvidia

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

גרסה מכווננת של מטא מבית אנבידיה, שנבנתה ישירות לשיחות מבוססות מסמכים ושליפת מידע. היא מיועדת למי שרוצה ביצועי שאלות ותשובות גבוהים בלי להסתמך על מודלים סגורים.

  • 71Bפרמטרים
  • 8,192טוקנים בהקשר
  • 131 GBמשקל הקבצים
  • 285הורדות בחודש

מה זה

אנבידיה לקחה את מודל הבסיס של מטא בגודל 70 מיליארד פרמטרים ואימנה אותו בשיטה ממוקדת שיחה ומסמכים. המטרה היתה לחזק יכולות ספציפיות שנוטות להישבר במודלים כלליים, כמו עבודה מול טבלאות וחישובים אריתמטיים בתוך טקסט. המודל נשען על מחקר ChatQA ושוחרר במקביל לגרסת 8B קטנה יותר.

במבחני ChatRAG Bench המודל עוקף את Llama3-instruct-70b המקורי ואפילו מציג ממוצע גבוה מזה של גרסאות GPT-4 שנבדקו, עם ציון ממוצע של 58.25 לעומת 54.03 של GPT-4-Turbo. היתרון שלו בולט במיוחד בחיפוש בתוך טבלאות כמו במבחן SQA שם קיבל 83.82, אך יש לקחת בחשבון שהבדיקות כוללות דאטה שהמודל אומן עליו כמו HybriDial.

מתאים ל

  • ניתוח דוחות כספיים באנגלית

    מצטיין בחישובים ואחזור מידע מתוך טבלאות מספריות מורכבות.

  • צ'אט מבוסס RAG בארגון

    כוונן ספציפית לנהל שיחה מרובת שלבים על בסיס פסקאות שנשלפו.

  • מענה טכני מתוך תיעוד

    יודע לציין בבירור מתי התשובה אינה מופיעה במסמך שסופק לו.

איפה זה נופל

חלון ההקשר מוגבל ל־8,192 טוקנים בלבד, שזה מעט מאוד לעומת מודלים מודרניים אחרים. מסמך ארוך לא ייכנס לכאן בבת אחת ותהיו חייבים לבנות סביבו ארכיטקטורת שליפה מלאה עם צ'אנקים. בנוסף, המודל אומן ומתועד באנגלית בלבד, כך שאין שום הבטחה ליכולות ניתוח מסמכים בעברית. במבחנים מסוימים כמו INSCIT הוא הציג ציון של 32.31, נמוך יותר מזה של מודלים אחרים באותו גודל.

אותה משפחה

Llama3-ChatQA-1.5 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם כדאי להחליף את מודל ברירת המחדל של Llama 3 70B בגרסה הזו?

אם המוצר שלכם נשען בעיקר על RAG ומענה על שאלות מתוך טקסטים או טבלאות, כן. אנבידיה שיפרה את היכולות האלה בדיוק על חשבון משימות כתיבה כלליות.

איך אפשר להכניס אליו קבצים גדולים עם חלון של 8k?

אי אפשר להזין קבצים שלמים. חובה לחתוך את המידע לחלקים קטנים ולהשתמש במנוע חיפוש כמו Dragon שהמפתחים ממליצים עליו כדי לשלוף רק את הפסקאות הרלוונטיות.

איך מריצים

כדי להריץ 131 גיגה בייט של משקולות בדיוק float16 צריך תשתית רצינית. דרושים לפחות שני כרטיסי A100 או H100 של 80GB כדי להחזיק את המודל בזיכרון ולהשאיר מקום להקשר, אלא אם מבצעים קוונטיזציה לארבעה ביטים.

אם אין לכם שרת ייעודי זמין, העלות והתחזוקה של חומרה כזו הופכות את ההרצה העצמית ללא משתלמת מול שירותי ענן שמגישים אותו ב־API. למי שרוצה לבדוק את היכולות על חומרה מקומית צנועה יותר, עדיף להתחיל מגרסת ה־8B שדורשת כרטיס בודד.

from transformers import pipeline

pipe = pipeline("text-generation", model="nvidia/Llama3-ChatQA-1.5-70B")
print(pipe("שלום"))

הרישיון

המודל כפוף לרישיון הקהילה של Meta Llama 3. השימוש המסחרי מותר בחינם, כל עוד מספר המשתמשים החודשיים הפעילים של המוצר שלכם לא עולה על 700 מיליון. הרישיון מחייב לכלול את תנאי השימוש ולהצמיד את השם Llama 3 לתוצרים.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗