GPT
L

LLaMA-Pro-8B

קוד פתוח

TencentARCllama22024-01-05

  • transformers
  • pytorch
  • safetensors
  • llama
  • text-generation

הרחבה של לאמה 2 שמוסיפה שכבות ייעודיות לקוד ומתמטיקה בלי למחוק את היכולות הכלליות. מתאים למי שצריך מודל בסיס שמשלב טקסט ותכנות באריזה קומפקטית יחסית.

  • 8.4Bפרמטרים
  • 4,096טוקנים בהקשר
  • 31.1 GBמשקל הקבצים
  • 243הורדות בחודש

מה זה

החוקרים של טנסנט לקחו את הבסיס המוכר של שבעה מיליארד פרמטרים, הוסיפו לו בלוקים של טרנספורמר ואימנו אותם על 80 מיליארד טוקנים של קוד ומתמטיקה. התוצאה היא מודל של 8.4 מיליארד פרמטרים שיושב על 40 שכבות, ומנסה לפתור את השחיקה הרגילה שקורית כשמאמנים מודל כללי על תחום ספציפי.

במבחנים התוצאה מעורבת. בבדיקות תכנות כמו HumanEval הוא קופץ לציון 28.66 לעומת 13.05 במודל המקורי, שיפור מורגש מאוד בכתיבת קוד פשוט. מצד שני, מול מודל שמיועד רק לקוד כמו CodeLLaMA-7B שמגיע ל־33.5, הוא עדיין מפסיד, ובמתמטיקה טהורה ב־GSM8K עם 17.89 מדובר בציון נמוך שלא מספיק לחישובים מורכבים.

מתאים ל

  • השלמת קוד מקומית

    מתאים לשרת פיתוח פנימי שצריך להשלים שורות קוד ופונקציות קצרות בלי להוציא נתונים החוצה.

  • אימון נוסף למשימות מעורבות

    בסיס טוב להמשך כוונון כשצריך מודל שמבין גם תיעוד באנגלית וגם תחביר של שפות תכנות.

  • סוכן בדיקות אוטומטי

    ניתוח לוגים טכניים והפקת הסברים מילוליים קצרים על שגיאות תחביר בקוד.

איפה זה נופל

זהו מודל בסיס ולא גרסת שיחה, מה שאומר שהוא ממשיך טקסט ולא בהכרח עונה להוראות ישירות. חלון ההקשר מוגבל ל־4,096 טוקנים בלבד, שזה מעט מאוד לפרויקטים אמיתיים של תכנות שדורשים קריאת קבצים מרובים. יוצרי המודל מציינים במפורש שהוא עדיין מתקשה במשימות שדורשות התמחות עמוקה, ובמדדי מתמטיקה כמו GSM8K הוא מקבל ציונים חלשים שמראים שהוא לא מתאים לפתרון בעיות חישוביות רב-שלביות.

אותה משפחה

LLaMA-Pro יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל מבין הוראות ישירות כמו צ'אט?

לא באופן טבעי. מדובר במודל בסיס שנועד להשלמת טקסט, כך שלבקשות ישירות תצטרכו להנדס פרומפטים בקפידה או לחפש את גרסת האינסטראקט שלו.

אפשר להריץ אותו על מחשב נייד רגיל?

לא במצבו הגולמי שתופס מעל 31 גיגה בייט. תצטרכו מחשב עם כרטיס מסך חזק וזיכרון ייעודי גדול, אלא אם תמירו את המשקלים לגרסה מכווצת.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־31.1 גיגה בייט בדיוק של bfloat16, כך שתצטרכו כרטיס מסך עם לפחות 24 גיגה זיכרון כדי לטעון אותו, או שתצטרכו לכווץ אותו לקוונטיזציה של 4 ביט כדי לדחוף אותו לחומרה ביתית. הוא רץ ישירות דרך ספריית transformers של פייתון.

אם אתם לא חייבים פרטיות מוחלטת או הרצה על שרת פנימי מנותק, עדיף להשתמש ב־API של מודל חיצוני. הטרחה סביב ניהול שרת והקצאת כרטיסי מסך כבדים לא תמיד מצדיקה את הביצועים של מודל בגודל הזה.

from transformers import pipeline

pipe = pipeline("text-generation", model="TencentARC/LLaMA-Pro-8B")
print(pipe("שלום"))

הרישיון

הרישיון הוא רישיון לאמה 2 המקורי. הוא מתיר שימוש מסחרי ומחקרי, אבל כפוף להגבלות השימוש המקובלות של מטא, כולל איסור על שימוש בפלט לאימון מודלים מתחרים והגבלת משתמשים חודשית לחברות ענק.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗