GPT
L

llama-68m

קוד פתוח

JackFramapache-2.02023-07-19

  • transformers
  • pytorch
  • llama
  • text-generation
  • en

גרסה ממוזערת של ארכיטקטורת LLaMA שנבנתה בעיקר עבור מנגנוני speculative decoding. אם אתם צריכים מודל קליל לבדיקות תשתית או להאצת מודל ראשי, הוא תופס פחות מג'יגה בזיכרון.

  • 2,048טוקנים בהקשר
  • 779 MBמשקל הקבצים
  • 114,494הורדות בחודש
  • 38לייקים

מה זה

מדובר במודל שפה זעיר עם שתי שכבות בלבד, שאומן על ויקיפדיה וחלק ממאגר C4 באנגלית. המטרה המקורית שלו אינה שיחה או יצירת תוכן מורכב, אלא שילוב בתור מודל עזר קטן במחקר SpecInfer כדי להציע טוקנים במהירות ולזרז הסקה של מודלים ענקיים.

מבחני הביצועים מראים היטב את הפער. בדקדוק בסיסי הוא מקבל ציון סביר של 70.57% במבחן BLiMP, אבל במבחני ידע והסקה כמו MMLU הוא עומד על 22.96%, וב־LAMBADA על 13.24% בלבד. ערכי הפרפלקסיטי שלו גבוהים מאוד, 205 ב־C4 ומעל 306 ב־WikiText, מה שאומר שהוא מתקשה מאוד לחזות את המילה הבאה בצורה הגיונית ועקבית.

מתאים ל

  • האצת מודלים גדולים

    הוא נבנה במקור לשמש כמנחש טוקנים זריז במערכות speculative inference כדי לקצר זמני תגובה.

  • בדיקות תשתית ופיתוח

    הוא שוקל מעט ונטען מיד, ולכן מתאים לוודא שצינורות עיבוד של LLaMA רצים חלק בלי לחכות לטעינת ענק.

  • מחקר על מודלים זעירים

    הוא מספק נקודת ייחוס קיצונית של שתי שכבות בלבד לבחינת התנהגות של ארכיטקטורות טרנספורמר מינימליות.

איפה זה נופל

בגלל גודלו ושתי השכבות שלו, המודל אינו מסוגל לענות על שאלות ידע, לייצר טקסט קוהרנטי או לבצע חישובים. במבחנים המצורפים משימות חשבון נכשלו בריצה, ובמבחני הבנה עמוקה הציונים שקולים לניחוש אקראי. בנוסף הוא אומן באנגלית בלבד ואין לו שום תמיכה בעברית.

אותה משפחה

llama יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להשתמש בו לצ'אטבוט או ליצירת תוכן?

לא. ציוני ההסקה הנמוכים ומדדי הפרפלקסיטי הגבוהים מעידים שהוא לא מסוגל לנהל שיחה הגיונית. הוא ייצר טקסט מקוטע וחסר פשר.

האם המודל תומך בעברית?

האימון נעשה על ויקיפדיה ומאגרי C4 באנגלית בלבד. אין לו ידע בעברית והוא לא מתאים למשימות בשפה זו.

איך מריצים

המשקל הכולל עומד על 779 מגה בייט, כך שאפשר לטעון אותו בעזרת ספריית transformers כמעט על כל מעבד רגיל או כרטיס מסך בסיסי ביותר, בלי צורך בחומרה ייעודית. בגלל הדיוק המקורי של float32, אפילו אין צורך במשחקי קוונטיזציה מורכבים כדי שהוא ירוץ מהר.

להריץ שרת עצמאי עבור משימות טקסט חופשי עם המודל הזה אין שום טעם. אם המטרה שלכם היא לקבל תשובות איכותיות או מענה למשתמשים, API של מודל קיים וגדול יעשה עבודה אמיתית, בעוד שהרצה מקומית של הכלי הזה הגיונית רק אם אתם מפתחים מנוע הסקה ספקולטיבי או בודקים קוד תשתית.

from transformers import pipeline

pipe = pipeline("text-generation", model="JackFram/llama-68m")
print(pipe("שלום"))

הרישיון

הרישיון הוא apache-2.0, מה שמאפשר שימוש חופשי בקוד ובמשקלים גם לפרויקטים מסחריים. מותר לשנות את המשקלים, לשלב אותם במוצר ולהפיץ אותם, בתנאי ששומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗