GPT
L

llama-160m

קוד פתוח

JackFramapache-2.02023-05-26

  • transformers
  • pytorch
  • safetensors
  • llama
  • text-generation

גרסה זעירה לארכיטקטורת LLaMA שנועדה בעיקר לשמש כמודל עזר להאצת הסקת מסקנות. הוא שוקל מעט מאוד, רץ כמעט על כל מכשיר ומתאים למי שמחפש מודל קומפקטי באנגלית.

  • 162Mפרמטרים
  • 2,048טוקנים בהקשר
  • 2.4 GBמשקל הקבצים
  • 84,537הורדות בחודש

מה זה

מדובר במודל שפה קטן במיוחד עם 162 מיליון פרמטרים בלבד, הבנוי בארכיטקטורת LLaMA ומכיל 12 שכבות. הוא אומן על טקסטים באנגלית מתוך ויקיפדיה וחלקים ממאגרי C4, ספציפית C4-en וגרסת החדשות C4-realnewslike. המטרה המקורית של הפיתוח שלו, כפי שפורסם במאמר SpecInfer, היא לשמש מודל ספקולטיבי קטן שמייצר הצעות טוקנים במהירות כדי שמודלים ענקיים יאמתו אותם.

בניגוד לרוב המודלים המודרניים, המפתח מציין במפורש שלא נערכו לו מבחני ביצועים והערכה מסודרים. הוא לא מתיימר להתחרות במודלי שיחה עמוקים או במודלים מרובי שפות. הערך שלו נמצא במבנה המוכר והפשוט שלו, שמציע נקודת מוצא זעירה לבדיקות ארכיטקטורה, לפיתוח מנגנוני האצה או לניסויי אימון מקומיים כשאין משאבי מחשוב כבדים.

מתאים ל

  • הסקה ספקולטיבית

    הוא נבנה במקור עבור SpecInfer כדי לייצר טוקנים במהירות לפני אימות במודל גדול.

  • ניסויי מעבדה ופיתוח

    המשקל הקל שלו מאפשר לבדוק תהליכי אימון ושינויי ארכיטקטורה על חומרה פשוטה בלי להמתין שעות.

  • השלמת טקסט בסיסית באנגלית

    מתאים למשימות ייצור טקסט קצרות מאוד באנגלית במערכות קצה שאין להן גישה לכרטיסי מסך חזקים.

איפה זה נופל

יוצר המודל מזהיר במפורש שלא בוצעה שום הערכת ביצועים, כך שאין שום מדד רשמי לאיכות הטקסט או לאמינות שלו. עם 162 מיליון פרמטרים וחלון הקשר של 2,048 טוקנים, הוא מועד להזיות קשות, חוסר עקביות וחוסר יכולת לבצע היגיון מורכב. הוא אומן באנגלית בלבד ולכן לא יודע עברית, ואינו כולל כוונון להוראות או סינון בטיחות.

אותה משפחה

llama יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להשתמש בו לצ'אטבוט או למענה על שאלות בעברית?

לא. המודל אומן אך ורק על מאגרי מידע באנגלית ולא עבר כוונון לשיחות או מילוי הוראות. ניסיון לכתוב אליו בעברית יפיק פלט משובש לחלוטין.

למה הקבצים שוקלים 2.4 ג'יגה אם יש לו רק 160 מיליון פרמטרים?

המשקלים נשמרו בדיוק מלא של float32, שדורש 4 בייטים לכל פרמטר, לצד קובצי הגדרות נוספים. המרה לפורמט float16 או שימוש בכימות יקטינו את נפח האחסון בצורה משמעותית.

איך מריצים

טוענים אותו ישירות דרך ספריית transformers בפייתון באמצעות המחלקה LlamaForCausalLM. הקבצים שוקלים 2.4 ג'יגה בייט בגלל שמירת המשקלים בפורמט float32, אבל בזכרון העבודה הוא תופס מעט מאוד מקום ויכול לרוץ בקלות על מעבד רגיל של מחשב נייד או כרטיס גרפי בסיסי ביותר.

אם אתם רוצים רק תוצאות טקסט איכותיות בענן, עדיף לקרוא לכל שירות מסחרי קיים. להריץ אותו מקומית כדאי רק כשאתם בונים תהליך של הסקה ספקולטיבית, צריכים מודל קל להדגמות פנימיות ללא רשת, או בודקים התנהגות של ארכיטקטורת LLaMA בסביבת פיתוח מוגבלת.

from transformers import pipeline

pipe = pipeline("text-generation", model="JackFram/llama-160m")
print(pipe("שלום"))

הרישיון

המודל מופץ תחת רישיון apache-2.0. זהו רישיון פתוח ומתירני שמאפשר שימוש מסחרי, שינוי של הקוד והמשקלים והפצה מחדש בתוך מוצרים. התנאי העיקרי הוא שמירה על הודעת זכויות היוצרים והצהרת הרישיון המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗