GPT
S

Sheared-LLaMA-2.7B

קוד פתוח

princeton-nlpapache-2.02023-10-10

  • transformers
  • pytorch
  • llama
  • text-generation
  • text-generation-inference

גרסה מכווצת של LLaMA 2 שחתכו מתוכה משקלים ואימנו מחדש על מעט דאטה יחסית. היא נותנת ביצועים טובים יותר ממודלים שנבנו מאפס באותו סדר גודל.

  • 4,096טוקנים בהקשר
  • 10.1 GBמשקל הקבצים
  • 2,274הורדות בחודש
  • 61לייקים

מה זה

החוקרים מפרינסטון לקחו את מודל 7B המקורי של מטא, ביצעו עליו גיזום מבני בעזרת 0.4 מיליארד טוקנים, ואז המשיכו לאמן אותו על 50 מיליארד טוקנים מתוך RedPajama. הרעיון כאן הוא לקבל מודל קטן בלי לשלם את מחיר האימון המלא מאפס, תוך שמירה על אוצר המילים המקורי של משפחת LLaMA.

במבחני ביצועים מול מודלים אחרים באזור ה־3 מיליארד פרמטרים, הוא עוקף מתחרים כמו Pythia 2.8B או Open-LLaMA 3B עם ציון ממוצע של 56.7 לעומת 51 עד 55 שלהם. זה אומר שבמשימות הבנה, היגיון ושפה הוא מחלץ יותר דיוק מכל פרמטר, למרות שאימנו אותו על שבריר מכמות הטוקנים שאימנו בה את האחרים.

מתאים ל

  • בסיס לכוונון עדין

    נקודת מוצא קלה ויעילה לאימון משימות מוגדרות מראש בלי לשלם על מודל ענק.

  • הסקה מקומית על חומרה זולה

    רץ מצוין על כרטיסי מסך קטנים או מעבדים כשחייבים פרטיות ואי אפשר לצאת לרשת.

  • מחקר על דחיסת מודלים

    משמש דוגמה מעשית לבדיקת ביצועים של מודל שעבר גיזום מבני ואימון המשך קצר.

איפה זה נופל

זהו מודל בסיס שנועד להשלמת טקסט ולא למענה על שאלות מהקופסה. הציון שלו, 56.7, עדיין רחוק מאוד מזה של מודל המקור LLaMA 2 7B שעומד על 64.6, כך שיש פגיעה ברורה ביכולות ביחס לגודל המקורי. בנוסף, חלון ההקשר מוגבל ל־4,096 טוקנים, והחומר לא מציין שום תמיכה מובנית בעברית, כך שבלי כוונון נוסף הוא כנראה יתקשה מאוד במשימות מקומיות.

אותה משפחה

Sheared-LLaMA יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להשתמש בו ישירות כבוט לצ'אט?

לא מומלץ. מדובר במודל בסיס שלא עבר אימון על הוראות, ולכן הוא פשוט ימשיך את הטקסט שתכתבו לו. אם רוצים אינטראקציה של שיחה, פרינסטון שחררו גרסת ShareGPT ייעודית למטרה הזו.

איזה כרטיס מסך אני צריך בשביל להריץ אותו?

במצבו הנוכחי כ־float32 הוא דורש מעל 10 גיגה זיכרון גרפי רק למשקלים. אם תמירו אותו ל־16 ביט או תבצעו קוונטיזציה ל־4 או 8 ביט, תוכלו להריץ אותו חלק גם על כרטיסים צנועים עם 6 עד 8 גיגה זיכרון.

איך מריצים

המשקלים יושבים כרגע בפורמט float32 ותופסים קצת יותר מ־10 גיגה־בייט ב־11 קבצים נפרדים. אפשר לטעון אותו ישירות דרך transformers עם AutoModelForCausalLM. כדי להריץ אותו בנוחות בלי לחנוק את החומרה עדיף להמיר אותו לחצי דיוק או לכמת ל־4 ביט, ואז הוא ירוץ בקלות על כרטיס מסך ביתי בסיסי עם 6 עד 8 גיגה זיכרון.

אם אתם צריכים צ'אט או מילוי הוראות ישירות, המודל הזה כשלעצמו הוא מודל בסיס ולא עבר התאמה לשיחה. בשביל זה יש להם גרסת ShareGPT נפרדת. שירותי ענן מסחריים לא תמיד מחזיקים משקלים של מודלים קטנים כאלה, אז ההיגיון פה הוא בעיקר הרצה עצמית מקומית.

from transformers import pipeline

pipe = pipeline("text-generation", model="princeton-nlp/Sheared-LLaMA-2.7B")
print(pipe("שלום"))

הרישיון

בעמוד מוגדר רישיון Apache 2.0, אבל החוקרים מציינים במפורש שחובה לציית לרישיון של LLaMA 2 כי המודל נגזר ממנו. המשמעות היא שאי אפשר להסתמך רק על החופש של אפאצ'י, ויש לבדוק את הגבלות השימוש המסחרי ומדיניות השימוש המקובל של מטא לפני הפצה במוצר.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗