GPT
S

Sheared-LLaMA-1.3B

קוד פתוח

princeton-nlpapache-2.02023-10-10

  • transformers
  • pytorch
  • llama
  • text-generation
  • text-generation-inference

גרסה מכווצת של לאמה 2 שמתאימה למי שרוצה חלופה מקומית וקלה במיוחד. החוקרים גזרו אותו ישירות מהמודל הגדול כדי לשמור על היכולות שלו בנפח קטן.

  • 4,096טוקנים בהקשר
  • 5.0 GBמשקל הקבצים
  • 4,189הורדות בחודש
  • 98לייקים

מה זה

חוקרים מפרינסטון לקחו את לאמה 2 של מטא, הסירו ממנו שכבות ומשקלים, ואימנו אותו מחדש על 50 מיליארד טוקנים ממאגר רד פג'מה. במקום להתחיל מאפס, הם שימרו את הידע והאוצר מילים של המודל המקורי, וכיווצו אותו לרמה של 1.3 מיליארד פרמטרים בלבד.

בבדיקות של הבנת הנקרא, היגיון ושפה, הוא מוציא ציון ממוצע של 51 לעומת מודלים מקבילים מאותו דור כמו פיתיה או אופט, שהגיעו לאזור ה־48 למרות שאומנו על פי שישה יותר טוקנים. זה לא אומר שהוא חכם במיוחד, אלא שהוא מנצל טוב יותר את הממדים המצומצמים שלו.

מתאים ל

  • השלמת טקסט מקומית

    רץ מצוין על חומרה חלשה בלי חיבור לרשת, ומשלים משפטים במהירות הודות למבנה הקל.

  • בסיס לכיול משימה צרה

    מתאים לאימון נוסף וזול על סיווג או חילוץ מידע, בלי לשלם על מודלי ענק.

  • מחקר על דחיסת מודלים

    מדגים איך גזירת משקלים עובדת בהשוואה לאימון מודל קטן מאפס.

איפה זה נופל

המודל הזה כמעט עיוור לחלוטין לחשבון ומתמטיקה, עם ציון נוראי של 0.45 בלבד במבחן GSM8K, וביצועים חלשים מאוד של 4.56 בבדיקות DROP. מעבר לזה, מדובר במודל בסיס שלא עבר התאמה לשיחה, ולכן הוא נוטה לפלוט המשכים אסוציאטיביים ולא תשובות ישירות. אין בו התאמה מיוחדת לעברית ואי אפשר לסמוך עליו במשימות שדורשות הבנה מורכבת של עובדות.

אותה משפחה

Sheared-LLaMA יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל מבין ועונה בעברית בצורה טובה?

לא. המודל אומן על נתונים באנגלית ולאמה 2 במקור כמעט לא כולל עברית. הוא אולי יזהה מילים בודדות, אבל יפלוט ג'יבריש ומשפטים שבורים.

למה לא להשתמש ישר בלאמה 2 המקורי?

היתרון היחיד פה הוא החומרה והמהירות. המודל המקורי דורש כרטיס מסך רציני, בעוד הגרסה הזו נכנסת בקלות לזיכרון של מחשב פשוט וזזה מהר.

איך מריצים

טוענים אותו בקלות דרך ספריית טרנספורמרס של הגפינג פייס ישירות לקוד. הקבצים שוקלים 5 גיגה בייט בגלל דיוק מקורי של float32, אבל כל כרטיס מסך בסיסי או לפטופ עם מעבד סביר יריץ אותו בלי להזיע.

אם אתם צריכים צ'אט, הגרסה הזו היא מודל בסיס שרק משלים טקסט ולא תענה לכם טוב בלי שתעברו לגרסת ההוראות שלהם או שתכיילו אותה בעצמכם. למשימות מורכבות של היגיון או עברית עדיף לפנות לשרת מרוחק עם מודל גדול, כי הגודל הזה מוגבל מאוד מראש.

from transformers import pipeline

pipe = pipeline("text-generation", model="princeton-nlp/Sheared-LLaMA-1.3B")
print(pipe("שלום"))

הרישיון

המטא־דאטה מציג אפאצ'י 2.0, אבל כרטיס המודל מבהיר במפורש שחובה לציית לרישיון של לאמה 2 כי הוא נגזר ממנו. המשמעות היא שאין לכם חופש מלא של קוד פתוח אמיתי, ואתם כפופים להגבלות השימוש וההפצה המסחרית של מטא.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗