GPT
T

TinyLlama-1.1B-intermediate-step-1431k-3T

קוד פתוח

TinyLlamaapache-2.02023-12-28

  • transformers
  • pytorch
  • safetensors
  • llama
  • text-generation

זה מודל שפה קטן של 1.1 מיליארד פרמטרים שאומן על שלושה טריליון טוקנים. הוא נבנה כדי לתת ביצועים סבירים במכשירים חלשים עם אותה ארכיטקטורה וטוקנייזר של לאמה 2.

  • 1.1Bפרמטרים
  • 2,048טוקנים בהקשר
  • 8.2 GBמשקל הקבצים
  • 77,790הורדות בחודש

מה זה

הפרויקט הזה לקח את הארכיטקטורה של לאמה 2 ודחס אותה למימדים קטנים של 1.1 מיליארד פרמטרים בלבד. המטרה היתה לאמן אותו על כמות עצומה של מידע ביחס לגודל שלו, שלושה טריליון טוקנים, כדי לראות כמה אפשר לסחוט ממוח כל כך צנוע. נקודת הביקורת הזו מייצגת בדיוק את סיום האימון המתוכנן בצעד 1431k.

במבחני הבנצ'מרק שפורסמו, הוא עוקף מודל כמו פיתיה 1.0B בממוצע המבחנים הכללי ומגיע לציון ממוצע של 52.99 לעומת 48.30. עם זאת, במבחן הידע הכללי וההבנה MMLU הוא משיג רק 26.04 נקודות, שזה קרוב מאוד לניחוש אקראי, מה שמראה שבלי גודל פיזי קשה מאוד לצבור ידע עולם רחב.

מתאים ל

  • השלמת טקסט באנגלית

    מתאים לחיזוי מילים והשלמת משפטים במערכות מקומיות בזכות אימון על 3T טוקנים וארכיטקטורת לאמה מוכרת.

  • אימון ייעודי למשימה צרה

    משמש כבסיס קל משקל לאימון נוסף (Fine-tuning) על משימות ספציפיות כמו מיון או תיוג טקסט באנגלית.

  • הרצה על חומרה מוגבלת

    דורש מעט מאוד זיכרון ומשאבי חישוב ביחס למודלים גדולים, כך שהוא מתאים לרוץ ישירות על מכשירי קצה.

איפה זה נופל

הנתונים מראים נפילה קשה ביכולות חשיבה מורכבות. במבחן המתמטיקה GSM8k הוא קיבל ציון של 1.44 בלבד, שזה כמעט אפס עגול, כך שאסור לסמוך עליו בשום צורה לחשבונות, לוגיקה או פתרון בעיות צעד אחר צעד.

בנוסף, מדובר במודל בסיס שאומן רק על אנגלית, בלי כוונון להוראות ובלי תמיכה רשמית בעברית. חלון ההקשר קצר ועומד על 2,048 טוקנים בלבד, כך שטקסטים ארוכים ייחתכו מהר מאוד.

שאלות
נפוצות

האם המודל הזה מתאים לעבודה בעברית?

לא. המודל הוגדר ואומן על טקסטים באנגלית בלבד. הטוקנייזר שלו לא מותאם לעברית, והוא לא יפיק פלטים הגיוניים בשפה הזו בלי אימון ייעודי מראש.

אפשר להשתמש בו ישירות בתור צ'אטבוט?

לא מומלץ כרגע. זו נקודת ביקורת של אימון מקדים (Base Model) שמיועדת להשלמת טקסט, ולא גרסה שעברה התאמה לשיחה או מילוי הוראות. כדי לדבר איתו צריך לאמן אותו קודם על דאטה של שיחות.

איך מריצים

המשקל הנוכחי של הקבצים עומד על 8.2 גיגה בייט בפורמט float32 המקורי, והוא רץ ישירות דרך ספריית transformers הרגילה בפייתון. במצב הזה כל כרטיס מסך בסיסי עם 10 עד 12 גיגה זיכרון יחזיק אותו בלי בעיה, ובקוונטיזציה פשוטה אפשר להוריד את הנפח עוד הרבה יותר.

אם אתם צריכים רק שירות ענן לשיחה כללית, עדיף לקרוא ל־API של מודלים גדולים שייתנו תשובות טובות בהרבה. המודל הזה משתלם להרצה עצמית רק כשאתם חייבים עיבוד מקומי על חומרה זולה, בלי חיבור לרשת או בלי לשלם על כל קריאה.

from transformers import pipeline

pipe = pipeline("text-generation", model="TinyLlama/TinyLlama-1.1B-intermediate-step-1431k-3T")
print(pipe("שלום"))

הרישיון

הקוד והמשקולות מפורסמים תחת רישיון apache-2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי של הקבצים והפצה שלהם בתוך מוצרים, כל עוד שומרים על הודעת זכויות היוצרים המקורית והצהרת הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗