GPT
T

TinyLlama-1.1B-Chat-v0.4

קוד פתוח

TinyLlamaapache-2.02023-11-16

  • transformers
  • pytorch
  • safetensors
  • llama
  • text-generation

גרסת צ'אט קטנה במיוחד של Llama 2 שמתאימה למי שחייב להריץ מודל שיחה מקומית על חומרה חלשה בלי לגעת בשרתים מרוחקים.

  • 1.1Bפרמטרים
  • 2,048טוקנים בהקשר
  • 8.2 GBמשקל הקבצים
  • 2,461הורדות בחודש

מה זה

מדובר במודל שפה קומפקטי שמבוסס בדיוק על הארכיטקטורה והטוקנייזר של Llama 2, אבל עם 1.1 מיליארד פרמטרים בלבד. המפתחים אימנו אותו על בסיס צ'קפוינט ביניים של 1.5 טריליון טוקנים, מתוך יעד כולל של 3 טריליון, ואז ביצעו כוונון עדין לשיחה באמצעות מאגר הנתונים של פרויקט OpenAssistant בפורמט ChatML.

היתרון המרכזי כאן הוא התאימות המיידית לכל כלי או תשתית שנבנו סביב הארכיטקטורה של Llama. במקום להתמודד עם משקלים עצומים, מקבלים מודל שיחה שדורש מעט מאוד זיכרון ויכול להיכנס כמעט לכל צינור עבודה פתוח בלי התאמות מיוחדות בקוד.

מתאים ל

  • בוט שיחה למכשיר קצה

    צורך מעט מאוד זיכרון ומאפשר שיחה בסיסית באנגלית ללא תלות בחיבור לרשת.

  • פיתוח ובדיקות מקומיות

    תואם לחלוטין לכלי Llama 2 ומאפשר לבדוק פייפליין שלם על מחשב נייד רגיל.

  • מענה אוטומטי פשוט

    מתאים למשימות ניתוב וטקסט קצרות באנגלית שלא דורשות ידע מעמיק או הקשר רחב.

איפה זה נופל

המודל אומן רק באנגלית, כך שאין מה לבנות עליו לעיבוד או יצירת תוכן בעברית. חלון ההקשר מוגבל ל־2,048 טוקנים בלבד, מה שמונע ממנו לנתח מסמכים ארוכים או להחזיק שיחות צ'אט ממושכות בלי לאבד את ההיסטוריה.

חשוב לזכור שזו גרסת פיתוח מוקדמת המבוססת על שלב ביניים של האימון. בגודל של 1.1 מיליארד פרמטרים יכולת ההסקה מוגבלת מאוד, והוא נוטה להמציא עובדות בקלות ברגע שיוצאים משאלות בסיסיות וישירות.

אותה משפחה

TinyLlama יצא ב־6 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל מבין ועונה בעברית?

לא. המודל אומן על נתונים באנגלית בלבד, והוא לא יפיק פלט הגיוני בשפה העברית. אם המוצר שלכם פונה לקהל ישראלי, תצטרכו לאמן אותו מחדש או לבחור מודל רב לשוני.

מה גודל הזיכרון הנדרש כדי להריץ אותו בפועל?

למרות שקבצי ההורדה שוקלים 8.2 גיגה בייט, טעינה בפורמט float16 תתפוס סביב 2.2 גיגה בייט של זיכרון גרפי בלבד. כרטיס מסך בסיסי למדי או מעבד סביר יספיקו כדי לקבל זמני תגובה טובים.

איך מריצים

טוענים אותו בעזרת ספריית transformers בגרסה 4.31 ומעלה יחד עם PyTorch. למרות שהקבצים במאגר שמורים ברמת דיוק של float32 ושוקלים 8.2 גיגה בייט, הקוד הרשמי מריץ אותו ב־float16 עם כיווץ ישיר לכרטיס המסך, כך שמספיק כרטיס גרפי פשוט עם 4 עד 6 גיגה זיכרון כדי להחזיק אותו בפועל.

הוא מתאים בעיקר למכשירים מקומיים או לשרתים זולים מאוד שבהם רוצים לחסוך עלויות תעבורה. אם המטרה היא לקבל מענה לשאלות מורכבות בעומס גבוה, קריאה ל־API של מודל גדול ומבוסס תיתן תוצאה טובה בהרבה בלי הצורך לנהל מופע שרת עצמאי.

from transformers import pipeline

pipe = pipeline("text-generation", model="TinyLlama/TinyLlama-1.1B-Chat-v0.4")
print(pipe("שלום"))

הרישיון

הקוד והמשקלים מופצים תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי מלא, שינוי של הקוד והפצה מחדש כחלק ממוצר סגור או פתוח, כל עוד משאירים את הצהרת זכויות היוצרים ואת נוסח הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗