GPT
T

TinyLlama_v1.1

קוד פתוח

TinyLlamaapache-2.02024-03-09

  • transformers
  • pytorch
  • llama
  • text-generation
  • en

גרסה מכווצת של ארכיטקטורת לאמה שדורשת מעט מאוד זיכרון. הבחירה בה הגיונית למי שחייב להריץ מודל מקומית על חומרה חלשה בלי לשלם על שרתים יקרים.

  • 2,048טוקנים בהקשר
  • 4.1 GBמשקל הקבצים
  • 43,034הורדות בחודש
  • 116לייקים

מה זה

מדובר במודל שפה של 1.1 מיליארד פרמטרים שנבנה בדיוק על הארכיטקטורה והטוקנייזר של לאמה 2, כך שכל תשתית קיימת שתומכת במשפחה הזו מקבלת אותו מיד. המפתחים אימנו אותו על שני טריליון טוקנים ממאגר סלים פג'מה, כשהגרסה הזו היא הבסיס הכללי מתוך שלוש וריאציות שהם הוציאו, לצד גרסאות ייעודיות לקוד ומתמטיקה או סינית.

במבחני ביצועים מול מודלים בגודל דומה, כמו פיתיה של מיליארד פרמטרים, הוא מציג יתרון ברור עם ממוצע ציונים של 53.63 נקודות לעומת 48.30. במבחני הגיון וידע בסיסי כמו הלה סוואג ופיקא הוא מוביל בבירור על פני מודלים ותיקים באותו סדר גודל, מה שמראה שאימון ארוך יותר על מאגר נקי מחפה על מגבלת המשקל. עם זאת, במבחני קריאה והבנה מורכבים יותר התוצאות נשארות צנועות, כי פיזיקה של מודל קטן פשוט לא מאפשרת לו להתחרות ברשתות גדולות ממנו בהרבה.

מתאים ל

  • השלמת טקסט במכשירי קצה

    צריכת הזיכרון הנמוכה מאפשרת לו לרוץ על מחשבים פשוטים ללא חיבור רשת פעיל.

  • אימון ייעודי למשימות סיווג

    הארכיטקטורה של לאמה 2 מאפשרת לבצע לו פיין טיונינג פשוט למשימות מוגדרות.

  • ניתוח מקומי של טקסטים באנגלית

    מתאים למי שחייב לשמור מידע רגיש בתוך השרת המקומי בלי לפנות לשירותי ענן.

איפה זה נופל

זהו מודל בסיס שלא עבר התאמה לשיחה, ולכן הוא נוטה להשלים טקסט במקום לענות ישירות לשאלות בלי שתגדירו לו הנחיה ברורה או ענישה על חזרות. חלון ההקשר מוגבל ל־2,048 טוקנים בלבד, כך שאי אפשר להזין אליו מסמכים ארוכים או לבנות סביבו זיכרון מתמשך. מעבר לכך, האימון התמקד באנגלית, ולכן כל ניסיון לעבוד איתו בעברית יפיק תוצאות גרועות או ג'יבריש מוחלט. לא הייתי משתמש בו לשום משימה שדורשת דיוק עובדתי עמוק בלי לבדוק קודם איך הוא מגיב להנחיות שלכם.

אותה משפחה

TinyLlama יצא ב־6 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך בעברית?

הנתונים מראים שהאימון שלו נעשה על מאגר באנגלית בלבד. מודלים קטנים שלא נחשפו לעברית מייצרים שפה משובשת לחלוטין, ולכן הוא לא מתאים לעבודה בעברית.

האם אפשר להשתמש בו ישירות כצ'אטבוט?

לא מומלץ בלי שלב נוסף. מדובר במודל בסיס שנועד להשלמת טקסט, כך שהוא עלול לחזור על עצמו או לפלוט מלל לא קשור אם לא מבצעים לו כוונון לשיחות.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־4.1 גיגה בייט בדיוק מלא, אבל בסביבת ריצה אפשר לטעון אותו בחצי דיוק ישירות דרך ספריית הטרנספורמרס, מה שמוריד את צריכת הזיכרון לפחות משלושה גיגה בייט. כרטיס גרפי בסיסי ביותר, אפילו ברמת מחשב נייד או מעבד מודרני, מספיק כאן לגמרי כדי לקבל מהירות סבירה בלי לגעת בתשתיות ענן מורכבות.

אם כל מה שאתם צריכים זה שירות אמין לייצור טקסט מורכב עבור משתמשי קצה, עדיף להשתמש ב־API מסחרי של מודל גדול בהרבה. הריצה המקומית של המודל הזה משתלמת רק כשחייבים פרטיות מלאה, אוטומציה מנותקת רשת, או פעולות קבועות שחייבות לרוץ באפס עלות שוטפת.

from transformers import pipeline

pipe = pipeline("text-generation", model="TinyLlama/TinyLlama_v1.1")
print(pipe("שלום"))

הרישיון

הקוד והמשקלים שוחררו תחת רישיון אפאצ'י 2.0 המלא. אפשר להשתמש במודל למוצרים מסחריים, לשנות אותו, לבצע עליו אימון נוסף, ואף להפיץ אותו באופן סגור, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗