GPT
T

TinyLlama-1.1B-Chat-v0.6

קוד פתוח

TinyLlamaapache-2.02023-11-20

  • transformers
  • safetensors
  • gguf
  • llama
  • text-generation

גרסת שיחה קומפקטית במיוחד שמבוססת על ארכיטקטורת Llama 2. היא נכנסת לכל מכשיר קצה בלי להכביד על הזיכרון ומגיעה אחרי אימון ייעודי לשיחות.

  • 1.1Bפרמטרים
  • 2,048טוקנים בהקשר
  • 2.6 GBמשקל הקבצים
  • 8,283הורדות בחודש

מה זה

הפרויקט הזה לקח את הארכיטקטורה והטוקנייזר המדויקים של Llama 2 ודחס אותם לגודל של 1.1 מיליארד פרמטרים. במקום להסתפק במודל בסיס, הגרסה הזו עברה כוונון עדין לשיחה לפי המתכון של Zephyr. היא אומנה על שיחות סינתטיות ממאגר UltraChat ועברה יישור באמצעות DPO על גבי דירוגים של GPT-4 ממאגר UltraFeedback.

היתרון המעשי כאן הוא התאימות. בגלל שמבנה המודל זהה לזה של Llama, אפשר לזרוק אותו ישירות לתוך כמעט כל כלי קוד פתוח קיים שנבנה עבור האקוסיסטם הזה, בלי התאמות מיוחדות בקוד או בצינורות העבודה.

מתאים ל

  • בוט שיחה במכשירי קצה

    הוא שוקל 2.6 גיגה בייט בלבד ונכנס למכשירים מוגבלי זיכרון שחייבים לפעול בלי חיבור שרת.

  • בדיקות מהירות בסביבת פיתוח

    הוא תואם לחלוטין לכלים של Llama 2 ומאפשר לבדוק פייפליין מקומית בלי לחכות לזמני טעינה כבדים.

  • מיון וסיווג טקסט מקומי

    מתאים למשימות עיבוד קצרות של עד 2,048 טוקנים כשחייבים לשמור על המידע בתוך הארגון.

איפה זה נופל

מדובר במודל קטן שרואה רק 2,048 טוקנים בהקשר שלו, כך שאי אפשר להזין לו מסמכים ארוכים או לצפות לניהול שיחה ממושכת בלי לאבד את ההקשר מהר מאוד. הוא דווח רשמית באנגלית בלבד, ואימון השיחה שלו נשען על דאטה סינתטי מ־ChatGPT שדורג בידי מודל אחר, כך שההיגיון והידע העובדתי שלו מוגבלים מאוד בהשוואה למודלים מלאים.

אותה משפחה

TinyLlama יצא ב־6 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך בעברית?

הכרטיס מצהיר על תמיכה באנגלית בלבד. הארכיטקטורה אמנם תואמת לזו של Llama 2, אבל עם 1.1 מיליארד פרמטרים ואימון באנגלית, פלט בעברית לא יעבוד בצורה אמינה בלי אימון ייעודי משלכם.

איך אפשר לשלב אותו במערכות קיימות של Llama?

בקלות רבה, כי הוא חולק בדיוק את אותו הטוקנייזר ואותו מבנה ארכיטקטוני. צריך רק לעדכן את transformers לגרסה 4.34 ומעלה ולהטעין אותו באותן פונקציות שמריצות את הדגמים הגדולים יותר.

איך מריצים

המשקל הכולל של הקבצים עומד על 2.6 גיגה בייט בפורמט bfloat16, כך שכל מעבד גרפי פשוט ואפילו מעבדים רגילים של מחשבים ניידים מסוגלים להחזיק אותו בזיכרון בלי שום בעיה. כל מה שצריך כדי להריץ זה להתקין את ספריית transformers מגרסה 4.34 ומעלה.

אם אתם צריכים רק לבדוק רעיון או לפתח פיצ'ר שלא דורש פרטיות מלאה, שליחת קריאות למודל גדול דרך API תיתן תוצאות עמוקות יותר בחלקיק מהמאמץ. הרצה מקומית של המודל הזה מתאימה רק אם אתם באמת חייבים שהכל ירוץ על הברזלים שלכם בלי תלות ברשת.

ollama run hf.co/TinyLlama/TinyLlama-1.1B-Chat-v0.6:Q4_0

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

רישיון apache-2.0 מאפשר שימוש חופשי לחלוטין, כולל שימוש מסחרי, שינוי הקוד והפצה של המודל בתוך המוצר שלכם. התנאי המרכזי הוא שמירה על הודעות זכויות היוצרים והרישיון המקורי, בלי חובת פתיחה של הקוד הפרטי שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗