GPT
T

TinyLlama-1.1B-Chat-v0.3-GGUF

קוד פתוח

TheBlokeapache-2.02023-10-03

  • transformers
  • gguf
  • tinyllama
  • en

גרסת צ'אט מכווצת שמבוססת על Llama 2 ורצה כמעט על כל מחשב בלי כרטיס מסך ייעודי. היא מתאימה למי שחייב מודל מקומי קל משקל ולא מוכן לשלם על שרתים יקרים.

  • 7.9 GBמשקל הקבצים
  • 44,493הורדות בחודש
  • 48לייקים

מה זה

הפרויקט הזה לוקח את הארכיטקטורה והטוקנייזר של Llama 2 ומכווץ אותם לגודל של 1.1 מיליארד פרמטרים. הגרסה הספציפית הזו היא כוונון עדין לצ'אט על בסיס צעד ביניים של טריליון טוקנים מתוך שלושה מתוכננים, כשהאימון בוצע על דאטה סט השיחות של OpenAssistant בפורמט ChatML. TheBloke המיר אותו לפורמט GGUF, מה שמאפשר להריץ אותו ישירות דרך מעבד רגיל בכלים כמו llama.cpp.

בשונה ממודלים גדולים שדורשים תשתית ענן מורכבת, כאן כל המודל תופס פחות מג'יגה בייט ברוב גרסאות הכימות. הוא נועד לענות על שאלות ולנהל שיחה בסיסית תוך שימוש במעט מאוד משאבים, אם כי היכולת שלו נופלת משמעותית ממודלים מלאים של שבעה מיליארד פרמטרים ומעלה.

מתאים ל

  • בוט שיחה במכשיר קצה

    הוא דורש פחות מ־4 ג'יגה זיכרון, ולכן מתאים למחשבים חלשים ללא חיבור רציף לרשת.

  • מיון טקסטים באנגלית

    הוא מגיב מהר על מעבד רגיל ומספיק למשימות תיוג קצרות שלא מצדיקות עלויות ענן.

  • בדיקות ופיתוח מקומי

    מאפשר לבדוק שרשראות קריאה ואינטגרציות ב־LangChain בלי לשלם על טוקנים בכל הרצה.

איפה זה נופל

המודל אומן רק על אנגלית, והוא מבוסס על שלב ביניים מוקדם של תהליך האימון, 480 אלף צעדים מתוך היעד הסופי. בגודל של 1.1 מיליארד פרמטרים הוא נוטה להמציא עובדות, מתקשה בחשיבה רב שלבית, וכימותים אגרסיביים מתחת ל־4 ביט גורמים לירידה ניכרת באיכות הפלט. אל תבנו עליו לעברית או לניתוח טקסט עמוק בלי בדיקה מקיפה מראש.

אותה משפחה

TinyLlama יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל עובד טוב בעברית?

הכרטיס מגדיר תמיכה באנגלית בלבד. הארכיטקטורה והאימון מתמקדים באנגלית, ולכן כל ניסיון לייצר בעברית יפיק פלטים משובשים או חסרי היגיון.

האם כדאי להוריד את כל הקבצים שבעמוד?

לא, הריפו מכיל מגוון רחב של כימותים שונים לאותו מודל. בוחרים קובץ אחד בלבד, למשל tinyllama-1.1b-chat-v0.3.Q4_K_M.gguf, ומורידים רק אותו לפי מגבלות החומרה שלכם.

איך מריצים

קובץ בודד שוקל בין 0.48 ל־1.17 ג'יגה בייט, ותצטרכו בין 3 ל־3.7 ג'יגה בייט של זיכרון עבודה כדי להריץ אותו על המעבד בלי כרטיס מסך. הגרסאות המומלצות בכרטיס הן Q4_K_M לאיזון טוב או Q5_K_M לאיבוד איכות מינימלי, בעוד שכימותים נמוכים כמו Q2_K מאבדים יותר מדי דיוק ולא מומלצים.

מריצים אותו מקומית דרך llama.cpp, LM Studio, או בספריות פייתון כמו ctransformers. אם המשימה שלכם כוללת לוגיקה מורכבת, עדיף לקרוא ל־API חיצוני כמו OpenAI, כי המודל הזה מתאים בעיקר לתשובות מהירות ומשימות מוגדרות היטב.

ollama run hf.co/TheBloke/TinyLlama-1.1B-Chat-v0.3-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא Apache 2.0. מותר להשתמש במודל, לשנות אותו ולשלב אותו במוצרים מסחריים או פנימיים בחינם, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי בקוד או בהפצה.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗