GPT
T

TinyLlama-1.1B-Chat-v1.0-GGUF

קוד פתוח

TheBlokeapache-2.02023-12-31

  • transformers
  • gguf
  • tinyllama
  • en
  • conversational

מודל שיחה זעיר שרץ כמעט על כל מעבד בלי לדרוש שרת ייעודי. פתרון מתאים למי שחייב מודל מקומי קל משקל ולא מחפש יכולות ניתוח מורכבות.

  • 7.9 GBמשקל הקבצים
  • 72,732הורדות בחודש
  • 236לייקים

מה זה

מדובר בגרסת GGUF שעברה כימות של מודל קומפקטי בן 1.1 מיליארד פרמטרים. הבסיס שלו אומן על שלושה טריליון טוקנים לפי הארכיטקטורה והטוקנייזר של לאמה שתיים, ועבר כיוונון לשיחה עם המתכון של זפיר דרך מאגרי השיחות אולטרה צ'אט ומשוב אולטרה פידבק. המטרה כאן היא לא להתחרות במודלי ענק, אלא לספק יכולת שיחה בסיסית בפורמט קל להטמעה.

המודל מיועד לעבודה מקומית ומציע תאימות מלאה לכלים מבוססי לאמה סי פי פי. אין כאן מדידות ביצועים ספציפיות בכרטיס, אך נפח הפרמטרים הנמוך מעיד על מהירות ריצה גבוהה במחיר של עומק הבנה מוגבל. הוא יודע לענות על שאלות ישירות ולנהל אינטראקציה פשוטה באנגלית, אך מתקשה במשימות שדורשות לוגיקה כבדה.

מתאים ל

  • סיווג טקסט מקומי

    מיון מהיר של טקסטים קצרים ישירות במעבד של מחשב פשוט ללא כרטיס גרפי.

  • מענה פשוט במכשירי קצה

    בוט בסיסי הפועל במצב לא מקוון בחומרה מוגבלת זיכרון.

  • בדיקות אוטומציה ופיתוח

    אימות זרימת עבודה ופרומפטים בזול בלי לשלם על קריאות רשת.

איפה זה נופל

גודל של 1.1 מיליארד פרמטרים גובה מחיר כבד. המודל מייצר הזיות בקלות, נוטה לפספס הוראות מסובכות ולא מסוגל להתמודד עם הנמקה מורכבת או משימות קוד מעבר לדוגמאות טריוויאליות. הוא מוגדר רשמית לאנגלית בלבד, כך שלא כדאי לבנות עליו לפעולות בעברית. לפני שמשלבים אותו בזרימת עבודה, צריך לבדוק היטב אם הוא מצליח לשמור על עקביות במבנה הפלט הנדרש.

אותה משפחה

TinyLlama יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

איזה קובץ כדאי להוריד מתוך הרשימה?

עדיף לבחור בגרסת Q4_K_M ששוקלת 0.67 גיגה בייט ודורשת קצת יותר משלושה גיגה זיכרון. גרסאות נמוכות מ־4 ביט מאבדות איכות באופן מורגש ולא מומלצות למרבית השימושים.

האם המודל תומך בעברית בצורה טובה?

המודל הוגדר ואומן באנגלית בלבד. הוא עשוי לפלוט מילים בודדות בעברית, אך אי אפשר לסמוך עליו לשיחה או להבנת טקסטים בעברית.

איך מריצים

אתם מורידים קובץ בודד בלבד מתוך המאגר, ולא את כל החבילה. לרוב השימושים גרסת Q4_K_M במשקל 0.67 גיגה בייט מספקת איזון טוב, ודורשת כ־3.17 גיגה בייט זיכרון עבודה בריצה על המעבד בלבד. אם תרצו איכות מעט טובה יותר במחיר של קובץ כבד יותר, גרסת Q5_K_M שוקלת 0.78 גיגה בייט.

אפשר להריץ אותו דרך ספריות כמו לאמה סי פי פי פייתון או ממשקים כמו טקסט ג'נריישן ווב יו איי ואל אם סטודיו. אם אתם צריכים רק מדי פעם תשובה מהירה ואיכותית ולא כבולים לפרטיות מוחלטת על המכשיר, עדיף לפנות לשרותי ענן חיצוניים כי התוצאה שלהם תהיה חכמה בהרבה.

ollama run hf.co/TheBloke/TinyLlama-1.1B-Chat-v1.0-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא אפאצ'י שתיים אפס. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להפיץ אותו ולשלב אותו במוצרים סגורים. התנאי העיקרי הוא שמירה על הודעות זכויות היוצרים והצהרת הרישיון המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗