GPT
T

TinyLlama-1.1B-Chat-v1.0

קוד פתוח

TinyLlamaapache-2.02023-12-30

  • transformers
  • safetensors
  • llama
  • text-generation
  • conversational

זה מודל שיחה קטן של 1.1 מיליארד פרמטרים שרץ כמעט על כל מחשב. הוא נועד למקרים שבהם חייבים מודל מקומי בלי שרתים כבדים ובלי חשבונות ענן תופחים.

  • 1.1Bפרמטרים
  • 2,048טוקנים בהקשר
  • 2.1 GBמשקל הקבצים
  • 1,626,567הורדות בחודש

מה זה

מדובר בגרסת שיחה שאומנה מראש על 3 טריליון טוקנים ועברה כוונון עדין לפי המתכון של Zephyr. המפתחים השתמשו בנתוני שיחות סינתטיים מ־UltraChat וביצעו יישור באמצעות DPOTrainer על מאגר UltraFeedback שמדורג לפי GPT-4. המבנה שלו זהה לחלוטין לארכיטקטורה ולטוקנייזר של Llama 2, מה שאומר שהוא מתחבר ישירות לכלים קיימים בלי התאמות מיוחדות.

ההבדל המרכזי מול מודלים אחרים בקטגוריה הזו הוא שילוב של בסיס שלמד המון טוקנים יחסית לגודלו יחד עם תהליך DPO מובנה. במקום מודל בסיס שדורש אימון נוסף כדי לענות להוראות, מקבלים ישר מודל שמגיב לשאלות ולשיחה פתוחה באנגלית ישר מהקופסה.

מתאים ל

  • ריצה במכשירי קצה

    שוקל רק 2.1 גיגה בייט ולכן נכנס במעבדים חלשים בלי צורך בכרטיס מסך ייעודי.

  • עוזר שיחה מקומי

    עבר כוונון DPO ומגיב לפקודות שיחה באנגלית בלי לגעת ברשת חיצונית.

  • שילוב בפרויקטי Llama 2

    משתמש באותו טוקנייזר וארכיטקטורה בדיוק, מה שמאפשר להחליף מודלים גדולים לבדיקות.

איפה זה נופל

גודל של 1.1 מיליארד פרמטרים מציב רף יכולת נמוך. הוא פגיע להזיות, מתקשה מאוד במשימות הסקה מורכבות, ואינו מתאים לשום משימה שדורשת דיוק עובדתי קריטי. חלון ההקשר עומד על 2,048 טוקנים בלבד, כך שאי אפשר להזין מסמכים ארוכים או לנהל שיחות מתמשכות בלי לאבד את ההתחלה. בנוסף, המודל אומן על אנגלית בלבד. בעברית הוא פשוט לא יעבוד כמו שצריך, ואסור לשלב אותו במוצר בלי לבדוק לעומק את איכות התשובות והבטיחות שלהן.

אותה משפחה

TinyLlama יצא ב־6 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל הזה מתאים לעבודה בעברית?

לא. המודל מוגדר ומאומן על אנגלית בלבד. אם תפנו אליו בעברית תקבלו תוצאות משובשות, חוסר הבנה או ג'יבריש מוחלט.

באיזו חומרה חייבים להשתמש כדי לראות ביצועים טובים?

הוא לא דורש חומרה יקרה. כל מעבד מודרני במחשב נייד או כרטיס מסך בסיסי עם 4 גיגה זיכרון יריצו אותו במהירות טובה מאוד.

איך מריצים

כדי להריץ אותו צריך רק את ספריית transformers מגרסה 4.34 ומעלה. עם משקל של 2.1 גיגה בייט בדיוק bfloat16, הוא נכנס בקלות לזיכרון של כרטיס מסך ביתי פשוט, ואפשר להריץ אותו ישירות על מעבד של מחשב נייד רגיל בלי להרגיש חנק במשאבים.

אם אתם צריכים לוגיקה מורכבת, קריאות לפונקציות או עבודה בנפח אדיר, עדיף לפנות ל־API של מודל ענק כמו GPT-4 או מודלים גדולים אחרים. TinyLlama מתאים כשרוצים עצמאות מלאה, ריצה על מכשירי קצה או סביבות שאין בהן חיבור רשת.

from transformers import pipeline

pipe = pipeline("text-generation", model="TinyLlama/TinyLlama-1.1B-Chat-v1.0")
print(pipe("שלום"))

הרישיון

המודל שוחרר ברישיון apache-2.0. זה אומר שמותר להשתמש בו לצרכים מסחריים, לשנות אותו, לאמן אותו מחדש ולהפיץ אותו בתוך המוצר שלכם בלי תשלום תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗