GPT
L

llama-3-8b-bnb-4bit

קוד פתוח

unslothllama32024-04-18

  • transformers
  • safetensors
  • llama
  • text-generation
  • llama-3

גרסת 4-ביט מכווצת של מודל הבסיס מבית מטא, שמגיעה במשקל 5.3 גיגה-בייט בלבד. היא מיועדת למי שרוצה לאמן או להריץ אותו מקומית על כרטיסי מסך בסיסיים בלי לחנוק את הזיכרון.

  • 8.2Bפרמטרים
  • 8,192טוקנים בהקשר
  • 5.3 GBמשקל הקבצים
  • 14,700הורדות בחודש

מה זה

החבילה הזו לוקחת את מודל השפה הפתוח של מטא ומגישה אותו בכימות bitsandbytes מוכן מראש. מדובר במודל בסיס של 8.2 מיליארד פרמטרים שאומן על מעל 15 טריליון טוקנים, עם חלון הקשר של 8,192 טוקנים ומנגנון Grouped-Query Attention לשיפור מהירות ההסקה. במבחני ביצועים כלליים כמו MMLU הוא מציג 66.6 נקודות, ובמבחן ההיגיון ARC-Challenge הוא מגיע ל־78.6, תוצאות שמשאירות אבק למודלים מהדור הקודם באותו סדר גודל.

בניגוד לגרסת ה־Instruct, המודל הזה הוא מודל בסיס גולמי. הוא לא עבר התאמה לשיחה מול משתמש ולא עבר תהליכי יישור עם בני אדם, אלא יודע לחזות את הטוקן הבא. היתרון הגדול שלו מול משקלי המקור הוא התאימות המיידית לעבודה קלה ואימון חסכוני דרך הכלים של unsloth.

מתאים ל

  • אימון LoRA על חומרה זולה

    משקל של 5.3 גיגה מאפשר לדייק את המודל על דאטה ייעודי גם על כרטיס T4 בסיסי בחינם.

  • השלמת טקסט וקוד גולמי

    מבנה מודל הבסיס מצטיין בהמשך ישיר של משפטים, סכמות נתונים ומבני קוד באנגלית.

  • חילוץ מידע מדאטה מקומי

    חלון של 8,192 טוקנים מאפשר לעבד מסמכים עסקיים שלמים בתוך תשתית פרטית ומאובטחת.

איפה זה נופל

המודל מוגדר רשמית לעבודה באנגלית בלבד. כל ניסיון לעבוד איתו בעברית ייתקל בביצועים חלשים ובחוסר הבנה, אלא אם תאמנו אותו מחדש על דאטה מקומי. נתוני האימון שלו נעצרו במרץ 2023, כך שהוא לא מכיר שום אירוע שהתרחש מאז.

חשוב לזכור שזהו מודל בסיס ולא מודל שיחה. הוא לא יענה לפקודות ישירות אלא ינסה להמשיך את הטקסט שקיבל. בנוסף, מטא מציינים במפורש שהוא עלול לייצר מידע שגוי, להציע קוד לא מאובטח, ולהפגין הטיות, כך שאי אפשר לחבר אותו למוצר ייצורי בלי שכבת סינון ובדיקות בטיחות.

אותה משפחה

llama-3 יצא ב־6 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר לדבר איתו בצ'אט כמו ChatGPT ישר מהקופסה?

לא. מדובר במודל בסיס ולא בגרסת Instruct שעברה התאמה לשיחה. אם תשאלו אותו שאלה, הוא ינסה להשלים את השאלה ולא לענות עליה, אלא אם תאמנו אותו מראש לשיחה.

איך המודל מתמודד עם טקסט בעברית?

הכרטיס מגדיר את המודל לאנגלית בלבד. הוא לא אומן ולא נבדק על עברית, ולכן לא מומלץ להשתמש בו למשימות בעברית בלי לבצע קודם אימון מקיף.

מה היתרון של הגרסה הזו מול הגרסה הרשמית של מטא?

הגרסה הזו עברה כימות מראש ל־4-ביט על ידי unsloth. אתם מורידים קבצים במשקל 5.3 גיגה במקום קבצי ענק, וחוסכים זמן הגדרה ומשאבי זיכרון בזמן הטעינה והאימון.

איך מריצים

המשקל הכולל של הקבצים עומד על 5.3 גיגה-בייט, מה שמאפשר לטעון אותו בקלות לכרטיס מסך בודד וצנוע כמו Tesla T4 בענן, ואפילו לכרטיסים ביתיים עם 8 או 12 גיגה זיכרון VRAM. unsloth מציעים מחברות מוכנות שמאפשרות להתחיל אימון LoRA מיד דרך ספריית transformers.

אם אתם רק צריכים צ'אטבוט גנרי באנגלית, אין טעם להרים בשבילו שרת משלכם, עדיף לקרוא ל־API של שירות קיים. הריצה העצמאית משתלמת כשאתם רוצים להריץ אימון נוסף על דאטה פרטי משלכם, או כשאתם חייבים שליטה מוחלטת על החומרה בלי תלות ברשת.

from transformers import pipeline

pipe = pipeline("text-generation", model="unsloth/llama-3-8b-bnb-4bit")
print(pipe("שלום"))

הרישיון

המודל משוחרר תחת רישיון קהילתי ייעודי של Llama 3 שמתיר שימוש מחקרי ומסחרי. התנאים כוללים ציות למדיניות השימוש ההוגן של מטא, ואיסור על שימוש במודל בשפות שאינן אנגלית אלא אם ביצעתם אימון ייעודי לכך.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗