GPT
L

unsloth/Llama-3.2-1B-Instruct

קוד פתוח

unslothllama3.22024-09-25

  • transformers
  • safetensors
  • llama
  • text-generation
  • llama-3

מודל שיחה זעיר ששוקל קצת יותר משני ג'יגה ומגיע עם חלון הקשר ענקי. הוא פתרון טוב למי שרוצה להריץ מודל מקומית על חומרה בסיסית בלי לשלם על שרתים יקרים.

  • 1.2Bפרמטרים
  • 131,072טוקנים בהקשר
  • 2.3 GBמשקל הקבצים
  • 392,283הורדות בחודש

מה זה

מטא בנתה את הגרסה הזו לצורכי שיחה, סיכום טקסטים ומשימות אחזור, וצוות unsloth ארז אותה מחדש כדי להקל על אימון והרצה. הגודל שלו עומד על 1.2 מיליארד פרמטרים בלבד, אבל הוא מגיע עם חלון הקשר של 131,072 טוקנים, תכונה ששמורה בדרך כלל למודלים כבדים בהרבה. המבנה שלו מבוסס על מנגנון Grouped-Query Attention, מה שמסייע לחסוך זיכרון בזמן יצירת הטקסט.

הוא עבר כוונון ייעודי להוראות באמצעות שילוב של למידה מונחית ומשוב אנושי. הכרטיס מצהיר שהוא עוקף מודלים פתוחים וסגורים מקבילים במבחני ביצועים נפוצים בתעשייה, אם כי המספרים המדויקים של המבחנים לא מפורטים בעמוד. המטרה העיקרית כאן היא לתת מענה קל משקל למשימות טקסטואליות פשוטות בלי הסרבול של מודלי ענק.

מתאים ל

  • סיכום טקסטים ארוכים

    חלון ההקשר הגדול מאפשר להזין מסמכים ארוכים באנגלית ולסכם אותם במהירות על חומרה פשוטה.

  • עוזרי שיחה מקומיים

    המודל עבר התאמה מיוחדת לשיחה והוא רץ ישירות על מכשירי קצה או מחשבים ללא חיבור חיצוני.

  • משימות אחזור מידע

    מתאים לעבודה כחלק משרשרת של סוכנים לחיפוש ושליפת נתונים באנגלית מתוך מאגרי מידע.

איפה זה נופל

מטא הגדירה רשימה סגורה של שמונה שפות נתמכות רשמית, ביניהן אנגלית, גרמנית, ספרדית ותאילנדית. עברית אינה מופיעה ברשימה הזו, ולמרות שהמודל נחשף לשפות נוספות באימון המקדים, אסור לבנות עליו לעבודה בעברית בלי לבצע כוונון והתאמה יזומה. בנוסף, מדובר במודל סטטי שאומן על מידע מנותק מהרשת, ובשל גודלו הזעיר הוא מוגבל בהבנה מורכבת ועלול לטעות או לייצר מידע שגוי במשימות שדורשות היגיון עמוק.

אותה משפחה

Llama-3.2 יצא ב־6 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל מתאים לעבודה בעברית?

לא באופן רשמי. מטא ציינה תמיכה רשמית בשמונה שפות בלבד, ועברית אינה אחת מהן. הוא אומן על טקסטים בשפות נוספות, אך כדי לקבל תוצאות אמינות בעברית תצטרכו לאמן אותו בעצמכם על נתונים מתאימים.

איזו חומרה צריך כדי להריץ אותו?

הדרישות נמוכות מאוד. המודל שוקל 2.3 ג'יגה בפורמט המקורי שלו, כך שכרטיס מסך בסיסי עם 4 עד 8 ג'יגה זיכרון יספיק בקלות להרצה, ואפילו כרטיסי T4 פשוטים יכולים לבצע איתו אימון מהיר.

איך מריצים

במשקל של 2.3 ג'יגה בפורמט bfloat16, אפשר להריץ אותו כמעט על כל מחשב מודרני, מעבד גרפי פשוט, או אפילו כרטיס חינמי כמו Tesla T4 בסיסי. הוא מתאים במיוחד לפיתוח מקומי דרך ספריית transformers או להרצה בעזרת הכלים של unsloth שחוסכים שימוש בזיכרון.

אם אתם צריכים רק שאילתות בודדות או משימות קלות מאוד, הרצה עצמית על חומרה מקומית תעבוד בקלות ובלי עלות שרתים. מעבר ל־API חיצוני יהיה הגיוני רק אם אתם דורשים יכולות ניתוח עמוקות בהרבה, תמיכה מקורית בעברית, או שאין לכם עניין לנהל שרתים ותשתיות בכלל.

from transformers import pipeline

pipe = pipeline("text-generation", model="unsloth/Llama-3.2-1B-Instruct")
print(pipe("שלום"))

הרישיון

השימוש כפוף לרישיון הקהילתי של מטא, Llama 3.2 Community License. הרישיון מאפשר שימוש מסחרי, אך כולל מגבלות ספציפיות של החברה ומדיניות שימוש מקובל שיש לעמוד בהן, כולל חובת הפצה אחראית ובטוחה אם מבצעים התאמות לשפות נוספות.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗