GPT
L

unsloth/Llama-3.2-1B

קוד פתוח

unslothllama3.22024-09-25

  • transformers
  • safetensors
  • llama
  • text-generation
  • llama-3

גרסה מוקטנת וזריזה שמיועדת לאימון מקומי מהיר וריצה חסכונית. הפתרון מתאים למי שצריך מודל טקסט בסיסי בלי להחזיק שרת יקר או לשלם על כל קריאה.

  • 1.2Bפרמטרים
  • 131,072טוקנים בהקשר
  • 2.3 GBמשקל הקבצים
  • 124,955הורדות בחודש

מה זה

המשקל הזה מביא את מודל הבסיס של מטא בגרסת 1.2 מיליארד פרמטרים, כשהוא מותאם לעבודה חלקה דרך הכלים של unsloth. הוא מיועד ליצירת טקסט, ומגיע עם חלון הקשר עצום ביחס לגודלו שעומד על 131,072 טוקנים. בארכיטקטורה יש 16 שכבות ושימוש במנגנון Grouped-Query Attention, מה שמסייע ביעילות הריצה.

מטא מציינת שהמשפחה הזו נבנתה לשימושים של סיכום, אחזור מידע ושיחה, כשהיא אמורה להתחרות במודלים פתוחים וסגורים מקבילים. היתרון שמציעים כאן הוא בעיקר סביב תהליך הכוונון העדין. החבילה נבנתה כדי לקצר את זמני האימון פי כמה ולחסוך בעלויות זיכרון העבודה, כך שאפשר לאמן אותו מאפס על נתונים פרטיים בלי להסתבך עם קלאסטרים מורכבים.

מתאים ל

  • אימון מקומי חסכוני

    הוא שוקל 2.3 גיגה בלבד, מה שמאפשר כוונון עדין על חומרת קצה או כרטיס מסך בודד ופשוט.

  • עיבוד מסמכים באנגלית

    חלון של 131,072 טוקנים נותן אפשרות להזין טקסטים ארוכים ישירות לתוך מודל קל משקל.

  • מיון וחילוץ נתונים

    אחרי אימון קצר על דוגמאות מוגדרות, הוא מסוגל לבצע משימות סיווג ופליטת טקסט קבועות בעלות אפסית.

איפה זה נופל

זהו מודל הבסיס הגולמי ולא גרסת הוראות, מה שאומר שהוא מייצר המשך טקסט ולא בהכרח עונה ישירות לשאלות בלי כוונון מקדים. בנוסף, רשימת השפות הרשמיות כוללת שמונה שפות בלבד כמו אנגלית, גרמנית, ספרדית ותאילנדית. עברית לא נכללת ברשימה הנתמכת הזו.

מודל סטטי בגודל 1.2 מיליארד פרמטרים נוטה להזיות בהסמכות עובדתיות מורכבות ומוגבל בלוגיקה קשה. חלון ההקשר אומנם רחב, אבל במודלים קטנים יכולת השליפה והדיוק בתוך טקסטים ארוכים דורשת בדיקה יסודית לפני שמשלבים אותם בזרימת עבודה אמיתית.

אותה משפחה

Llama-3.2 יצא ב־6 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל מבין ועונה בעברית בצורה טבעית?

הוא אומנם נחשף לשפות נוספות מעבר לשמונה השפות הרשמיות, אך עברית אינה ברשימה הנתמכת של מטא. בלי כוונון עדין ממוקד לדאטה עברי, התוצאות בעברית עלולות להיות חלשות ולא מדויקות.

מה ההבדל בין המשקל הזה למודל המקורי של מטא?

המשקלים והארכיטקטורה זהים למודל המקורי, אך הקבצים הוכנו לעבודה ישירה עם הכלים של unsloth. המבנה הזה מיועד לאפשר כוונון מהיר יותר וצריכת זיכרון נמוכה משמעותית בזמן אימון.

איך מריצים

בזכות משקל כולל של 2.3 גיגה בייט בלבד ובדיוק של bfloat16, אפשר להריץ ולאמן אותו ישירות על מעבד גרפי פשוט וזול כמו Tesla T4 בסיסי, למשל בסביבות ענן חינמיות. הוא עובד ישירות עם ספריית transformers, ומי שרוצה לחסוך עוד יותר במשאבים יכול לייצא אותו למבני GGUF או לעבוד איתו בפורמטים מכווצים של 4 ביט.

ההרצה המקומית הגיונית מאוד אם אתם רוצים לעשות fine-tuning על דאטה פנימי בלי להוציא אותו החוצה. לעומת זאת, אם כל מה שאתם צריכים זה מענה כללי ומזדמן לשאלות מורכבות, עדיף לפנות למודל גדול בהרבה דרך שירות חיצוני, כי מודל בגודל כזה לא מתחרה בעומק ההבנה של מפלצות הענן.

from transformers import pipeline

pipe = pipeline("text-generation", model="unsloth/Llama-3.2-1B")
print(pipe("שלום"))

הקבצים

8 קבצים במאגר, 2.3 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

השימוש כפוף לרישיון הקהילתי של Llama 3.2. מדובר ברישיון מסחרי מותאם אישית של חברת מטא, שמאפשר שימוש במוצרים מסחריים כל עוד עומדים במדיניות השימוש המקובל שלהם ומקפידים על מגבלות ההפצה והיקף המשתמשים שהוגדרו במסמך המקורי.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗