GPT
L

Llama-3.2-1B-Instruct-GGUF

קוד פתוח

bartowskillama3.22024-09-25

  • gguf
  • facebook
  • meta
  • llama
  • llama-3

גרסה מכווצת של המודל הקטן ביותר בסדרת Llama 3.2, המיועדת להרצה מקומית על חומרה בסיסית. הוא שוקל פחות מג'יגה ברוב הפורמטים ומתאים למשימות טקסט פשוטות כשרוצים אפס עלויות שרת.

  • 16.0 GBמשקל הקבצים
  • 133,359הורדות בחודש
  • 176לייקים

מה זה

מדובר בהמרה של דגם Llama 3.2 בעל מיליארד פרמטרים לפורמט GGUF באמצעות llama.cpp וטכניקת imatrix. המטרה כאן היא לא להתחרות במודלים הגדולים בניתוח מעמיק, אלא לספק מענה זריז ומקומי מאוד לפקודות מוגדרות מראש, כשהמשקל של רוב הקבצים נע בין 660 מגה ל־1.3 ג'יגה בלבד.

המודל אומן על שמונה שפות ספציפיות הכוללות אנגלית, גרמנית, ספרדית, צרפתית, איטלקית, פורטוגזית, הינדי ותאילנדית. עברית אינה מופיעה ברשימת השפות הרשמית, ולכן פניות בעברית עלולות להניב פלט משובש או שגוי לחלוטין. אם המשימה שלכם כוללת עברית, הוא כנראה לא הבחירה הנכונה.

מתאים ל

  • סיווג טקסט במכשיר קצה

    הוא שוקל פחות מג'יגה, עולה מיד לזיכרון וממיין טקסט פשוט מקומית בלי לגעת באינטרנט.

  • חילוץ נתונים מובנה באנגלית

    עובד טוב להמרת טקסט קצר למבנה מוגדר מראש לפי תבנית הפרומפט הרשמית של Instruct.

  • עיבוד על שבבי ARM

    הגרסאות המותאמות כמו Q4_0_4_4 מאפשרות ביצועים מהירים במיוחד על חומרת מובייל ומעבדי ARM.

איפה זה נופל

זה מודל של מיליארד פרמטרים בלבד, והציפיות צריכות להתאים. הוא יתקשה מאוד במשימות הסקה מורכבות, בלוגיקה רב־שלבית או בכתיבת קוד סבוך, והוא נוטה להזיות כשההנחיות מעורפלות. חלון ההקשר ותאריך חיתוך הידע מדצמבר 2023 מגבילים אותו למידע ישן יחסית, כך שחובה לבדוק היטב את הפלט שלו לפני שמחברים אותו לזרימת עבודה אמיתית.

אותה משפחה

Llama-3.2 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך בעברית?

לא באופן רשמי. רשימת השפות כוללת שמונה שפות בלבד, ביניהן אנגלית, ספרדית וגרמנית, ולכן הוא לא מתאים לעיבוד עברית.

איזה קובץ הכי כדאי להוריד מהרשימה?

לרוב השימושים עדיף לקחת את Q4_K_M ששוקל 810 מגה, או את Q6_K במשקל 1.02 ג'יגה לדיוק גבוה יותר בלי פגיעה מורגשת במהירות.

האם חייבים GPU של אנבידיה כדי להריץ אותו?

ממש לא. המודל שוקל פחות מג'יגה ברוב הפורמטים וירוץ במהירות גבוהה גם על מעבד רגיל בלפטוף ישן או בסביבת ARM.

איך מריצים

בגלל הגודל הזעיר, אין שום צורך בכרטיס מסך ייעודי כדי לעבוד איתו. גרסת ברירת המחדל המומלצת היא Q4_K_M ששוקלת 810 מגה בלבד, והיא רצה בלי בעיה על מעבד של לפטופ פשוט או על טלפון, ישירות דרך llama.cpp או תוכנות כמו LM Studio. יש גם גרסאות ייעודיות לשבבי ARM כמו Q4_0_4_4 שמשפרות מהירות.

אם אתם צריכים איכות טקסט מקסימלית בלי איבוד מידע בכימות, אפשר לקחת את f16 במשקל 2.48 ג'יגה. לעומת זאת, אם אתם בונים שירות שצריך לטפל במאות משתמשים בו־זמנית, שרת מקומי קטן על מעבד ייחנק תחת עומס, ושם כבר עדיף לשלם לפי טוקן ל־API חיצוני.

ollama run hf.co/bartowski/Llama-3.2-1B-Instruct-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

השימוש כפוף לרישיון llama3.2 של מטא. הוא מאפשר שימוש מסחרי ומחקר, אך כפוף למדיניות השימוש המקובל שלהם ולמגבלות על בסיס משתמשים חודשי של מעל 700 מיליון איש. אם אתם מוציאים מוצר לקהל הרחב, אתם נדרשים לשמור על תנאי הרישיון המקוריים של מטא.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗