GPT
L

unsloth/Llama-3.2-1B-Instruct-GGUF

קוד פתוח

unslothllama3.22024-09-25

  • transformers
  • gguf
  • llama
  • text-generation
  • llama-3

גרסת GGUF מכווצת של המודל הקטן של מטא, שמתאימה למי שרוצה להריץ מודל שיחה ישירות על מעבד מקומי בלי לגעת בשרתים יקרים.

  • 131,072טוקנים בהקשר
  • 23.2 GBמשקל הקבצים
  • 32,867הורדות בחודש
  • 71לייקים

מה זה

המאגר הזה מכיל המרות של מודל ההוראות בגודל מיליארד פרמטרים ממשפחת Llama 3.2. מטא אימנה אותו למשימות שיחה, סיכום ושליפת מידע, כשהייחוד המרכזי בגודל הזה הוא חלון הקשר עצום של 131,072 טוקנים. בדרך כלל מודלים קטנים כאלה מגיעים עם חלון צר מאוד, וכאן יש יכולת תיאורטית להעמיס טקסטים שלמים ישירות לתוך הפרומפט.

צוות Unsloth ארז כאן קבצים ברמות כימות שונות, החל מגרסאות 16 ביט ועד גרסאות דחוסות של 2 ביט. המודל מתמקד ביצירת טקסט בלבד ועבר כוונון עם משוב אנושי כדי להתאים לשיחה. הוא בנוי לעבודה רזה, אך בגודל כזה היכולות שלו מוגבלות בעיקר להבנת הוראות ישירות ולא לפתרון בעיות סבוכות.

מתאים ל

  • סיכום טקסטים באנגלית

    מתאים לעיבוד מקומי וזול של מאמרים קצרים באנגלית בלי להוציא מידע מחוץ למכשיר.

  • סיווג נתונים ושיחות

    עובד מהר על מעבדים פשוטים לצורך מיון פניות או חילוץ פרטים קבועים מתוך טקסט.

  • בוט שיחה קל למכשיר קצה

    צורך מעט מאוד משאבים ומספק תשובות בסיסיות להוראות ישירות ללא תלות ברשת.

איפה זה נופל

מודל של מיליארד פרמטרים עושה טעויות, ממציא עובדות בקלות ומתקשה מאוד בחשיבה רב-שלבית. בנוסף, רשימת השפות הנתמכות רשמית כוללת שמונה שפות בלבד כמו אנגלית, גרמנית ותאילנדית. עברית אינה ברשימה הזו, ולכן אי אפשר להסתמך עליו לפרויקטים בעברית בלי בדיקה מקיפה או אימון מקדים.

גם חלון ההקשר הגדול עלול להטעות. העובדה שהוא מסוגל לקבל 131 אלף טוקנים לא אומרת שהוא מצליח לעבד אותם בלי לאבד פרטים חשובים באמצע הטקסט.

אותה משפחה

Llama-3.2 יצא ב־6 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך בעברית בצורה טובה?

עברית אינה מופיעה ברשימת שמונה השפות הנתמכות שהוגדרו בכרטיס המודל. הוא אומן על טקסטים נוספים מעבר לרשימה, אבל כדאי לבדוק אותו היטב לפני שימוש כי הוא עלול לשבש משפטים או לייצר שגיאות תחביר.

איזו גרסת כימות כדאי להוריד מתוך המאגר?

עבור רוב השימושים על מחשב אישי, קובץ בכימות של 4 ביט או 5 ביט נותן יחס מאוזן בין גודל בזיכרון לבין איכות הפלט. אין סיבה אמיתית לרדת ל־2 ביט אלא אם החומרה שלכם חנוקה לחלוטין במשאבים.

איך מריצים

לא צריך כרטיס מסך ייעודי כדי להריץ את המודל הזה. בגלל שמדובר בפורמט GGUF ובמודל של מיליארד פרמטרים בלבד, גרסאות הביניים כמו 4 ביט או 5 ביט רצות בקלות על זיכרון של מחשב נייד ממוצע או מעבד פשוט, ותופסות מעט מאוד גיגה-בייטים של זיכרון עבודה.

גרסאות 16 ביט או 8 ביט שומרות על דיוק גבוה יותר אבל דורשות יותר זיכרון, בעוד גרסאות 2 ביט ו־3 ביט חוסכות מקום במחיר פגיעה חדה באיכות הפלט. אם המשימה שלכם דורשת ניתוח לוגי עמוק, עדיף לפנות למודל גדול יותר דרך שירות ענן, כי להריץ מיליארד פרמטרים מקומית שווה בעיקר כשחשוב לכם שהמידע לא ייצא מהמחשב.

ollama run hf.co/unsloth/Llama-3.2-1B-Instruct-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא Llama 3.2 Community License של מטא, שמאפשר שימוש מסחרי חופשי תחת תנאי הרישוי והשימוש ההוגן שלהם. אם המוצר שלכם עובר מאות מיליוני משתמשים יש צורך לבקש אישור מיוחד ממטא, אך לרוב הפיתוחים והעסקים השימוש פתוח לחלוטין.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗