GPT
L

Llama-3.2-3B-Instruct-GGUF

קוד פתוח

unslothllama3.22024-09-25

  • transformers
  • gguf
  • llama
  • text-generation
  • llama-3

גרסת קוונטיזציה קלה של מודל ההוראות מבית מטא, שמיועדת להרצה מקומית מהירה וחסכונית בזיכרון בלי להזדקק לשרתים כבדים.

  • 131,072טוקנים בהקשר
  • 57.2 GBמשקל הקבצים
  • 221,677הורדות בחודש
  • 77לייקים

מה זה

מדובר במודל שפה בגודל שלושה מיליארד פרמטרים שעבר אימון להוראות ולשיחה, ומגיע כאן בפורמט שמיועד לטעינה ישירה על מעבדים או כרטיסי מסך צנועים. הוא תומך בהקשר עצום של 131,072 טוקנים, מה שמאפשר להזין לו מסמכים שלמים למשימות סיכום ושליפה מבלי לחתוך את הטקסט לחלקים קטנים.

המודל אומן מראש לשימושים מבוססי סוכנים, מענה לפקודות ושיחה בכמה שפות עיקריות. מטא ביצעה עליו כוונון עדין עם משוב אנושי לבטיחות ותאימות, וההסבה לפורמט הדחוס שומרת על יכולות אלה תוך צמצום ניכר בדרישות החומרה ביחס למודלים גדולים יותר.

מתאים ל

  • סיכום מסמכים ארוכים

    חלון ההקשר העצום מאפשר לנתח קבצים שלמים ברצף אחד על חומרה מקומית בסיסית.

  • סוכני שיחה מקומיים

    הוא עבר התאמה מובנית לשיחה ולשליפת מידע, ומתאים למענה מהיר באנגלית ושפות נתמכות.

  • אימון ייעודי בעלות נמוכה

    המשקל הקל מאפשר לבצע עליו כוונון מהיר מאוד תוך חיסכון של מעל חמישים אחוז בזיכרון.

איפה זה נופל

המודל תומך רשמית רק בשמונה שפות: אנגלית, גרמנית, צרפתית, איטלקית, פורטוגזית, הינדי, ספרדית ותאילנדית. עברית אינה מופיעה ברשימת השפות הנתמכות, ולכן עיבוד טקסט בעברית עלול לייצר שגיאות או ניסוחים משובשים אלא אם מבצעים אימון נוסף. בנוסף, מדובר במודל סטטי שאומן על נתונים לא מקוונים, כך שהוא אינו מכיר אירועים עדכניים ללא חיבור לכלי אחזור חיצוניים.

אותה משפחה

Llama-3.2 יצא ב־6 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל מתאים לעבודה בעברית?

הוא לא מוגדר רשמית כתומך בעברית, אלא בעיקר באנגלית ובשבע שפות נוספות. לשימוש אמין בעברית תצטרכו לאמן אותו מחדש על דאטה ייעודי.

איזה קובץ כדאי להוריד מתוך המאגר?

המאגר כולל גרסאות מדיוק של שתי סיביות ועד שש עשרה סיביות. לרוב מומלץ לבחור בגרסת ארבע או חמש סיביות, שמספקת איזון טוב בין צריכת זיכרון נמוכה לאיכות טקסט.

איך מריצים

אין צורך בחומרת שרתים יקרה כדי לעבוד איתו. אפשר להריץ אותו מקומית על מעבד רגיל או מאיץ גרפי פשוט כמו כרטיס טי ארבע חינמי בענן, בזכות חבילות הקוונטיזציה שנעות מגרסאות של שתי סיביות ועד שש עשרה סיביות. ככל שבוחרים דיוק נמוך יותר של שלוש או ארבע סיביות, צריכת הזיכרון יורדת בחצי ויותר על חשבון פגיעה קלה באיכות הפלט.

אם אתם צריכים רק מענה נקודתי בלי תחזוקה מקומית, שימוש בממשק מרוחק יכול לחסוך התעסקות. מצד שני, ההרצה המקומית משתלמת מיד כשרוצים שליטה מלאה במידע ופרטיות מוחלטת.

ollama run hf.co/unsloth/Llama-3.2-3B-Instruct-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

השימוש כפוף לרישיון הקהילתי של לאמה 3.2 מבית מטא. הרישיון מאפשר שימוש מסחרי מותנה, אך מחייב לעמוד במדיניות השימוש המקובל ובמגבלות הפצה שהוגדרו במקור. פיתוח מוצרים סביבו מחייב בדיקה של תנאי ההסכם המקוריים.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗