GPT
L

lmstudio-community/Llama-3.3-70B-Instruct-GGUF

קוד פתוח

lmstudio-communityllama3.32024-12-06

  • gguf
  • facebook
  • meta
  • llama
  • llama-3

גרסת קוונטיזציה של מטא שמביאה ביצועים של מודל ענק לגודל של 70 מיליארד פרמטרים. מיועד למי שרוצה חלון הקשר של 128 אלף טוקנים על שרת משלו.

  • 198 GBמשקל הקבצים
  • 21,636הורדות בחודש
  • 55לייקים

מה זה

מטא בנו את הדגם המקורי, בארטובסקי עשה את ההמרה לפורמט GGUF דרך llama.cpp, וקהילת LM Studio ארזה אותו להרצה מקומית. הטענה המרכזית סביבו היא שהוא מגיע לרמת הביצועים של Llama 3.1 405B, רק עם 70 מיליארד פרמטרים בלבד. אם זה מחזיק במבחן המציאות, אתם מקבלים איכות של מודל קצה בלי צורך באשכול שרתים מנופח.

הוא מיועד ליצירת טקסט ומגיע עם תמיכה רשמית בשמונה שפות: אנגלית, גרמנית, צרפתית, איטלקית, פורטוגזית, הינדי, ספרדית ותאית. חלון ההקשר עומד על 128 אלף טוקנים, כך שאפשר להזין לו מסמכים כבדים בלי לחתוך אותם לחתיכות קטנות.

מתאים ל

  • עיבוד מסמכים ארוכים

    חלון של 128 אלף טוקנים מאפשר לקרוא קבצים כבדים בניתוח אחד, בתנאי שהם בשפות הנתמכות.

  • חלופה למודלי ענק

    נותן איכות מקבילה למודל 405B על תשתית מקומית צנועה יותר של 70B.

  • תרגום לשפות אירופיות

    מתאים במיוחד לעבודה שוטפת מול שפות כמו גרמנית, צרפתית, ספרדית ופורטוגזית.

איפה זה נופל

עברית לא מופיעה ברשימת השפות הנתמכות של המודל. הוא מכיר רשמית רק אנגלית, גרמנית, צרפתית, איטלקית, פורטוגזית, הינדי, ספרדית ותאית, כך שכל ניסיון לעבוד איתו בעברית ידרוש בדיקה יסודית כדי לראות שהוא לא ממציא מילים או מאבד את ההקשר.

בנוסף, הכרטיס מזהיר במפורש שהתוכן עלול להיות פוגעני, שגוי או מטעה, כך שאי אפשר להסתמך עליו בעיניים עצומות במערכות קריטיות.

שאלות
נפוצות

האם כדאי להוריד אותו בשביל לפתח אפליקציה בעברית?

המודל לא הוגדר רשמית כתומך בעברית, אלא רק בשמונה שפות אחרות. הוא עשוי להחזיר פלט בעברית ברמה מסוימת, אבל הסיכון להזיות ולתחביר שבור גבוה מאוד בלי אימון ייעודי.

איזה סוג חומרה מינימלי צריך כדי להריץ את הקבצים האלה?

הקבצים שוקלים 198 גיגה בייט במצטבר. תצטרכו שרת עם כמה כרטיסי מסך חזקים או מחשב מקצועי עם זיכרון מאוחד של מעל 64 גיגה לפחות כדי להריץ גרסה מכווצת.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־198 גיגה בייט שמחולקים לשמונה קבצים. כדי להריץ משקל כזה בזיכרון תצטרכו כרטיסי מסך חזקים עם עשרות גיגות של VRAM או תחנת עבודה עם זיכרון מאוחד גדול, בהתאם לקוונט שתבחרו בפועל.

אם יש לכם מחשב ביתי ממוצע או שרת ענן פשוט, אין מה לנסות לדחוף אותו פנימה כי הוא פשוט יזחל. במצב כזה, עדיף בהרבה לקרוא לו דרך API מסודר של ספק ענן מאשר לקנות חומרה ייעודית.

ollama run hf.co/lmstudio-community/Llama-3.3-70B-Instruct-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא רישיון llama3.3 של מטא. הוא מאפשר שימוש מסחרי, אבל כפוף לתנאי השימוש והמגבלות של מטא על מודלים ממשפחת לאמה, כולל מגבלות על היקף משתמשים חודשי של מוצרים מסחריים.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗