GPT
L

Llama-3.3-70B-Instruct-GGUF

קוד פתוח

bartowskillama3.32024-12-06

  • gguf
  • facebook
  • meta
  • llama
  • llama-3

גרסת GGUF מכווצת של המודל הפתוח של מטא בנפח שבעים מיליארד פרמטרים. היא מאפשרת להריץ אותו מקומית על מחשב חזק במקום לשלם לענן.

  • 1.1 TBמשקל הקבצים
  • 54,206הורדות בחודש
  • 75לייקים

מה זה

מדובר בהמרה של דגם ההוראות המקורי באמצעות כלי llama.cpp עם imatrix לשימור דיוק. bartowski ארז אותו בעשרות רמות דחיסה שונות, ממשקל מלא של מעל מאה וארבעים גיגה בייט ועד גרסאות מכווצות של פחות מעשרים גיגה בייט.

המודל מיועד ליצירת טקסט ומענה להוראות, ותומך רשמית בשמונה שפות שכוללות אנגלית, צרפתית, גרמנית, איטלקית, פורטוגזית, הינדי, ספרדית ותאילנדית. עברית לא מופיעה ברשימת השפות הנתמכות, ולכן מי שבונה עליו לשפה המקומית יצטרך לבדוק אותו בזהירות רבה.

חלק מגרסאות ה־K_L כוללות שדרוג ממוקד שבו משקולות הקלט והפלט נשמרות ברמת שמונה ביט כדי לשמור על איכות הפלט, בזמן ששאר המודל דחוס יותר.

מתאים ל

  • שרת פנימי מעבד נתונים

    מריצים מקומית את Q4_K_M כדי לעבד מידע רגיש בארגון בלי להוציא אף בייט לענן חיצוני.

  • בדיקות ופיתוח ב־LM Studio

    טוענים את קובץ ה־GGUF לממשק מקומי בלחיצת כפתור לצורך ניסוי פרומפטים ישירות על החומרה.

  • הסקה על שרתי ARM ייעודיים

    משתמשים בגרסאות המותאמות כמו Q4_0_8_8 לשרתי מעבד ייעודיים שתומכים בהרחבות sve.

איפה זה נופל

הכרטיס מודה במפורש שגרסאות הדחיסה הנמוכות, כמו IQ1_M או Q3_K_S, מספקות איכות ירודה ולא מומלצות לשימוש. בנוסף, הגרסאות שמיועדות למעבדי ARM כמו Q4_0_4_4 ודומותיהן לא מיועדות לעבודה עם מעבדי אפל סיליקון או כרטיסי מסך, כך שמשתמשי מק צריכים להתרחק מהן.

שאלות
נפוצות

איזו גרסה כדאי להוריד מתוך הרשימה הענקית?

עבור רוב האנשים עם חומרה מתאימה, Q4_K_M במשקל ארבעים ושניים גיגה וחצי היא נקודת האמצע הטובה בין איכות לגודל. אם הזיכרון לוחץ אפשר לנסות את IQ4_XS, אבל מתחת לזה מורגשת ירידה באיכות.

האם אפשר להריץ את המודל על מקבוק?

כן, אבל צריך להיזהר מהגרסאות שמסומנות בהערות עם אזהרה מפורשת נגד מק, כמו סדרת Q4_0_4. גרסאות סטנדרטיות יעבדו דרך התוכנות הנתמכות אם יש לכם מספיק זיכרון אחוד במחשב.

האם המודל עובד טוב בעברית?

רשימת השפות הרשמית כוללת אנגלית, ספרדית ועוד שש שפות, ועברית אינה חלק מהן. הוא עשוי לפלוט עברית מסוימת בזכות המידע הכללי באימון, אבל ללא תמיכה רשמית התחביר והדיוק עלולים להישבר.

איך מריצים

ההרצה נעשית דרך llama.cpp או תוכנות כמו LM Studio שמשתמשות בו ישירות. כדי להריץ את גרסת ברירת המחדל המומלצת, Q4_K_M, תצטרכו לפחות ארבעים ושלושה גיגה בייט פנויים בזיכרון, ועדיף כרטיסי מסך עם מספיק VRAM כדי לקבל מהירות נסבלת.

אם יש לכם מחשב ביתי ממוצע בלי חומרה ייעודית, המודל הזה פשוט יזחל. במצב כזה אין שום היגיון להתעקש על הרצה מקומית, ועדיף לשלם לפי טוקן לספק API שמחזיק את המודל המקורי.

ollama run hf.co/bartowski/Llama-3.3-70B-Instruct-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

41 קבצים במאגר, 1.1 TB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא רישיון llama3.3 של חברת מטא. הוא מאפשר שימוש מסחרי חופשי לרוב החברות, אך כפוף למגבלות שימוש מקובלות ולתנאי נפח משתמשים גדולים מאוד של מטא שדורשים אישור מיוחד.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗