GPT
Z

zed-industries_zeta-2-GGUF

קוד פתוח

bartowskiapache-2.02026-03-26

  • transformers
  • gguf
  • text-generation-inference
  • edit-prediction
  • next-edit-suggestion

גרסת קוונטיזציה יעילה למודל zeta-2 מבית zed-industries, שמתאימה להרצה מקומית קלה בכלים תומכי llama.cpp. היא חוסכת משאבים ומיועדת למי שרוצה ביצועי טקסט טובים בלי להחזיק שרת כבד.

  • 124 GBמשקל הקבצים
  • 1,306הורדות בחודש
  • 40לייקים

מה זה

מדובר בהמרה של המודל zeta-2 לפורמט GGUF, אותה ביצע bartowski באמצעות גרסה b8457 של llama.cpp. ההמרה משתמשת בכיול imatrix כדי למזער את איבוד המידע שנובע מהורדת רמת הדיוק. המודל מתמקד במשימות יצירת טקסט בשפה האנגלית, ומשקלי הקבצים נעים בין 3.38 גיגה-בייט לדחיסה המקסימלית לבין 16.51 גיגה-בייט למשקלים המלאים בפורמט bf16.

הייחוד כאן הוא מגוון גרסאות הקוונטיזציה, כולל שילובים שמצמידים דיוק גבוה של Q8_0 לשכבות הקלט והפלט כדי לשמור על יציבות הפלט. הטבלאות שמצורפות להסבר על דחיסת מעבדים מציגות עיבוד מהיר יותר על חומרות ARM ו־AVX בזכות ארגון מחדש של הנתונים בזמן ריצה, מה שמבטיח פעולה יעילה גם על מעבדים כלליים ולא רק על כרטיסים גרפיים ייעודיים.

מתאים ל

  • עבודה מנותקת מרשת

    מאפשר לייצר טקסט באנגלית מקומית על מחשב נייד חזק, בלי לשלוח מידע החוצה ובלי תלות בחיבור אינטרנט.

  • סביבות פיתוח אישיות

    מתאים לשילוב בכלים כמו LM Studio או Jan AI לבדיקת רעיונות ותסריטי שיחה באופן פרטי ומהיר.

  • הסבה לשרתי מעבד זולים

    התמיכה בארגון משקלים בזמן ריצה בפורמט Q4_0 מאפשרת ביצועים סבירים על מעבדי x86 ו־ARM ללא מאיץ גרפי.

איפה זה נופל

הכרטיס לא מציג תבנית שיחה או הנחיה מוגדרת ומפנה לחפש אותה בעמוד המקורי, מה שעלול להקשות על הטמעה ראשונית תקינה. בנוסף, המודל מוגדר עבור השפה האנגלית בלבד, כך שאין לצפות לביצועים סבירים בעברית. הגרסאות הקטנות ביותר, בייחוד אלו שמתחת ל־Q3, מאבדות איכות ועלולות לייצר תשובות לא עקביות. חובה לבדוק את התנהגות המודל במשימות שלכם לפני שמחברים אותו לקוד חי.

שאלות
נפוצות

איזה קובץ הכי כדאי להוריד מתוך הרשימה?

האפשרות המאוזנת ביותר היא גרסת Q4_K_M ששוקלת 5.22 גיגה-בייט. היא מציעה שילוב יציב בין מהירות שמירה על איכות הפלט, ומתאימה לרוב כרטיסי המסך הביתיים.

האם המודל תומך בהוראות בעברית?

המודל הוגדר עבור השפה האנגלית בלבד ולא מיועד לעברית. אפשר לנסות להריץ איתו עברית, אבל התוצאות צפויות להיות משובשות או לא מדויקות.

האם חייבים להוריד את כל 124 הגיגה-בייט של המאגר?

ממש לא. המאגר כולל עשרות קוונטיזציות שונות כדי לתת מענה לחומרות מגוונות, ואתם צריכים להוריד רק קובץ GGUF יחיד שמתאים למפרט המחשב שלכם.

איך מריצים

כדי להריץ את המודל צריך כלי שתומך בקובצי GGUF, כמו LM Studio, llama.cpp, Jan AI או koboldcpp. אם יש לכם כרטיס מסך מודרני עם 8 גיגה-בייט זיכרון, גרסת Q4_K_M במשקל 5.22 גיגה-בייט תיכנס במלואה לזיכרון הגרפי ותיתן קצב עבודה גבוה. למחשבים חלשים יותר קיימות גרסאות IQ ששוקלות פחות מ־4 גיגה-בייט, אך הן ידרשו מעבד סביר.

אם אין לכם כרטיס גרפי מתאים וכל הריצה נופלת על המעבד והזיכרון הרגיל, קצב יצירת הטקסט יירד משמעותית. במצב כזה, או אם תרצו דיוק מלא ברמת bf16 שדורש מעל 16 גיגה-בייט רק למודל עצמו, עדיף לפנות לפתרון מבוסס ענן במקום לחנוק את המחשב המקומי.

ollama run hf.co/bartowski/zed-industries_zeta-2-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל מופץ תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי מלא, שינוי של הקוד והמשקלים והפצה חופשית, בתנאי ששומרים על הודעת זכויות היוצרים המקורית ומצרפים עותק של תנאי הרישיון לכל תוצר שמשוחרר הלאה.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗