GPT
H

Hy3-GGUF

קוד פתוח

AngelSlimapache-2.02026-07-13

  • gguf
  • text-generation
  • endpoints_compatible
  • imatrix
  • conversational

גרסאות מכווצות של Hy3 שמיועדות לריצה מקומית דרך llama.cpp. מיועד למי שמחזיק שרתי GPU כבדים ורוצה להריץ מודל ענק עם פענוח ספקולטיבי עצמי.

  • 951 GBמשקל הקבצים
  • 350,651הורדות בחודש
  • 186לייקים

מה זה

המאגר כולל קובצי GGUF מכווצים של המודל Hy3, כולל תמיכה במנגנון MTP לפענוח ספקולטיבי עצמי שנועד להאיץ את מהירות הפליטה. החבילה מגיעה עם מתכוני קוונטיזציה מעורבת שמיועדים לשמור על איכות השכבות הקריטיות כמו מנגנוני תשומת הלב והמומחים המשותפים, בזמן שמרבית המומחים המנותבים נדחסים באגרסיביות לרמות נמוכות כדי לצמצם את נפח הזיכרון.

המשקלים הזמינים נעים סביב 83 גיגה בייט עבור גרסת IQ1_M ועד כ־166 גיגה בייט עבור גרסת Q4_K_M, כאשר תוספת של MTP דורשת עוד כ־2 גיגה בייט לצד זיכרון למטמון טיוטה. מדובר במודל MoE עצום בגודלו, כך שגם הגרסה המכווצת ביותר עדיין דורשת חומרה ברמת מרכזי נתונים כדי לפעול, ולא מיועדת בשום צורה למחשב מקומי רגיל.

מתאים ל

  • הסקה מהירה בשרתי H20

    שימוש בגרסת Q4_K_M עם MTP מאפשר ניצול של שרתי GPU מרובים לקבלת קצב טוקנים גבוה בהרבה.

  • דחיסה מותאמת אישית

    בניית קובצי GGUF חדשים מטקסט כיול ייעודי באמצעות המתכונים המצורפים.

  • שרת מקומי בהקשר ארוך

    הרצת חלון של 65,536 טוקנים על גבי תשתית ארגונית מבודדת בלי להוציא מידע החוצה.

איפה זה נופל

הגרסה הקלה ביותר, IQ1_M, עושה שימוש בביטים בודדים לחלק גדול מהשכבות, מה שעלול לפגוע באופן מורגש באיכות הפלט במשימות מורכבות. בנוסף, שכבות המומחים של בלוק ה־MTP אינן מכווצות בפורמט IQ אלא נשארות בפורמט K, משום שמטריצת החשיבות אינה מכסה אותן. הדבר מגדיל את דרישות הזיכרון ומגביל את הגמישות בדחיסה. ההרצה תלויה לחלוטין בגרסת קוד ספציפית של llama.cpp, וקבצים ישנים שנבנו עם טלאים קודמים לא ייטענו בגרסאות חדשות.

שאלות
נפוצות

האם אפשר להריץ את המודל על כרטיס מסך ביתי?

לא. משקל הקובץ הקטן ביותר הוא כ־83 גיגה בייט לפני חישוב הזיכרון של הקונטקסט והמטמון. כדי להריץ אפילו את הגרסה המכווצת ביותר תצטרכו כרטיס שרת כמו H20 עם 96 גיגה בייט זיכרון גרפי לפחות.

איזו גרסת llama.cpp חובה להתקין?

יש למשוך את הגרסה העדכנית ביותר של llama.cpp שמכילה את PR מספר 25395, כלומר כל קומיט שאחרי 505b1ed. קבצים ישנים יותר שנבנו מול טלאים חיצוניים לא יפעלו מול הקוד הנוכחי.

איך מריצים

כדי להריץ אותו צריך גרסה עדכנית של llama.cpp שכוללת תמיכה בארכיטקטורת hy_v3 ממיזוג PR מספר 25395. כרטיס בודד של H20 עם 96 גיגה בייט יחזיק רק את גרסת IQ1_M, בצפיפות רבה, ללא MTP, ותוך כיווץ ה־KV cache ל־q8_0 והגבלת הקונטקסט ל־65,536 טוקנים.

להרצת גרסת Q4_K_M עם MTP נדרשים שני כרטיסי H20 עם 192 גיגה בייט ועדיין חובה לכווץ את ה־KV cache, או מערך של ארבעה כרטיסים כדי לעבוד בצורה מרווחת. אם אין לכם גישה למערך שרתים כזה, אין טעם לנסות להרים את זה לבד ועדיף להשתמש ב־API חיצוני.

ollama run hf.co/AngelSlim/Hy3-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא Apache 2.0. מותר להשתמש במודל לצרכים מסחריים, לשנות אותו ולהפיץ אותו הלאה במוצרים שלכם. התנאי העיקרי הוא שמירה על הודעת זכויות היוצרים המקורית, הצגת עותק של הרישיון וציון השינויים שבוצעו בקוד או במשקלים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗