GPT
H

Hy4-preview-GGUF

קוד פתוח

AngelSlimרישיון לא דווח2026-08-28

  • gguf
  • endpoints_compatible
  • imatrix
  • conversational

גרסת GGUF מכווצת למודל ענק עם 256 מומחים, שמנסה לדחוס מאות ג'יגה לזיכרון של שרתים חזקים. היא מתאימה למי שחייב להריץ מודל בגודל כזה אצלו ולא דרך שירות ענן חיצוני.

  • 868 GBמשקל הקבצים
  • 171,412הורדות בחודש
  • 94לייקים

מה זה

המאגר מכיל המרות של Hy4-preview מבית Tencent בפורמט GGUF, כשהחידוש המרכזי כאן הוא אסטרטגיית קוונטיזציה קיצונית. במקום חיתוך אחיד, המפתחים חילקו את הדיוק לפי חשיבות הרכיבים. המומחים מהווים 97.7% מכלל הפרמטרים, ולכן דחסו אותם לרמות של 1.3125 עד 2.0625 ביטים לפרמטר בגרסת STQ1_0, תוך שמירה על שכבות קריטיות כמו הראוטר, הנורמליזציה והפלט בדיוק מלא של F32.

התוצאה היא חיתוך של כחצי מנפח המודל לעומת גרסת Q4_K_M סטנדרטית, מנפח של 435.20 GiB לכיוון 213.66 GiB בלבד. במדידות על שרת של שמונה מאיצי H20, גרסת STQ1_0 הציגה קצב עיבוד קלט של 204.56 טוקנים לשנייה וייצור פלט של כעשרים טוקנים לשנייה. אלה ביצועים סבירים לחלוטין למודל בממדים האלה, בתנאי שהחומרה מסוגלת להחזיק אותו במלואו.

מתאים ל

  • שרתי הסקה בארגונים גדולים

    דחיסת מודל עצום לתוך שרת של שמונה מאיצים עם זיכרון גרפי מוגבל, במקום להכפיל את כמות החומרה.

  • מחקר על דחיסת מומחים

    בדיקת שיטת STQ1_0 והתנהגות מודלים עם 256 מומחים ברמות דחיסה אגרסיביות של פחות משני ביטים.

  • עיבוד אופליין עצמאי

    הרצה מקומית ומבודדת של מודל עתיר פרמטרים ללא תלות ברשת חיצונית או בשירותי צד שלישי.

איפה זה נופל

זהו שחרור מוקדם שמחייב פשרות הנדסיות כבדות. דחיסת משקלים עד לרמה של 1.3125 ביטים מגיעה עם ירידה בדיוק לעומת המודל המקורי, גם אם האלגוריתם מתקן סטיות בעזרת מטריצת חשיבות. מעבר לכך, התוכנה שברירית. הדגל הרגיל למניעת שיחה אינו מתפקד וגורם ללולאות אינסופיות בסיום קלט, קריאה מ־NFS מאיטה את הטעינה למספר שעות, וספריות פייתון דורשות עקיפת נתיבים ידנית כדי לפענח את הקבצים.

שאלות
נפוצות

האם המודל יעבוד על עמדת עבודה עם כרטיס RTX 4090 בודד?

לא. אפילו הגרסה המכווצת ביותר שוקלת מעל 213 GiB ודורשת זיכרון ייעודי של לפחות 214 GiB כדי לפעול כולה על המאיץ. כרטיס בודד שמציע 24 GiB רחוק מאוד מלהספיק.

מדוע הגרסה הרשמית של llama.cpp לא מריצה את הקבצים?

הארכיטקטורה של Hy4 חדשה ואינה מוטמעת בפרויקט המרכזי. חובה להוריד את קוד המקור, להפעיל את קובצי הטלאי שמצורפים למאגר, ולקמפל את הבינארי מחדש עם תמיכה בטנזורים ובשיטת STQ1_0.

באיזו גרסה מומלץ לבחור מבין הקבצים?

אם השרת שלכם כולל מעל 450 GiB זיכרון גרפי פנוי, גרסת Q4_K_M היא הבחירה הבטוחה מבחינת שמירה על איכות. אם יש מגבלת זיכרון, גרסת STQ1_0 מציעה נפח נמוך בחצי כמעט בלי שינוי במבנה הליבה.

איך מריצים

אי אפשר להריץ את הקבצים האלה ישר מהקופסה. הארכיטקטורה לא נתמכת בגרסה הרשמית של llama.cpp, וצריך להוריד קוד מקור מקומי מגרסה ספציפית ולהחיל טלאים ידניים לפני הקומפילציה, כולל דגלים ייעודיים לכרטיסי מסך בארכיטקטורה 90 כמו H100 או H20.

מבחינת חומרה, דרוש שרת ייעודי כבד מאוד. כדי לטעון את כל המשקלים לזיכרון הגרפי צריך כ־214 GiB עבור גרסת STQ1_0 וכ־435 GiB לגרסת Q4. חובה לשמור את הקבצים בדיסק מקומי מהיר כי קריאה דרך רשת איטית מחריבה את זמני הטעינה. בנוסף, חובה להפעיל את הדגל jinja בריצה כי תבנית השיחה אינה סטנדרטית.

ollama run hf.co/AngelSlim/Hy4-preview-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון לא דווח בעמוד המודל. במצב כזה אין אישור מפורש לשימוש מסחרי, ואי אפשר לדעת מה המגבלות המשפטיות שהטילה Tencent במקור. עבור חברות או מוצרים מסחריים בישראל, מדובר בסיכון משפטי ברור ולא כדאי להטמיע את הקבצים במערך ייצור ללא בירור הרישיון המקורי.

הרישיון המלא בעמוד המודל ↗