GPT
H

Hy3-1M-GGUF

קוד פתוח

satgezeapache-2.02026-07-06

  • gguf
  • long-context
  • yarn
  • hunyuan
  • hy_v3

זו גרסת GGUF ראשונה למודל של טנסנט עם חלון של מיליון טוקנים. היא מיועדת למי שרוצה להריץ מודל ענק עם הקשר ארוך על שרת מקומי במקום לשלם לענן.

  • 1.2 TBמשקל הקבצים
  • 1,346הורדות בחודש
  • 44לייקים

מה זה

המודל הזה הוא גרסת קוונטיזציה של Hy3 מבית טנסנט, ארכיטקטורת תערובת מומחים עם 299 מיליארד פרמטרים שמהם פעילים כ־17 מיליארד בכל שלב. ההבדל הגדול מול המקור הוא הרחבת חלון ההקשר למיליון טוקנים באמצעות שיטת YaRN, לצד דחיסה שמאפשרת להריץ אותו דרך llama.cpp העדכני. הוא שומר על יכולות קידוד ושיחה, וכולל מנגנון פענוח ספקולטיבי מסוג MTP שמאיץ יצירת טקסט.

בבדיקות שליפה של מחט בערימת שחת, המודל משיג דיוק מושלם של עשר מתוך עשר עד לעומק של 786 אלף טוקנים. כשמותחים אותו עד קצה החלון במיליון טוקנים, רמת הדיוק יורדת לממוצע של שבעים אחוז, עם פספוסים שמתרכזים באזורי האמצע של הטקסט. במשימות שרשור נתונים רב שלביות הוא מגיע לארבעה דיוקים מתוך חמישה על חצי מיליון טוקנים.

מתאים ל

  • סריקת מסמכים משפטיים

    הוא שומר על דיוק שליפה מושלם עד 786 אלף טוקנים בגרסאות הביניים, מתאים למציאת סעיפים בארכיונים כבדים.

  • ניתוח מאגרי קוד גדולים

    חלון ענק מאפשר לטעון פרויקט שלם לצורך איתור תלויות, בתנאי שמשתמשים בגרסת IQ2_M ומעלה.

  • שרשור מסקנות בטקסט ארוך

    מבצע שליפה רב שלבית בהצלחה של ארבע מחמש על חצי מיליון טוקנים, מתאים למחקר שמחבר נתונים ממקורות שונים.

איפה זה נופל

הגרסה המכווצת ביותר, IQ1_M, קורסת לחלוטין כשמפעילים מצב חשיבה מעמיק. בבדיקות עם שאלות בסיסיות היא נכנסה ללולאות של מאות מילים של חשיבה מעגלית בלי להחזיר תשובה. בשיחה רגילה היא נוטה לקשקשנות מוגזמת, ואי אפשר לסמוך עליה למשימות קוד. בנוסף, מיליון הטוקנים אינם אמינים במאה אחוז, והמודל נוטה לפספס עובדות שקבורות בין עשרים וחמישה לארבעים וחמישה אחוזים מעומק המסמך.

שאלות
נפוצות

האם אפשר להריץ את המודל על מחשב נייד חזק?

אפשר להריץ רק את גרסת IQ1_M על מחשב מק עם 128 גיגה בייט זיכרון מאוחד. הגרסה הזו מוגבלת לשיחה פשוטה בלי מצב חשיבה, והיא לא מומלצת למשימות מורכבות או לקוד. לכל שימוש רציני בגרסאות הגדולות יותר תצטרכו שרת עם 192 גיגה בייט זיכרון ומעלה.

איך מפעילים את האצת ה־MTP בלי לפגוע בביצועים?

יש להגדיר בפקודת ההרצה של השרת את הדגל spec-draft-p-min לערך של 0.75. ראש החיזוי של המודל מייצר טיוטות בביטחון נמוך, ובלי הגבלת הסף הזו מנגנון החיזוי יוריד את קצב יצירת הטקסט במקום להאיץ אותו.

איך מריצים

המודל רץ ישירות מתוך llama.cpp הרשמי ומחייב שימוש בקובץ תבנית הצ'אט הנלווה בגלל אי תאימות במנוע המקורי. לקבלת האצה מורגשת ב־CUDA, יש להפעיל את דגלי ה־MTP עם סף הסתברות מינימלי של 0.75, אחרת הפענוח הופך לאיטי יותר. הגרסאות נעות בין IQ1_M במשקל 62 גיגה בייט ועד Q6_K ששוקל 245 גיגה בייט.

מבחינת חומרה, צריך מפלצת. גרסת ה־IQ1_M המכווצת רצה על מחשב מק עם 128 גיגה בייט זיכרון מאוחד בקצב של כ־24 טוקנים לשנייה, אבל בשביל הגרסאות הרציניות יותר כמו IQ2_M או Q4_K_M וחלונות הקשר ארוכים תצטרכו שרת עם לפחות 192 גיגה בייט זיכרון וכרטיסי H200. אם אין לכם חומרה כזו ייעודית, עדיף להשתמש ב־API מנוהל.

ollama run hf.co/satgeze/Hy3-1M-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל מופץ תחת רישיון Apache 2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי של הקוד והפצה פנימית או חיצונית במוצר שלכם, כל עוד שומרים על הודעות זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗