GPT
H

Hy3-preview

קוד פתוח

tencentother2026-04-13

  • transformers
  • safetensors
  • hy_v3
  • text-generation
  • conversational

מודל מומחים ענקי מבית טנסנט שמתמחה בקוד ובסוכנים חכמים. הוא מפעיל מעט פרמטרים בכל שלב, מה שמאפשר מהירות גבוהה ביחס לגודל העצום שלו.

  • 299Bפרמטרים
  • 262,144טוקנים בהקשר
  • 557 GBמשקל הקבצים
  • 55,140הורדות בחודש

מה זה

מדובר בארכיטקטורת תערובת מומחים עם מאתיים תשעים וחמישה מיליארד פרמטרים בסך הכל, שרק עשרים ואחד מיליארד מהם פעילים בכל מעבר. המבנה הזה מחזיק מאה תשעים ושניים מומחים שונים ובוחר שמונה בכל פעולה. החלון שלו מגיע למאתיים חמישים וששה אלף טוקנים, כך שהוא קולט מסמכים ארוכים או בסיסי קוד שלמים בלי להיחנק. הוא כולל גם שכבת חיזוי מרובת טוקנים שמיועדת להאיץ את קצב הפליטה בזמן ריצה.

במבחני ביצועים הוא עוקף מודלים פתוחים בולטים כמו דיפסיק ו־GLM במתמטיקה ובקוד. ב־GSM8K הוא הגיע ליותר מתשעים וחמישה אחוזים וב־MATH למעל שבעים ושש. המבחנים האלה מראים שהוא יודע להתמודד עם שרשראות חשיבה סבוכות ופתרון בעיות אמיתי, במיוחד תחת הגדרת חשיבה עמוקה, ולא רק לפלוט תשובות שנראות נכון תחבירית.

מתאים ל

  • סוכני פיתוח קוד

    מתאים לביצוע משימות פיתוח מורכבות, תיקון באגים ושימוש בכלים בזכות ציונים גבוהים במבחני סביבות פיתוח אמיתיות.

  • ניתוח מסמכי ענק

    חלון של מאתיים חמישים וששה אלף טוקנים מאפשר להזין תיעוד טכני נרחב או קובצי לוג גדולים לצורך תחקור.

  • פתרון בעיות מתמטיות

    מצב החשיבה המעמיקה שלו מתאים למשימות חישוביות קשות שדורשות הסקת מסקנות רב שלבית אמינה.

איפה זה נופל

זהו שחרור מוקדם ומוגדר כגרסת תצוגה מקדימה, עם כל הבעיות שמגיעות עם חוסר בשלות. בנוסף, אף שהמודל נבדק על מבחנים רב לשוניים, טנסנט שמה דגש מוחלט על סינית ואנגלית, ואין שום מידע על היכולות שלו בעברית. סביר מאוד שעברית תוביל לפלט משובש או להזיות תכופות, כך שאסור לבנות עליו לממשקים מקומיים בלי בדיקה מעמיקה מראש.

אותה משפחה

Hy3 יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

אפשר להריץ אותו על שרת עם שני כרטיסי RTX 4090?

ממש לא. המודל שוקל מעל חמש מאות גיגה בייט ודורש שמונה כרטיסי שרת ייעודיים עם נפח זיכרון עצום רק כדי להיטען לזיכרון. לשימוש מקומי כזה תצטרכו להמתין לגרסאות מכווצות בכבדות.

מה המשמעות של מצבי החשיבה בקריאות אליו?

אפשר להעביר פרמטר שקובע אם המודל יענה מיד או ייקח זמן לחשיבה מעמיקה. עבור שאלות יומיומיות בוחרים במענה ישיר כדי לחסוך זמן ומשאבים, ועבור מתמטיקה או כתיבת קוד סבוך מפעילים את החשיבה המעמיקה.

איך מריצים

המשקל של הקבצים עומד על 557 גיגה בייט, מה שאומר שאין מה לנסות להריץ אותו על שרת רגיל או תחנת עבודה ביתית. טנסנט ממליצים על שרת של שמונה כרטיסי H20 עם זיכרון גדול כדי לארח אותו דרך ספריות כמו vLLM או SGLang שנבנו ישירות מקוד המקור. חובה לחלק את המשקלים על פני כל השמונה כדי שהזיכרון יספיק לדיוק המקורי ולחלון ההקשר.

אם אין לכם אשכול ייעודי של מעבדים גרפיים מתקדמים בענן, עדיף להמתין לשירותי ענן שיציעו אותו דרך ממשק פניות סטנדרטי. תחזוקה עצמית של חומרה כזו עולה הון ודורשת היכרות עמוקה עם ניהול זיכרון וחלוקת מומחים.

from transformers import pipeline

pipe = pipeline("text-generation", model="tencent/Hy3-preview")
print(pipe("שלום"))

הקבצים

153 קבצים במאגר, 557 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הוא מופץ תחת רישיון קהילתי קנייני של טנסנט שמוגדר במאגר כ־other, ולא תחת רישיון קוד פתוח מוכר כמו אפאצ׳י או MIT. כדי להטמיע אותו במוצר מסחרי צריך לקרוא בזהירות את תנאי ההסכם המצורפים למאגר, מאחר שרישיונות כאלה כוללים לעיתים הגבלות על היקף משתמשים חודשי או איסור על תחרות ישירה מול מוצרי החברה.

הרישיון המלא בעמוד המודל ↗