GPT
H

Hy-MT1.5-1.8B-1.25bit

קוד פתוח

AngelSlimרישיון לא דווח2026-04-28

  • safetensors
  • hunyuan_v1_dense
  • translation
  • hy-mt
  • quant

גרסת קוונטיזציה קיצונית שמכווצת מודל תרגום של 1.8B פרמטרים לגודל של 440 מגה בייט. היא מיועדת למי שחייב להריץ תרגום מקומי על טלפונים ישנים או מעבדי קצה חלשים בלי חיבור רשת.

  • 2Bפרמטרים
  • 262,144טוקנים בהקשר
  • 3.8 GBמשקל הקבצים
  • 98הורדות בחודש

מה זה

מדובר במודל ייעודי למשימות תרגום שמבוסס על סדרת HunYuan של טנסנט, ומכסה 33 שפות, 5 ניבים ו־1,056 כיווני תרגום. הייחוד כאן אינו ארכיטקטורת הבסיס אלא שיטת הדחיסה Sherry, שמשתמשת בדלילות של 3 מתוך 4 משקלים כדי לאחסן כל משקל ברוחב אפקטיבי של 1.25 ביט בלבד.

לפי נתוני הבנצ'מרק של Flores-200 שמציגים המפתחים עבור תרגום הדדי בין סינית לשפות זרות, המודל המקורי עוקף מודלים פתוחים כבדים בהרבה כמו Tower-Plus-72B ושירותי ענן כמו מיקרוסופט. הדחיסה ל־1.25 ביט מורידה את נפח הזיכרון מ־3.3 גיגה בייט בפורמט FP16 לכדי 440 מגה בייט ב־GGUF, תוך שמירה על ביצועים שמישים מאוד למרות הקיצוץ האגרסיבי במשקלים.

מתאים ל

  • תרגום אופליין במובייל

    תרגום טקסטים והודעות במכשיר בלי תלות בחיבור אינטרנט ובלי צריכת זיכרון כבדה.

  • חילוץ ותרגום ברקע באפליקציות

    שירות רקע שקורא טקסט מאפליקציות שונות ומתרגם אותו מיד על גבי המסך.

  • מכשירי קצה ורכיבי IoT

    הרצת מודל תרגום במערכות משובצות מבוססות מעבד חלש בלי כרטיס מסך ייעודי.

איפה זה נופל

המודל מיועד אך ורק לתרגום ולא יודע לעשות שיחה, סיכום או יצירת תוכן כללי. קוונטיזציה קיצונית של 1.25 ביט מוחקת משקלים בצורה מובנית, כך שעלולים להופיע עיוותים בניסוח, איבודי הקשר במשפטים מורכבים או שגיאות בתחביר בשפות פחות נפוצות. בנוסף, חלון ההקשר העצום שעומד על 262,144 טוקנים הוא בעיקר נתון תאורטי של הארכיטקטורה. הרצה של טקסטים באורך כזה על טלפון נייד תחנוק את הזיכרון מיד בגלל ה־KV Cache, בלי קשר לגודל המשקלים.

אותה משפחה

Hy-MT1.5-1.8B-1.25bit יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך בעברית?

הכרטיס מצהיר על תמיכה ב־33 שפות אך לא מפרט את הרשימה המלאה. הבנצ'מרקים מתמקדים בעיקר בתרגום לסינית וממנה. לפני שמשלבים אותו בפרויקט עם עברית, חובה להריץ בדיקה מעשית על טקסטים מקומיים כדי לראות אם היא נתמכת ובאיזו איכות.

האם אפשר להריץ אותו עם הגרסה הרשמית של llama.cpp?

עדיין לא בגרסה היציבה. התמיכה בקרנל STQ1_0 נמצאת כרגע בתוך ענף של Pull Request פתוח מספר 22836, ולכן צריך למשוך את הענף ולקמפל אותו ידנית לפי ההוראות.

איך מריצים

בשביל להריץ אותו לא צריך כרטיס מסך. המודל פותח לעבודה ישירה על גבי מעבד המכשיר באמצעות קרנל מותאם בשם STQ, והוא נבדק ורץ חלק על טלפונים ישנים עם מעבדי Snapdragon 865 או 888 ו־8 גיגה בייט זיכרון. קיימת גם גרסת 2 ביט ששוקלת 574 מגה בייט, שמספקת פשרה מעט פחות אגרסיבית בדיוק.

ההרצה עצמה דורשת שימוש ב־llama.cpp מענף ספציפי שתומך בקרנל STQ1_0 דרך Pull Request מספר 22836. אם אתם צריכים תרגום לשרת ענן סטנדרטי עם GPU זמין, עדיף להריץ את גרסת ה־FP16 המקורית או להשתמש ב־API מסחרי, כי היתרון המרכזי כאן הוא נטו חסכון במשאבי קצה מוגבלים.

pip install -U huggingface_hub
hf download AngelSlim/Hy-MT1.5-1.8B-1.25bit

הרישיון

הרישיון של המודל בעמוד לא דווח. הכרטיס מפנה לקובץ רישיון פנימי של פרויקט AngelSlim בגיטהאב בלי לפרט את התנאים הספציפיים. במצב כזה אסור לשלב אותו במוצר מסחרי בלי לבדוק ישירות את הרישיון במאגר המקורי של טנסנט ולוודא מה המגבלות על הפצה.

הרישיון המלא בעמוד המודל ↗