GPT
H

HY-Embodied-0.5

קוד פתוח

tencentother2026-04-02

  • transformers
  • safetensors
  • hunyuan_vl_mot
  • image-text-to-text
  • hunyuan

מודל ראייה ושפה קומפקטי שמיועד לרובוטיקה ולהבנה של מרחב תלת ממדי. הוא מפעיל רק 2.2 מיליארד פרמטרים בזמן ריצה, מה שמאפשר להריץ אותו מקומית על חומרה צנועה יחסית.

  • 3.8Bפרמטרים
  • 262,144טוקנים בהקשר
  • 7.1 GBמשקל הקבצים
  • 273הורדות בחודש

מה זה

הפיתוח הזה מגיע מצוות הרובוטיקה של טנסנט, והוא בנוי סביב ארכיטקטורת תערובת שנאים שכוללת כמעט 3.8 מיליארד פרמטרים בסך הכל. בזמן הסקה בפועל מופעלים רק 2.2 מיליארד פרמטרים, שזה שילוב שנותן מהירות של מודל קטן עם דיוק תפיסתי גבוה יותר בתמונות.

הייחוד שלו לעומת מודלי ראייה סטנדרטיים הוא המיקוד באינטראקציה פיזית. הוא אומן על מעל מאה מיליון דוגמאות של נתונים מרחביים ומאתיים מיליארד טוקנים, כולל זיקוק יכולות חשיבה ותכנון ממודל גדול יותר של שלושים ושניים מיליארד פרמטרים. במבחנים הוא מציג יתרון בולט בהבנת מרחב, כמו תוצאה של 92.3 ב־DA-2K וציון של 66.3 ב־MindCube, שמשאיר מודלים מקבילים הרחק מאחור.

מתאים ל

  • ניתוח זוויות ומרחב בתמונות

    מצטיין בהערכת יחסים תלת ממדיים בתוך תמונה בזכות ציונים גבוהים במבחני זוויות והבנה מרחבית.

  • בקר עליון למערכות רובוטיות

    מתאים לשמש מוח מקומי שמפרק הנחיות מורכבות לשלבי פעולה לפני הורדה לפקודות מנוע.

  • הסקה על חומרת קצה

    מפעיל רק 2.2 מיליארד פרמטרים בריצה, מה שמאפשר לו לעבוד על כרטיס יחיד עם 16 גיגה זיכרון.

איפה זה נופל

הנתונים חושפים חולשות ברורות במשימות תכנון וסביבות ביתיות. במבחן RoboSpatial-Home הוא קיבל 55.7 ונכנע למודלים קטנים אחרים, וב־ShareRobot לתנועה הגיע ל־73.3 לעומת 81.4 של המתחרה. בנוסף, כל התוצאות שלו הושגו במצב חשיבה פעיל, שמייצר שרשרת הסקה ומאט את זמן התגובה. במבחני זיהוי יכולות אינטראקציה התוצאה שלו צונחת ל־26.8, כך שאי אפשר לסמוך עליו לתפעול פיזי עיוור בלי בדיקות קפדניות.

שאלות
נפוצות

האם אפשר להריץ אותו על מעבד רגיל בלי כרטיס מסך?

הקוד תומך בריצה על מעבד, אבל זה יעבוד לאט מאוד ולא יתאים לשימוש מעשי. כדי לקבל תגובות בקצב סביר צריך מעבד גרפי של אנבידיה עם 16 גיגה זיכרון ומעלה.

האם המודל מיועד לצ'אט כללי או למשימות רובוטיקה בלבד?

הוא יודע לעבד טקסט ותמונה ומגיע עם חלון הקשר ענק, אבל כל האימון שלו התמקד במרחב, פיזיקה ותכנון פעולות. לשיחה כללית יש מודלים רגילים שעושים עבודה טובה וזולה יותר.

איך מריצים

כדי להריץ אותו צריך כרטיס מסך של אנבידיה עם 16 גיגה זיכרון לפחות, לצד 16 גיגה זיכרון מערכת ולפחות 20 גיגה פנויים בדיסק לקבצים ולסביבה. המשקלים שוקלים 7.1 גיגה ב־14 קבצים. הריצה דורשת לינוקס, פייתון 3.12 ומעלה, פייטארץ' 2.8, קודה 12.6, והתקנה של קומיט ספציפי מאוד של ספריית טרנספורמרס ישירות מגיטהאב.

כרגע אין עדיין תמיכה ב־vLLM או קוד פיין-טיונינג פתוח. אם אתם צריכים תפוקה מהירה בייצור בלי לתחזק תלויות תוכנה שבירות על הברזלים שלכם, עדיף להמתין לממשקי ענן במקום להרים אותו מקומית.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="tencent/HY-Embodied-0.5")
print(pipe("שלום"))

הרישיון

הרישיון מוגדר כמותאם אישית, מה שאומר שהוא לא תחת רישיון קוד פתוח סטנדרטי ומוכר. לפני שמשלבים אותו במוצר מסחרי או מפיצים אותו, חובה לבדוק את תנאי השימוש המדויקים במאגר ובדוח הטכני כדי לוודא שאין הגבלות שימוש או חובת ייחוס מחמירה.

הרישיון המלא בעמוד המודל ↗