GPT
H

HY3D-Bench

קוד פתוח

tencentother2026-01-13

מאגר ענק של מודלים תלת ממדיים סגורים ונקיים שמיועד לאימון מודלי יצירה והסקה. מקבלים כאן אובייקטים שלמים, פירוק לחלקים ודאטה סינתטי מגוון להשלמת קטגוריות נדירות.

  • 8.6 GBמשקל הקבצים
  • 42,414הורדות בחודש
  • 95לייקים

מה זה

המאגר כולל שלושה חלקים עיקריים שנועדו לפתור את בעיות הרעש והגאומטריה הפתוחה הנפוצות במאגרים קיימים. החלק הראשון מכיל מעל 252 אלף אובייקטים שלמים עם רשתות גאומטריות אטומות לחלוטין, רינדורים מרובי זוויות ודגימות נקודות המחולקים לסטים של אימון, בדיקה ואימות.

החלק השני מציע יותר מ־240 אלף אובייקטים המפורקים לחלקים מבניים, כאשר כל חלק שמור כרשת אטומה נפרדת לצד רינדורים של ההרכבה ותוויות סגמנטציה. החלק השלישי מביא מעל 125 אלף אובייקטים שנוצרו על ידי בינה מלאכותית בתהליך שעבר מטקסט לתמונה ומשם לתלת ממד, ומכסה 1,252 תתי קטגוריות במטרה לעבות מקרים נדירים.

מתאים ל

  • אימון מודלי יצירה בתלת ממד

    שימוש ברשתות האטומות וברינדורים מרובי הזוויות לאימון מודלי דיפוזיה שמפיקים תלת ממד מטקסט או מתמונה בודדת.

  • למידת תפיסה ורובוטיקה

    ניתוח חלקי אובייקטים לטובת תכנון אחיזה וזיהוי אפשרויות פעולה במניפולציה רובוטית בסביבות מורכבות.

  • בנצ'מרק לשחזור גאומטרי

    הערכת ביצועים של אלגוריתמי שחזור תלת ממד על בסיס נתונים נקיים עם נקודות ייחוס גאומטריות מדויקות.

איפה זה נופל

החלק הסינתטי נוצר כולו בצינור אוטומטי של מודלי שפה, דיפוזיה ומודלי תלת ממד, מה שעלול להחדיר ארטיפקטים ועיוותים גאומטריים האופייניים לגנרציה אוטומטית. בנוסף, חלוקת הנתונים מתמקדת במבנה הנדסי ורינדורים ולא בטקסטורות עשירות בעולם האמיתי, ואין פירוט על שפות או תיאורים מעבר לקטגוריות המובנות. לפני שרצים לאמן על הכל, כדאי לסנן ולבדוק מדגמית את איכות הרשתות הסינתטיות.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

הרישיון של המאגר מוגדר כמותאם אישית ולא כרישיון חופשי מוכר. יש לעיין בקובץ התנאים המצורף במאגר כדי להבין אילו הגבלות חלות על תוצרי אימון ומסחור. כל עוד לא בדקתם את התנאים המדויקים, אין להניח היתר מסחרי גורף.

כמה שטח דיסק צריך כדי להוריד את כל הדאטהסט?

הורדה מלאה של כל שלושת החלקים דורשת כ־22.5 טרה בייט של נפח אחסון פנוי. אם שטח האחסון מוגבל, מומלץ להוריד רק את החלק הרלוונטי לפרויקט באמצעות פקודת ההורדה הייעודית. החלקים מחולקים לאובייקטים שלמים, חלקים מפורקים ומידע סינתטי.

מה היתרון של המאגר הזה בהשוואה למאגרי תלת ממד ישנים?

מאגרים מוקדמים סבלו לרוב מגאומטריה מקולקלת, חורים ברשתות ורעש רב בקבצים. כאן כל המודלים עברו עיבוד לרשתות אטומות ומנורמלות שמתאימות מיד לאימון יציב של מודלי למידה עמוקה. בנוסף יש חלוקה מובנית לחלקים שמקלה על משימות סגמנטציה ותפיסה.

האם יש במאגר תמיכה בשפה העברית?

המאגר כולל קטגוריות מובנות באנגלית ואינו מכיל תיאורי טקסט חופשיים בעברית. לצורך אימון מודלים מונחי טקסט בעברית תצטרכו לתרגם את הקטגוריות או לייצר תיאורים מתאימים באופן עצמאי. הנתונים מתרכזים בעיקר במידע גאומטרי, רינדורים חזותיים וענני נקודות.

איך מריצים

הורדת החומר נעשית ישירות מתוך Hugging Face באמצעות כלי הפקודה הרשמי, עם אפשרות למשוך תת מאגר ספציפי במקום את המאגר כולו. מדובר בנפח עצום שמגיע במצטבר לכ־22.5 טרה בייט, כאשר חלק האובייקטים המלאים תופס כ־11 טרה, החלקים כ־5 טרה והחלק הסינתטי כ־6.5 טרה. הקבצים שמורים בארכיונים דחוסים וכוללים רשתות בפורמט glb, תמונות עיבוד ונקודות דגומות, כך שחובה להכין מראש שטח אחסון מהיר ומערך פריקה ייעודי.

pip install -U huggingface_hub
hf download tencent/HY3D-Bench

הרישיון

המאגר מוגדר תחת רישיון מותאם אישית שאינו רישיון קוד פתוח סטנדרטי. במאגר מופיע קובץ תנאים בשם LICENSE-Dataset.txt ולכן חובה לקרוא אותו לפני כל שימוש, במיוחד לצורך מסחרי או הפצת מודלים שמאומנים עליו. אי אפשר להניח שמותר להשתמש בתוצרים למוצר מסחרי ללא בדיקת תנאי ההסכם של טנסנט.

הרישיון המלא בעמוד המודל ↗