GPT
T

TexVerse

קוד פתוח

YiboZhang2001odc-by2025-06-29

  • 3D

מאגר ענק של מודלים בתלת מימד ברזולוציות מרקם גבוהות. מי שמאמן מודלים לג'נרוט טקסטורות או אובייקטים מקבל כאן גישה לגרסאות 2K ומעלה יחד עם תיאורים מפורטים.

  • 22,328הורדות בחודש
  • 49לייקים

מה זה

הנתונים נאספו ישירות מפלטפורמת Sketchfab וכוללים 858,669 מודלים ייחודיים, מתוכם 158,518 כוללים חומרי PBR מבוססי פיזיקה. מכיוון שלכל מודל צורפו גרסאות הטקסטורה השונות שלו, המספר הכולל מגיע ל־1,659,097 אובייקטים. במאגר הנוכחי שמורים הקבצים ברזולוציות של 2K, 4K ו־8K, בעוד שגרסאות ה־1K פוצלו למאגר נפרד בגלל מגבלות טכניות של פלטפורמת האחסון.

לצד הגיאומטריה שמגיעה בקובצי glb, החוקרים הוסיפו קובץ תיאורים בשם caption.json שמפרט מאפיינים כלליים, רכיבים מבניים ופרטים עדינים לכל אובייקט. ישנם גם קובצי טקסט שממפים את מזהי המודלים הכלליים ומודלי ה־PBR. בנוסף קיימות ספריות ייעודיות לתמונות ממוזערות של האובייקטים, המחולקות למספר קובצי ארכיון שניתן למזג. מודלים בעלי שלד ואנימציה הועברו למאגר חיצוני נפרד בפורמט ההעלאה המקורי שלהם כדי למנוע אובדן תנועה בהמרות.

מתאים ל

  • אימון טקסטורות PBR

    אימון מודלים גנרטיביים ליצירת חומרים ותאורה פיזיקלית על גבי משטחים תלת מימדיים.

  • ג'נרוט תלת מימד מטקסט

    חיבור קובץ התיאורים לקובצי ה־glb לאימון מודלי text to 3d עתירי פרטים.

  • השבחת איכות מרקמים

    שימוש בגרסאות 2K, 4K ו־8K לאימון רשתות המשפרות חדות של טקסטורות קיימות.

איפה זה נופל

כל המודלים מגיעים מתוכן משתמשים שהועלה לאתר Sketchfab, מה שמייצר שונות גדולה באיכות הגיאומטריה והמידול. הטקסטים והתיאורים מוגבלים לאנגלית בלבד, ואין ייצוג לעברית. בנוסף, מי שצריך מודלים מונפשים או רזולוציות 1K יצטרך לפנות למאגרים נפרדים ולא ימצא אותם כאן באופן ישיר.

שאלות
נפוצות

האם מותר להשתמש במודלים לפרויקט מסחרי?

הדבר תלוי באובייקט הספציפי. רוב המודלים מוגדרים ברישיון CC BY או CC0 ומותרים לשימוש כזה עם מתן קרדיט מתאים. עם זאת, ישנם עשרות אלפי מודלים ברישיונות לא מסחריים כמו CC BY-NC, ולכן חובה לסנן את הנתונים לפי המטא-דאטה לפני האימון.

האם המאגר כולל טקסטורות ברזולוציית 1K?

לא במאגר הזה. עקב מגבלות אחסון של כמות קבצים, גרסאות ה־1K הופרדו למאגר חיצוני בשם TexVerse-1K. כאן תמצאו רק קבצים ברזולוציית 2K, 4K ו־8K.

האם יש במאגר נתונים בעברית?

לא. שפת הנתונים והתיאורים שהוצמדו למודלים בקובץ המטא-דאטה היא אנגלית בלבד.

איפה נמצאים המודלים המונפשים?

מודלים הכוללים שלד ואנימציה הועברו למאגר נפרד בשם TexVerse-Skeleton-Animation. החוקרים עשו זאת כדי לשמור על פורמט ההעלאה המקורי של המשתמשים ולמנוע שגיאות המרה.

איך טוענים

אין צורך בבקשת גישה מיוחדת, המאגר פתוח להורדה ישירה. הקבצים עצמם מאורגנים בתיקיות משנה לפי רזולוציות כמו glbs_2k בפורמט glb. קובץ התיאורים caption.json מרכז את המידע הטקסטואלי, ורשימות ה־txt מאפשרות לסנן מראש מודלים רגילים או מודלי PBR לפני שמושכים עשרות אלפי קבצים כבדים.

from datasets import load_dataset

ds = load_dataset("YiboZhang2001/TexVerse")

הרישיון

המאגר מסומן ברישיון odc-by, אך הרישיון ברמת האובייקט הבודד משתנה. מתוך המאגר, 699,075 מודלים זמינים תחת CC BY ו־6,139 תחת CC0 ומאפשרים שימוש מסחרי, אך עשרות אלפי מודלים אחרים מוגבלים לשימוש לא מסחרי או כוללים תנאי שיתוף זהה. מי שבונה מודל מסחרי חייב לסנן את הקבצים לפי המטא-דאטה.

הרישיון המלא ב־Hugging Face ↗