GPT
T

tabfm-1.0.0-pytorch

קוד פתוח

googleother2026-06-29

  • tabfm
  • safetensors
  • tabular
  • tabular-regression
  • zero-shot

מודל של גוגל לטבלאות שמנחש סיווג ורגרסיה בלי אימון מקדים. מעבירים לו שורות דוגמה כהקשר ומקבלים חיזוי בריצה אחת.

  • 12.2 GBמשקל הקבצים
  • 35,919הורדות בחודש
  • 466לייקים

מה זה

גוגל בנו כאן מודל בסיס לנתונים טבלאיים שלא דורש כוונון היפר-פרמטרים או התאמה מיוחדת לסט הנתונים. המבנה שלו מורכב מתשומת לב לעמודות דרך Set Transformer, דחיסת שורות באמצעות שמונה טוקנים ייעודיים, ובלוק עיקרי של 24 שכבות שלוקח את שורות האימון כהקשר ומנבא על שורות המבחן. הוא מטפל בערכים מספריים וקטגוריאליים ישירות מתוך דאטה-פריים של פנדס או מערך נאמפיי.

בבדיקות של החוקרים על 51 מערכי נתונים בבנצ'מרק TabArena, שכללו 38 משימות סיווג ו־13 משימות רגרסיה, הריצה הישירה שלו עקפה מודלים מאומנים ומכווננים היטב כמו עצי החלטה מבוססי גרדיאנט. כל האימון המקורי נעשה על מאות מיליוני סטים סינתטיים לחלוטין שנוצרו ממודלים סיבתיים, מה שאומר שהמשקלים לא ראו דאטה אמיתי של חברות בזמן הבנייה שלהם.

מתאים ל

  • פרוטוטייפ מהיר לטבלאות

    בדיקת ביצועים ראשונית על נתונים בלי לבזבז זמן על אימון וכוונון.

  • סיווג רב-מחלקתי קטן

    משימות סיווג של עד עשר קטגוריות ישירות מתוך טבלאות פנדס מעורבות.

  • מחקר על דאטה סינתטי

    בדיקת יכולות הכללה של מודלי שפה על מבנים טבלאיים בסביבה אקדמית.

איפה זה נופל

יש פה מגבלה קשיחה של עד עשרה סוגי תוויות בסיווג. בנוסף, המודל מותאם לטבלאות של עד 500 עמודות, ומעבר לזה הביצועים עלולים להיפגע בצורה חדה. צריכת הזיכרון גדלה ככל שמוסיפים שורות להקשר, ומאחר שהאימון בוצע רק על דאטה סינתטי, אין ביטחון איך הוא יגיב לפילוחים חריגים או למבנה נתונים אמיתי שלא תואם את ההנחות של המודל הסיבתי.

שאלות
נפוצות

אפשר להשתמש בו לסיווג של 20 קטגוריות שונות?

לא. הארכיטקטורה של המודל מוגבלת באופן קשיח לעד עשר מחלקות בלבד, ומעבר לזה הוא פשוט לא יעבוד.

האם הוא מתאים לשימוש מסחרי במוצר של החברה?

לא. המשקלים האלה זמינים תחת רישיון לשימוש לא מסחרי בלבד, כך שאי אפשר להטמיע אותם במערכת רווחית.

איך מריצים

המשקלים שוקלים 12.2 גיגה-בייט ומחולקים לשתי תיקיות נפרדות, אחת לסיווג ואחת לרגרסיה. מריצים אותם מקומית עם פייתון דרך הספרייה tabfm בגרסת PyTorch, כשיש גם גרסת JAX נפרדת ברשת. בגלל שהשורות נכנסות כרצף אחד לטרנספורמר, צריכת הזיכרון של כרטיס המסך מטפסת יחד עם כמות שורות הדוגמה שתזינו לו.

אם יש לכם כרטיס מסך עם מספיק זיכרון ואתם עובדים על מחקר או בדיקות היתכנות, ההרצה המקומית פשוטה ודורשת רק קריאת fit ו־predict רגילה בלי שלב אימון אמיתי.

pip install -U huggingface_hub
hf download google/tabfm-1.0.0-pytorch

הרישיון

המשקלים שוחררו תחת רישיון ייעודי של גוגל לשימוש לא מסחרי בלבד. קוד המקור פתוח באפאצ'י 2.0, אבל את המשקלים עצמם אי אפשר לשלב במוצר מסחרי, באפליקציה בתשלום או במערכת ארגונית שמפיקה רווח.

הרישיון המלא בעמוד המודל ↗