GPT
T

tabpfn_3

קוד פתוח

Prior-Labsother2026-05-05

  • chemistry
  • biology
  • finance
  • legal
  • climate

מודל טרנספורמר שמבצע סיווג ורגרסיה על נתונים טבלאיים במעבר יחיד וללא צורך באימון ארוך. מתאים למי שרוצה ביצועים מעולים על טבלאות קטנות ובינוניות ישר מהקופסה.

  • 1.7 GBמשקל הקבצים
  • 18,315הורדות בחודש
  • 231לייקים

מה זה

במקום לאמן מודלים כמו עצי החלטה מגרדיינט על כל סט נתונים חדש, המודל הזה מתבסס על ארכיטקטורת טרנספורמר עם 24 שכבות שלמדה מראש לחזות על נתונים טבלאיים דרך למידה בהקשר. הוא אומן כולו על משימות סינתטיות, מה שמבטיח שאין שום דליפת נתונים ממאגרים ציבוריים מוכרים.

לפי הדוחות הוא מגיע לתוצאות מובילות במבחנים ציבוריים כמו TabArena ו־TALENT, ומוביל במיוחד בטבלאות של פחות ממאה אלף שורות, או עד מיליון שורות כשיש פחות ממאתיים עמודות. החבילה כוללת צ׳קפוינטים ייעודיים לסיווג בינארי, מרובה מחלקות, סדרות עתיות והתמודדות עם חריגה מהתפלגות האימון.

מתאים ל

  • סיווג בינארי מהיר

    חיזוי על טבלאות של עד מאתיים אלף שורות בלי לבזבז זמן על אימון וכוונון היפר-פרמטרים ממושך.

  • התמודדות עם חריגות מהדאטה

    שימוש בצ׳קפוינט המיועד לחריגה מהתפלגות כשנתוני הבדיקה צפויים להתרחק מנתוני המקור.

  • חיזוי סדרות עתיות

    הרצת רגרסיה לסדרות עתיות בעזרת הצ׳קפוינט שכוונן על נתוני זמן סינתטיים.

איפה זה נופל

הביצועים צונחים כשעוברים את הרף של מיליון שורות אימון או מעל אלפיים עמודות, ושם המודל כבר מאבד את היתרון שלו. בנוסף, הוא מיועד לנתונים טבלאיים מסודרים בלבד ולא יודע לקבל טקסט או תמונות בלי עיבוד חיצוני. צריך לזכור שגם אם המודל עצמו אומן על מידע סינתטי, הוא עדיין יושפע מהטיות שקיימות בנתונים שתזינו לו בזמן הריצה.

שאלות
נפוצות

אפשר להכניס את המודל למוצר שמוכר מנויים?

לא. הרישיון שסופק אוסר במפורש שימוש מסחרי, הפקת הכנסות או שימוש בפלטים לתהליכים עסקיים בייצור. לצורך כזה צריך לפנות לחברה ולקנות רישיון מסחרי.

האם המודל יתמודד עם קובץ ענק של עשרה מיליון שורות?

התיעוד מגדיר בבירור שהגבול העליון הוא מיליון שורות ואלפיים מאפיינים, ומעבר לזה הביצועים עלולים להיפגע. עבור נפחים גדולים יותר מומלץ לבחון כלים אחרים שמתאימים לטבלאות ענק.

איך מריצים

מתקינים את ספריית tabpfn בפייתון ועובדים איתה דרך ממשק פשוט שמזכיר מאוד את scikit-learn, עם פעולות fit ו־predict רגילות. המשקל הכולל של הקבצים עומד על 1.7 ג׳יגהבייט, כך שאפשר להריץ אותו בלי בעיה על מחשב פיתוח חזק או שרת צנוע עם כרטיס גרפי סביר.

יש גרסאות ממוקדות שניתן לטעון לפי נתיב הקובץ, כמו מודל לסיווג בינארי לדאטהסטים קטנים ממאתיים אלף שורות או מודל לחיזוי סדרות עתיות. אם הדאטה כולל טקסט חופשי, הכרטיס מציין שהמודל המקומי לא מתאים לטקסט לא מובנה ומפנה לגרסת ה־API של החברה.

pip install -U huggingface_hub
hf download Prior-Labs/tabpfn_3

הרישיון

הרישיון מוגדר כ־tabpfn-3-license-v1.0 ומאפשר בדיקות, הערכות פנימיות ומחקר בלבד. אסור להשתמש במודל, בפלטים שלו או בנגזרות שלו לכל צורך מסחרי, הפקה או החלטות עסקיות. שימוש כזה במוצר חי מחייב רכישת רישיון מסחרי ייעודי מהחברה שמפתח אותו.

הרישיון המלא בעמוד המודל ↗