GPT
T

TableGPT2-7B

קוד פתוח

tablegptapache-2.02024-11-01

  • safetensors
  • qwen2
  • zh
  • en

התאמה ייעודית של Qwen2.5 לעבודה מול טבלאות ושאילתות עסקיות. שווה לשקול אותו כשצריך מודל קומפקטי שיודע לפענח מבנה של בסיסי נתונים בלי להזות.

  • 7.6Bפרמטרים
  • 32,768טוקנים בהקשר
  • 14.2 GBמשקל הקבצים
  • 3,843הורדות בחודש

מה זה

מדובר במודל שמבוסס על הארכיטקטורה של Qwen2.5, שעבר אימון המשך על יותר מחצי מיליון טבלאות ועשרות מיליארדי טוקנים שממוקדים בניתוח מידע מובנה. במקום לזרוק טבלה לתוך מודל כללי ולקוות שהוא יבין את הקשרים בין הטורים, כאן כיוונו את היכולת לתרגם שאלות בשפה טבעית לקוד ולשאילתות SQL, לחלץ קשרים מתוך שורות ולענות על שאלות שמבוססות על נתוני דוחות.

במדדי ביצועים מול נתונים מובנים הוא עוקף בקלות מודלים מקבילים באותו סדר גודל. במבחנים כמו זיהוי סוגי עמודות הוא הגיע לציון F1 של 85.88 לעומת פחות מ־33 במודל הבסיס, ובמבחן HiTab שמודד דיוק ביצוע על טבלאות הוא רשם 70.27 אחוזי הצלחה, מעל מודלים כלליים גדולים בהרבה. זה אומר שהוא מבין את ההקשר הטבלאי בצורה עקבית יותר ומייצר פחות שגיאות לוגיות כשמבקשים ממנו לחשב או לסנן נתונים.

מתאים ל

  • המרה של שאלות ל־SQL

    תרגום שאלות אנליטיות מורכבות לקוד SQL תקין שרץ ישירות מול בסיס הנתונים הארגוני.

  • אימות עובדות מדוחות

    סריקת נתונים מתוך גיליונות אקסל וטבלאות כדי לוודא התאמה בין סיכומים מילוליים למספרים בפועל.

  • סיווג עמודות אוטומטי

    מיפוי מהיר של מבנה טבלאות לא מוכרות וזיהוי סוג המידע בכל שדה במסגרת תהליכי קליטת נתונים.

איפה זה נופל

היוצרים מדגישים שהמודל אומן בעיקר על מאגרי מידע בסינית, ותמיכה בשפות אחרות מוגבלת. עברית לא נבדקה שם כלל, כך שסביר להניח ששאילתות או ערכים בעברית יתקלו בקשיים וידרשו תרגום מקדים לאנגלית. בנוסף, הארכיטקטורה המלאה כוללת מקודד סמנטי ייעודי לטבלאות שעדיין לא שוחרר בקוד פתוח, כך שכרגע מריצים רק את הדקודר העצמאי כשטבלאות מוזנות אליו כטקסט גולמי בתבנית של df.head.

שאלות
נפוצות

האם אפשר לתת למודל קבצי אקסל שלמים?

לא ישירות. המודל הנוכחי מקבל קלט טקסטואלי בלבד, והמפתחים ממליצים להעביר לו דגימה של הטבלה כמו פלט של df.head בפייתון. לעבודה מורכבת עם קבצים גדולים הם מספקים כלי נפרד בשם tablegpt-agent שמנהל את הפירוק והקריאות.

איך הוא מתמודד עם שאלות בעברית?

בכרטיס המודל מצוין במפורש דגש על סינית ותמיכה מוגבלת בשפות אחרות, ללא אזכור של עברית. אם הנתונים או השאלות שלכם בעברית, תצטרכו לתרגם אותם לאנגלית או לבצע כוונון עדין נוסף בעצמכם, אחרת תקבלו תוצאות לא אמינות.

איך מריצים

המשקל הכולל מגיע ל־14.2 גיגה בייט בדיוק של bfloat16, כך שכדי להריץ אותו מקומית תצטרכו כרטיס מסך בודד עם לפחות 16 עד 24 גיגה בייט זיכרון. מומלץ להרים אותו דרך vLLM שנתמך רשמית וכולל תאימות לשרת API במבנה של OpenAI, מה שחוסך התעסקות עם מימושים ידניים.

יש גרסת 72B חזקה יותר שמופיעה בבנצ'מרקים אבל עדיין לא שוחררה לציבור. אם אתם צריכים רק שאילתות מזדמנות או בדיקת היתכנות מהירה, עדיף להשתמש במודל גדול דרך ספק ענן חיצוני, אבל אם יש לכם זרימת נתונים פנימית שכוללת טבלאות רגישות, הרצה מקומית על שרת ייעודי נותנת פתרון מדויק בלי לחשוף מידע.

pip install -U huggingface_hub
hf download tablegpt/TableGPT2-7B

הרישיון

רישיון apache-2.0 מלא. אפשר להשתמש בו לצרכים מסחריים, לשנות את הקוד והמשקלים ולשלב אותו במוצרים פנימיים או חיצוניים, בתנאי ששומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗