GPT
T

TildeOpen-30b

קוד פתוח

TildeAIcc-by-4.02025-08-19

  • transformers
  • safetensors
  • llama
  • text-generation
  • en

מודל בסיס רב לשוני שנבנה במיוחד עבור שפות מזרח וצפון אירופאיות שנדחקות הצידה בדרך כלל. הוא מציע הבנה תחבירית וטקסטואלית מצוינת בשפות האלה, אבל דורש אימון המשך כדי לעבוד עם הוראות.

  • 31Bפרמטרים
  • 65,536טוקנים בהקשר
  • 57.1 GBמשקל הקבצים
  • 1,223הורדות בחודש

מה זה

המודל אומן על מחשב העל LUMI באמצעות 768 כרטיסי AMD MI250X, על פני שני טריליון טוקנים בשיטת למידה שדוגמת שפות בצורה מאוזנת. המטרה שלו ברורה, לספק בסיס חזק ל־19 שפות יעד אירופיות שלא מקבלות מספיק ייצוג במודלים אמריקאיים סטנדרטיים. הטוקנייזר שלו תוכנן לייצג טקסט באורך דומה בכל שפה, מה שמצמצם את כמות הטוקנים שנוצרת בשפות פחות נפוצות ומאיץ את הריצה.

במבחני ביצועים, ההשקעה הזו מורגשת. במבחן הדקדוק MultiBLiMP הוא הגיע לממוצע של 99% בדיוק, כשהוא עוקף מודלים כמו Gemma 2 27B ו־ALIA 40B, במיוחד בשפות כמו איסלנדית שבה השיג 98.8% לעומת 88.5% של גמה. במבחן הבנת הנקרא Belebele הוא מוביל עם ממוצע של 84.7%, ובבחינות בגרות מקומיות בשפת המקור הוא הוביל בממוצע עם 66.6%, כולל 75.6% באלבנית לעומת כ־55% אצל המתחרים. לעומת זאת, במבחני ידע כללי ומדעים כמו ARC Easy במערב אירופה, הוא מפגר מעט אחרי המתחרים עם ממוצע של 78.8%.

מתאים ל

  • בסיס למודלי תרגום

    אימון מודל תרגום ייעודי לשפות כמו בולגרית, לטבית, אלבנית ואיסלנדית, שנהנות מטוקנייזר מאוזן וייצוג עמוק.

  • חילוץ מידע רב לשוני

    מערכות RAG שסורקות מסמכים בשפות מזרח אירופיות, בזכות ציון גבוה של 84.7% במבחן הבנת הנקרא Belebele.

  • אימות דקדוק ועריכה

    בדיקת תקינות תחבירית בטקסטים מורכבים במגוון שפות אירופיות, שם המודל מפגין דיוק כמעט מושלם ב־MultiBLiMP.

איפה זה נופל

זהו מודל בסיס לחלוטין. הוא לא עבר התאמה למעקב אחרי הוראות ואינו מכיל שכבות של בטיחות או סינון תוכן, כך שאם תזרקו לו פרומפט בצורת שאלה, הוא עשוי פשוט להמשיך את הטקסט במקום לתת תשובה. הוא לא מתאים לשיחה עם משתמשים בצורתו הגולמית. בנוסף, חלון ההקשר בהיפר-פרמטרים של האימון הוא 8,192 טוקנים, למרות שהמטא-דאטה מציין פוטנציאל ארוך יותר. עברית אינה מופיעה ברשימת השפות שנתמכות או נבדקו במבחנים, ולכן אין לצפות כאן לביצועים סבירים בשפה המקומית.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה ישירות כצ'אטבוט?

לא. זהו מודל בסיס שלא אומן לעקוב אחר הוראות או לנהל שיחה, והוא ייטה להשלים טקסטים במקום לענות. כדי לבנות איתו צ'אט תצטרכו לבצע כוונון עדין על מערך נתוני שיחה.

איך המודל מתמודד עם עברית?

עברית אינה נכללת ברשימת שפות היעד של המודל ולא הופיעה במבחני הביצועים. המודל נבנה במפורש עבור שפות צפון ומזרח אירופה, ולכן מומלץ לבחור במודלים אחרים למשימות בעברית.

מדוע הטוקנייזר דורש הגדרה מיוחדת בקוד?

בכרטיס המודל מוגדר במפורש שיש להגדיר use_fast=False בעת הטעינה ב־transformers. הטוקנייזר מותאם אישית לחלוקה שוויונית בין השפות, והמימוש המהיר הרגיל אינו נתמך כרגע.

איך מריצים

משקל הקבצים עומד על 57.1 גיגה בייט בפורמט bfloat16. כדי לטעון ולהריץ אותו במלואו תצטרכו לפחות 64 עד 80 גיגה בייט של זיכרון גרפי, כלומר שרת עם כרטיס A100 או H100 בודד, או לחלופין שני כרטיסי 24 גיגה בייט עם קוונטיזציה מתאימה.

נקודה טכנית קריטית בקוד המקור היא חובת השימוש בדגל use_fast=False בעת טעינת הטוקנייזר בספריית transformers, אחרת הטעינה תיכשל. אין כרגע גרסאות מכווננות רשמיות להוראות או API מנוהל מטעמם, כך שאם אין לכם את התשתית להחזיק שרת ייעודי ואין לכם כוונה לאמן אותו בעצמכם, עדיף להמתין למודל התרגום הייעודי שהצוות מתכנן לשחרר.

from transformers import pipeline

pipe = pipeline("text-generation", model="TildeAI/TildeOpen-30b")
print(pipe("שלום"))

הרישיון

הרישיון הוא CC-BY-4.0. זהו רישיון פתוח ומתירני שמאפשר להשתמש במודל, לשנות אותו, לאמן אותו מחדש ולשלב אותו במוצרים מסחריים. התנאי היחיד הוא מתן קרדיט מתאים ליוצרים המקוריים, TildeAI, וציון הקישור לרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗