GPT
K

Karnak-40B-v1.0

קוד פתוח

Applied-Innovation-Centerapache-2.02026-02-06

  • transformers
  • safetensors
  • qwen3_moe
  • text-generation
  • pytorch

המודל הזה מיועד לעיבוד והפקה של טקסט בערבית ובאנגלית ברמה גבוהה. הוא נבנה עבור מי שחייב ריצה מקומית של מודל גדול ומותאם ספציפית לשפה הערבית.

  • 41Bפרמטרים
  • 262,144טוקנים בהקשר
  • 75.8 GBמשקל הקבצים
  • 7,314הורדות בחודש

מה זה

מדובר במודל שנוצר מהרחבת עומק של מודל הבסיס Qwen3-30B-A3B-Instruct-2507, מה שהביא אותו לנפח של כארבעים מיליארד פרמטרים ושישים וארבע שכבות. המפתחים לקחו את המשקולות הקיימות, הוסיפו שכבות, והעבירו את התוצאה אימון המשך וכוונון עדין להוראות על גבי נתונים מסוננים. השוני המרכזי מול מודלים כלליים באותו סדר גודל הוא ההתמקדות המובהקת בשפה הערבית.

הצוות שילב טוקנייזר ייעודי שמקטין פיצול מילים בערבית, מה שמשפר את שטף הכתיבה וחוסך טוקנים בפועל. המודל מתמודד עם מעקב אחר הוראות, כתיבת תוכן, מענה לשאלות וניתוח טקסטים ארוכים בשילוב של אנגלית וערבית.

מתאים ל

  • בוט שירות לקוחות בערבית

    הטוקנייזר הייעודי מעניק שטף כתיבה טבעי ויעיל במיוחד בתשובות ארוכות בשפה הערבית.

  • תמצות מסמכים ארוכים

    תמיכה יציבה בטקסטים של עד עשרים אלף טוקנים מאפשרת לעבד דוחות וחוזים באנגלית ובערבית.

  • הטמעה מקומית בארגונים

    הרישיון החופשי והיכולת לפרוס שרת vLLM עצמאי מתאימים לארגונים שלא מוציאים מידע החוצה.

איפה זה נופל

למרות שהארכיטקטורה תומכת טכנית בחלון הקשר של מאתיים שישים ושניים אלף טוקנים, המפתחים מזהירים במפורש להישאר בטווח של עד עשרים אלף טוקנים בלבד כדי לשמור על יציבות. מעבר לזה, הביצועים והאמינות עלולים לרדת בחדות.

בנוסף, הכרטיס לא מציג שום ציוני בנצ'מרק עצמאיים, ולכן אי אפשר לדעת מראש איך הוא מתמודד מול מודלים מובילים אחרים באותן משימות. הוא מוגבל לערבית ואנגלית בלבד, ואין לצפות ממנו לתמיכה איכותית בעברית או בשפות אחרות.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה לטקסטים בעברית?

האימון והטוקנייזר הותאמו ספציפית לערבית ולאנגלית בלבד. המודל לא מיועד לעברית, ולכן פלט בעברית צפוי להיות שבור, איטי או משובש לחלוטין.

מדוע המפתחים מגבילים את ההקשר לעשרים אלף טוקנים אם המפרט מציין יותר?

חלון המפרט הטכני מייצג את תקרת הארכיטקטורה, אך שלבי האימון ובדיקות היציבות בוצעו ביעילות עד עשרים אלף טוקנים. חריגה מהטווח הזה עלולה לגרום להזיות או לאיבוד עקביות של התשובות.

איך מריצים

המשקל הכולל של הקבצים מגיע לכמעט שבעים ושישה ג'יגה בייט, כך שאי אפשר להריץ אותו על חומרה ביתית רגילה. תצטרכו שרת עם לפחות שני כרטיסי A100 או H100 של שמונים ג'יגה כדי לטעון אותו בפורמט bfloat16 מלא ולהשאיר מקום לזיכרון הריצה.

ההרצה מתבצעת ישירות דרך ספריית transformers החל מגרסה 4.40.0, או דרך vLLM שמומלצת לפרודקשן עם תמיכה בממשק תואם OpenAI. אם אין לכם גישה לשרת ייעודי בעלויות של אלפי שקלים בחודש, הרצה עצמאית כזו תהיה יקרה וכבדה מדי בהשוואה לשימוש בפתרונות ענן מנוהלים.

from transformers import pipeline

pipe = pipeline("text-generation", model="Applied-Innovation-Center/Karnak-40B-v1.0")
print(pipe("שלום"))

הרישיון

הפרויקט משוחרר תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי מלא, שינוי של הקוד והמשקולות, והפצה מחדש של המערכת במוצרים פרטיים או ציבוריים. התנאי העיקרי הוא שמירה על הצהרת זכויות היוצרים והרישיון המקורי, בלי להטיל אחריות משפטית על המפתחים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗