GPT
J

JoyAI-LLM-Flash

קוד פתוח

jdopensourceרישיון לא דווח2026-02-14

  • transformers
  • safetensors
  • joyai_llm_flash
  • text-generation
  • conversational

ארכיטקטורת תערובת מומחים שמפעילה רק שלושה מיליארד פרמטרים מתוך כמעט חמישים. המטרה היא לקבל דיוק של מערכת גדולה במהירות חישוב של מודל קטן.

  • 49Bפרמטרים
  • 131,072טוקנים בהקשר
  • 91.8 GBמשקל הקבצים
  • 192הורדות בחודש

מה זה

המודל בנוי כארכיטקטורת תערובת מומחים של DeepSeek V3 עם 256 מומחים בסך הכול, כשבכל צעד חישוב המערכת מנתבת את המידע דרך שמונה מומחים ספציפיים ומומחה משותף אחד בלבד. המבנה הזה מאפשר להחזיק כמעט 50 מיליארד פרמטרים של ידע שנלמד מתוך 20 טריליון טוקנים, אבל לבצע חישוב של 3 מיליארד פרמטרים בלבד בכל טוקן נתון. הוא אומן בריצה עם אופטימייזר בשם Muon ושיטות יישור חדשות שמיועדות לפתרון בעיות והפעלת כלים עצמאית.

במבחני ביצועים המודל מציג ציונים חריגים לגודל הפעיל שלו. במבחן הקוד המעשי LiveCodeBench הוא קיבל 65.6 נקודות מול 39.71 של Qwen3 המקביל, ובמבחן SWE-bench Verified לתיקון באגים אמיתיים בתוכנה הוא הגיע לשישים אחוז הצלחה. המספרים האלה מראים שהוא טוב משמעותית מהמתחרים הישירים שלו בניתוח בעיות תכנות מורכבות, ולא רק בזכירת תחביר בסיסי. גם במתמטיקה מתקדמת בבחינת AIME הוא הגיע לתוצאה של 65.83 נקודות, שמעידה על יכולת הסקה עמוקה.

מתאים ל

  • תיקון באגים בקוד

    מתאים לניתוח שגיאות במאגרי תוכנה הודות לציון 60.6 ב־SWE-bench Verified.

  • סוכני שיחה מרובי שלבים

    מיועד להפעלת כלים וקבלת החלטות עצמאית במערכות שירות ואוטומציה.

  • עיבוד מסמכים ארוכים

    תומך בטקסטים של עד 128 אלף טוקנים עם ציון 95.6 במבחן RULER.

איפה זה נופל

המודל אומן רק על אנגלית וסינית. מי שמתכנן לעבוד איתו בעברית יגלה שהוא כנראה מייצר פלט משובש או מתרגם עקום, כי השפה כלל לא נתמכת. נוסף לכך, במבחן התקשורת Tau2-Telecom המודל קיבל 79.83 נקודות, פחות מ־GLM-4.7 Flash שהגיע ל־88.6. יש לו גם נפילה מסוימת במבחני מדע ספציפיים כמו SciCode שבהם הוא לא התעלה על הדורות הקודמים. חיסרון טכני קבוע הוא שאתם עדיין משלמים את מלוא מחיר הזיכרון על 48 מיליארד פרמטרים, גם אם רק חלקם מבצע פעולות בפועל.

שאלות
נפוצות

האם המודל הזה מתאים לשימוש בעברית?

לא. המודל אומן אך ורק על טקסטים בסינית ובאנגלית, ולכן אינו מתאים למוצרים או למשימות שדורשים עיבוד שפה טבעית בעברית.

למה צריך חומרה גדולה אם הוא מפעיל רק שלושה מיליארד פרמטרים?

בארכיטקטורת MoE כל המשקולות של 48 מיליארד הפרמטרים חייבות להישאר טעונות בזיכרון הכרטיס כדי לאפשר ניתוב מהיר. רק שלב החישוב בפועל רץ על 3 מיליארד פרמטרים, אבל דרישת הזיכרון הבסיסית לא יורדת.

מה הדרך המומלצת לפרוס אותו לשרת עצמאי?

היוצרים ממליצים להשתמש במנועי ההסקה vLLM או SGLang שמותאמים למבנה המומחים. הם גם ממליצים על הגדרות דגימה קבועות של temperature=0.6 ו־top_p=1.0 כדי לקבל את התוצאות היציבות ביותר.

איך מריצים

כדי להריץ אותו אצלכם תצטרכו זיכרון וידאו עצום, למרות שרק חלק קטן מהפרמטרים מופעל בכל רגע. המשקל הכולל של הקבצים מגיע ל־91.8 ג׳יגה־בייט, כך שתצטרכו לפחות 100 ג׳יגה־בייט של זיכרון VRAM פנוי רק כדי לטעון את המשקולות בזיכרון, עוד לפני שלוקחים בחשבון את חלון ההקשר הגדול של 128 אלף טוקנים. שרת עם שני כרטיסי A100 או H100 בנפח של 80 ג׳יגה־בייט כל אחד הוא דרישת הסף ההגיונית לעבודה מקומית.

הריצה נתמכת רשמית במנועי vLLM ו־SGLang, ודורשת גרסת transformers מ־4.57.1 ומעלה. אם אין לכם גישה למערך כרטיסים ארגוני כזה, עדיף בהרבה להשתמש בנקודת הקצה התואמת של JD Cloud שהם מספקים, במקום לנסות לדחוס מודל כזה לכרטיס בודד ולסבול מביצועים אטיים.

from transformers import pipeline

pipe = pipeline("text-generation", model="jdopensource/JoyAI-LLM-Flash")
print(pipe("שלום"))

הרישיון

בעמוד המודל הרשמי מצוין Modified MIT, אך בפרטי המטא־דאטה הרשמיים לא דווח רישיון. המשמעות היא שקוד המקור והמשקולות מוגנים תחת גרסה מותאמת של רישיון MIT, שמחייבת בדיקה זהירה של קובץ התנאים המצורף לפרויקט כדי לוודא אם יש מגבלות על מסחור, הפצה או פיתוח מודלים מתחרים.

הרישיון המלא בעמוד המודל ↗