GPT
F

fuse-1-Lite

קוד פתוח

Akahsizrrapache-2.02026-08-05

  • transformers
  • safetensors
  • fuse3
  • text-generation
  • mixture-of-experts

שילוב בין שלד קטן למומחי קוד שנחתכו ממודל ענק יוצר כלי פיתוח קומפקטי. הוא נותן מענה למי שמחפש יכולות קוד סבירות בלי להחזיק כרטיס מסך מפלצתי.

  • 5.7Bפרמטרים
  • 131,072טוקנים בהקשר
  • 10.7 GBמשקל הקבצים
  • 1,821הורדות בחודש

מה זה

הבסיס כאן הוא מודל קטן של LiquidAI בגודל 2.7 מיליארד פרמטרים, שאליו הושתלו 960 מומחי קוד קפואים שנלקחו ישירות מתוך Qwen3.6-35B-A3B. במקום אימון מחדש יקר או זיקוק ידע, המודל מפעיל נתב קל משקל של 2 מיליון פרמטרים שבוחר שמונה מומחים פר טוקן רק כשמדובר בקוד, כאשר בפועל הנתב פעיל ב־11 מתוך 30 השכבות.

מבחינת מבחני ביצועים, מדד ה־pass@1 ב־HumanEval מוגדר עדיין כ־TBD, כך שאין שום מספר רשמי שמעיד על היכולת שלו ביחס למתחרים. מדובר בניסוי ארכיטקטורה מעניין שמתמקד באנגלית ובקוד, ומאפשר גם לכבות את מומחי הקוד לגמרי כדי לחזור להתנהגות הבסיסית של מודל השפה.

מתאים ל

  • השלמת קוד מקומית

    בקוונטיזציה של 4 ביט הוא רץ על חומרה ביתית צנועה ומספק פונקציות פייתון פשוטות.

  • ניסויי ניתוב MoE

    כר פורה לבדיקת השתלת מומחים בארכיטקטורות מעורבות עם תקציב אימון זעום.

  • סוכן פיתוח בסביבה סגורה

    הפעלת מומחי הקוד לפי דרישה ישירות מתוך המודל, ללא תלות ברשת חיצונית.

איפה זה נופל

הנתב אומן על 55 דוגמאות בלבד, 40 מתוכן של קוד, כך שיכולת ההכללה שלו מוגבלת מאוד. מעבר לזה, המומחים נלקחו ממרחב ייצוג שונה לחלוטין, מה שעלול לייצר פגיעה באיכות הפלט, ואין נתוני בנצ'מרק שמוכיחים שהוא אכן פותר בעיות מורכבות. הארכיטקטורה הלא סטנדרטית מייצרת תלויות בקוד מרוחק ומגבילה אינטגרציה חלקה בכלים סטנדרטיים.

שאלות
נפוצות

האם המודל תומך בעברית?

לא, המודל מוגדר ומאומן לאנגלית בלבד, וכל המומחים שהושתלו בו מיועדים למשימות תכנות בשפה זו.

האם אפשר להריץ אותו ב־llama.cpp רגיל?

לא, נדרש ענף מותאם שכולל את קובץ ה־C++ הייעודי לארכיטקטורת Fuse3 שנמצא במאגר ה־GGUF שלו.

מה המשמעות של כיבוי מומחי הקוד?

הפונקציה מנטרלת את השכבות שהושתלו ומחזירה את המודל להתנהגות של מודל הבסיס הקטן למשימות טקסט כלליות.

איך מריצים

במשקל מלא של 12 גיגה בייט ב־bfloat16 תצטרכו כרטיס מסך כמו RTX 4090 או L4. אם תרדו לקוונטיזציה של 4 ביט דרך bitsandbytes, דרישת הזיכרון צונחת ל־3.36 גיגה בייט, מה שמאפשר הרצה מקומית על RTX 3060 או מעבדי אפל סיליקון.

ההרצה דורשת transformers עם הגדרת trust_remote_code כיוון שמדובר בארכיטקטורה מותאמת אישית בשם Fuse3ForCausalLM. קיימות גרסאות מותאמות ל־vLLM, GGUF ו־MLX, אך הן דורשות פלאגינים ייעודיים או קוד C++ מותאם, ולכן למי שרוצה תשתית יציבה בלי לתחזק ספריות צד שלישי עדיף לפנות ל־API של מודל קוד מבוסס.

from transformers import pipeline

pipe = pipeline("text-generation", model="Akahsizrr/fuse-1-Lite")
print(pipe("שלום"))

הרישיון

רישיון apache-2.0 מתיר שימוש מסחרי, שינוי של הקוד והפצה חופשית של המודל. התנאי המרכזי הוא השארת הודעת זכויות היוצרים המקורית והצהרה על שינויים שבוצעו, בלי דרישה לפתוח את הקוד של המוצר שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗