GPT
P

unsloth/Phi-3.5-mini-instruct

קוד פתוח

unslothmit2024-08-20

  • transformers
  • safetensors
  • llama
  • text-generation
  • unsloth

מודל קומפקטי של 3.8 מיליארד פרמטרים עם חלון הקשר עצום של 128K טוקנים. הוא נבנה עבור מפתחים שצריכים היגיון חזק בקוד ומתמטיקה בתוך סביבה מוגבלת במשאבי זיכרון וחישוב.

  • 3.8Bפרמטרים
  • 131,072טוקנים בהקשר
  • 7.1 GBמשקל הקבצים
  • 3,790הורדות בחודש

מה זה

מיקרוסופט אימנה את הדגם הזה על 3.4 טריליון טוקנים, בדגש על נתונים סינתטיים מרוכזים וחומרי לימוד איכותיים, במקום לזרוק פנימה עובדות רנדומליות מהאינטרנט. המטרה כאן היא לדחוס יכולות ניתוח וחשיבה לוגית לגודל מזערי, וגרסת אנפות' מציגה תמיכה באימון מהיר בחצי מכמות הזיכרון. הוא עוקב אחרי הוראות בעזרת כוונון עדין ואופטימיזציית העדפות, ומציג יכולות שיחה מרובת שלבים.

במבחני חלון הקשר ארוך כמו RepoQA להבנת קוד, הוא מגיע לציון ממוצע של 77 ועוקף את למה 3.1 8B שעומד על 71. במבחן RULER לשליפת מידע מטקסט ארוך, הביצועים שלו יציבים יחסית עד 32K עם ציון 87.1, אך צונחים ל־63.6 ב־128K מלא. המודל תומך רשמית בעברית לצד עשרות שפות נוספות, אם כי במבחנים רב-לשוניים כלליים כמו MMLU הוא עומד על 55.4 ומפגר משמעותית אחרי מודלים ייעודיים או שירותי ענן מסחריים.

מתאים ל

  • ניתוח מסמכים ארוכים

    חלון של 128K טוקנים מאפשר לסכם קבצים עבי כרס ישירות על שרת פנימי קטן.

  • בדיקת קוד מקור בפייתון

    האימון התמקד בלוגיקה ובמבני שפה סטנדרטיים, מה שמתאים לאיתור שגיאות בקוד.

  • אימון מקומי בעלות אפסית

    צריכת הזיכרון הנמוכה מאפשרת לבצע SFT על גבי כרטיס T4 יחיד ללא תשלום.

איפה זה נופל

האימון התמקד בעיקר באנגלית, ולכן שפות אחרות, כולל עברית, יסבלו מביצועים נמוכים יותר ומפערים באיכות הפלט. הכרטיס מודה במפורש שהמודל נוטה לייצר הזיות, תוכן שגוי שנשמע משכנע, ותשובות שחוזרות על עצמן בשיחות ארוכות. בנוסף, רוב אימוני הקוד שלו התבססו על פייתון עם ספריות סטנדרטיות, כך שבשפות תכנות אחרות או בספריות מורכבות חובה לאמת ידנית את הקריאות. נקודת החיתוך של המידע היא אוקטובר 2023, והוא אינו מתאים כלל לקבלת החלטות משפטיות, רפואיות או הקצאת משאבים קריטיים.

שאלות
נפוצות

האם כדאי להריץ אותו בשביל אפליקציה שמדברת בעיקר בעברית?

לא מומלץ לבנות עליו בתור מנוע שיחה ראשי בעברית ללא כוונון נוסף. אמנם עברית מופיעה ברשימת השפות הנתמכות, אך מרבית המידע אומן באנגלית והיצרן מצהיר בגלוי על פערי איכות משמעותיים בשפות אחרות.

האם המודל יחזיק הקשר מלא של 128K טוקנים באותה איכות?

לא בכל המשימות. מבחן השליפה RULER מראה צניחה מציון 94.3 ב־4K טוקנים לציון 63.6 ב־128K טוקנים, כך שבקצוות הטווח יכולת הדיוק נפגעת.

איך מריצים

המשקל הכולל של הקבצים עומד על 7.1 גיגה בייט בדיוק bfloat16, כך שכרטיס מסך בודד כמו Tesla T4 חינמי בקולאב מספיק להרצה ולאימון עם אנפות'. הקוד דורש את ספריית transformers מגרסה 4.43.0 ומעלה, לצד תמיכה אופציונלית ב־Flash Attention 2 לזירוז הסקת מסקנות.

אם המוצר שלכם צריך בעיקר להריץ שאילתות פשוטות בלי דרישות פרטיות מקומיות, עדיף להשתמש ב־API מנוהל כמו זה של אז'ור במקום לתחזק שרת עצמאי. הריצה המקומית משתלמת רק כשאתם חייבים עבודה אופליין, אבטחת מידע קפדנית על שרת פרטי, או כוונון עדין על דאטה פנימי.

from transformers import pipeline

pipe = pipeline("text-generation", model="unsloth/Phi-3.5-mini-instruct")
print(pipe("שלום"))

הרישיון

המודל מופץ תחת רישיון MIT. מותר להשתמש בו לצרכים מסחריים ומחקריים, לשנות אותו, לכווץ אותו ולשלב אותו במוצרים סגורים בלי תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗