GPT
S

speaker-diarization-coreml

קוד פתוח

FluidInferencecc-by-4.02025-06-24

  • coreml
  • speech
  • audio
  • voice
  • speaker-diarization

הפרדת דוברים על גבי מכשירי אפל בלי לשלוח שום קובץ קול לשרת. הוא מתבסס על pyannote, שוקל מעט מאוד ומותאם ישירות לחומרה המקומית.

  • 123 MBמשקל הקבצים
  • 17,934הורדות בחודש
  • 41לייקים

מה זה

מדובר בהמרה של ארכיטקטורת pyannote המוכרת לפורמט CoreML, שנועדה לזהות מי דיבר ומתי בתוך קובץ שמע. במקום להריץ מודלים כבדים בפייתון על שרתי ענן, המודל הזה מותאם במיוחד לעבודה על ה־Apple Neural Engine. הוא מקבל שמע מונו ב־16kHz ופולט מקטעי זמן עם מזהה לכל דובר. בגלל שהוא נשען על מאפיינים אקוסטיים ולא על טקסט, הוא אמור לעבוד בכל שפה, כולל עברית.

היתרון המרכזי כאן הוא ביצועים מול משאבים. לפי המדידות של המפתחים, ההמרה ל־CoreML מציגה האצה של בערך פי עשרה על המעבד ופי עשרים על המעבד הגרפי ביחס לפייתורץ׳ המקורי. הפגיעה באיכות כמעט לא קיימת, עם עלייה של כאחוז בודד במדדי השגיאה DER ו־JER, שנובעת משינויי דיוק חישובי בין הסביבות.

מתאים ל

  • תמלול פגישות באפליקציית מק

    זיהוי דוברים מקומי במחשב בלי להוציא הקלטות רגישות החוצה ובלי עלויות ענן.

  • הקלטות חכמות באייפון

    חלוקת שיחות מוקלטות למקטעי דוברים בזמן קצר ובניצול מינימלי של הסוללה בעזרת ה־ANE.

  • סינון קול לפי דובר בטאבלט

    עיבוד אודיו מקומי באייפד שמחלק את פס הקול לדוברים שונים עבור עריכת תוכן.

איפה זה נופל

המעבר ל־CoreML גורר שינויי דיוק מספריים קלים שמייצרים טעויות קטנות בערכים, ולפי הכרטיס צריך לכוונן את שלב הקיבוץ כדי לפצות עליהן. תוספת השגיאה היא אמנם סביב אחוז בודד, אבל בהקלטות קשות עם דוברים חופפים או רעשי רקע, זה עלול להתבטא בזיהוי שגוי של החלפת דובר. בנוסף, חובה להזין לו קבצים בפורמט מונו ובדגימה של 16kHz בלבד, כך שכל קלט אחר דורש עיבוד מקדים לפני הכניסה למודל.

שאלות
נפוצות

האם המודל תומך בעברית?

כן. המודל מתבסס על חתימות אקוסטיות של גלי הקול ולא על ניתוח פונטי או שפתי. הוא לא צריך להבין את המילים כדי לדעת שקול מסוים שייך לאדם ספציפי.

אפשר להריץ אותו על שרת לינוקס בענן?

לא. הקבצים מומרים במיוחד עבור CoreML ומיועדים לעבודה על רכיבי החומרה של אפל. לשרתים סטנדרטיים יש להשתמש בגרסת הפייתורץ׳ המקורית של pyannote.

איך מריצים

ההרצה מיועדת באופן בלעדי לחומרה של אפל שתומכת ב־CoreML, כגון מחשבי מק עם שבבי סיליקון, אייפונים או אייפדים. המודל רץ ב־FP16 על ה־ANE או ב־FP32 על המעבד והמעבד הגרפי. ההטמעה בקוד נעשית באמצעות ערכת הפיתוח FluidAudio של היוצרים, שמשלבת את המודלים בצינור העיבוד.

אם המוצר שלכם יושב בשרת לינוקס רגיל או מיועד לאנדרואיד, אין לכם מה לחפש כאן ועדיף להישאר עם pyannote המקורי או שירות ענן. החבילה הזו שווה את המאמץ רק כשרוצים לחסוך עלויות שרתים ולהריץ פיענוח קולי ישירות בתוך אפליקציית אפל מקומית.

pip install -U huggingface_hub
hf download FluidInference/speaker-diarization-coreml

הקבצים

81 קבצים במאגר, 123 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל מופץ ברישיון cc-by-4.0. הרישיון מתיר שימוש מסחרי, שינוי והפצה, בתנאי שאתם נותנים קרדיט הולם ליוצרים המקוריים ומציינים אם נעשו שינויים. שימו לב שבעוד שערכת הפיתוח FluidAudio מופצת תחת Apache 2.0, משקולות המודל עצמן כפופות לדרישות הייחוס של Creative Commons.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗