GPT
L

LocalVQE

קוד פתוח

LocalAI-ioapache-2.02026-04-17

  • pytorch
  • gguf
  • audio-to-audio
  • speech-enhancement
  • acoustic-echo-cancellation

משפחת מודלים קטנה לניקוי הד, רעש והדהוד בזמן אמת שמיועדת לרוץ ישירות על המעבד. היא מתאימה למי שרוצה עיבוד קול מקומי בלי GPU ובלי תלות בשירותי ענן.

  • 127 MBמשקל הקבצים
  • 3,269הורדות בחודש
  • 67לייקים

מה זה

מדובר בגרסאות מכווצות של DeepVQE וארכיטקטורת GTCRN, שמבצעות ביטול הד אקוסטי, הפחתת רעשים וביטול הדהוד עבור אודיו של 16 קילוהרץ. העיבוד מתבצע בהזרמה עם חלונות קצרים של 256 דגימות, מה שמייצר שיהוי נמוך של 16 מילישניות בלבד.

המבחר כולל מודלים משולבים שמנקים הכל יחד, לצד גרסאות ממוקדות הד בלבד כמו גרסת ה־200 אלף פרמטרים או מודל הליניארי הזעיר של 2.7 אלף פרמטרים. במבחני ICASSP 2022 גרסת 1.3 מגיעה למדד של 4.73 בהפחתת הד בזמן דיבור מקביל עם נחיתה מינימלית באיכות הדיבור, בעוד שדגמי ה־AEC בלבד שומרים במכוון על רעשי הרקע ומנקים בעיקר את אות הרמקול.

במקום מודל ענק שדורש כרטיס גרפי יקר, המשקלים מגיעים בפורמט GGUF קל ורצים דרך מנוע C++ מבוסס GGML על גבי מעבדים ביתיים או שבבי ARM פשוטים.

מתאים ל

  • תוסף סינון קול לשידורי OBS

    מנקה את הד הרמקולים ורעשי הרקע בזמן אמת בלי להעמיס על המעבד ובשיהוי של 16 מילישניות.

  • אינטרקום על Raspberry Pi

    גרסת ה־49K רצה ב־219 מילישניות בלבד לקטע של 8 שניות על מעבד ARM צנוע.

  • שיחות קוליות ביישומי שולחן עבודה

    משתלב באמצעות ספריית C++ קלה ומבטל הד בלי לשלוח את האודיו לשרת חיצוני.

איפה זה נופל

כל המודלים דורשים אות ייחוס של מה שמתנגן ברמקולים כדי לנקות את ההד, כך שאי אפשר להריץ אותם על הקלטה מבודדת של מיקרופון בלבד. בנוסף, גרסת 2.7K הזעירה מתבססת על סינון ליניארי בלבד ונכשלת מול הד בעל הדהוד כבד בחדר.

היוצרים מזהירים במפורש שנתוני האימון סוננו באמצעות מדד DNSMOS, שמסווג לעיתים קולות מצוקה כמו צעקות ובכי כרעשי רקע. המודל מחליש צלילים כאלה, ולכן אסור להשתמש בו במערכות חירום או ביישומים מצילי חיים.

שאלות
נפוצות

האם המודל עובד על קובץ קול בודד בלי חיבור לרמקול?

לא. המודל חייב לקבל שני ערוצים נפרדים ב־16 קילוהרץ: את אות המיקרופון ואת ערוץ הייחוס של מה שמושמע ברמקולים. בלי אות הייחוס אין לו דרך לזהות מה מתוך הקליטה הוא הד שצריך לחסר.

מה ההבדל בין גרסה 1.3 לגרסאות 1.4-AEC?

גרסה 1.3 היא מודל משולב שמנקה הד, רעשי רקע והדהוד בפעימה אחת ומנקה את האודיו לגמרי. גרסאות 1.4-AEC מתמקדות רק במחיקת ההד של הרמקול ומשאירות בכוונה את רעשי הרקע והאקוסטיקה הטבעית של החדר ללא שינוי.

איך מריצים

מורידים את קובץ ה־GGUF ומריצים דרך שורת הפקודה של GGML או משלבים דרך ספריית C ופלאגין ל־OBS. אין צורך ב־GPU. מודל 1.3 צורך 34.1 מגה־בייט זיכרון עבודה בשיא ומבצע כל חלון ב־3.2 מילישניות על מעבד Ryzen 9 עם 4 ליבות. על Raspberry Pi 5 גרסת ה־49K מסתפקת בפחות ממילישנייה בודדת לכל חלון.

אין שום סיבה להשתמש ב־GPU עבור מודלי ה־AEC הקטנים כי השלב האדפטיבי רץ על המעבד, ואין טעם לקרוא ל־API חיצוני למשימה כזו כשכל החישוב תופס שבריר משאבים מקומיים ולא תלוי ברשת.

ollama run hf.co/LocalAI-io/LocalVQE:F32

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

רישיון Apache 2.0 מתיר שימוש מסחרי חופשי, הפצה ושינוי של הקוד והמשקלים. אתם יכולים להטמיע את המודל במוצר סגור או פתוח, בתנאי שאתם שומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗