שיאומי השיקה את OmniVoice – מודל בינה מלאכותית פתוח המסוגל להקרין טקסטים כמעט בכל שפה ולהעתיק קולות.
Xiaomi הציגה מודול בינה מלאכותית פתוח בשם OmniVoice
החברה הכריזה על השקת המודל של הבינה המלאכותית OmniVoice, שממיר טקסט לדיבור. מעבר לסינתזה קולית במאות שפות, המודל מסוגל לכפול קולות וליצור הגייה עם התאמות אישיות.
מה חדש ב-OmniVoice?
מדד תיאור שפות תמיכה ביותר מ־200 שפה, כולל שפות נדירות ובלתי מאומנות. גם אם יש פחות מעשר שעות נתונים, המודל יוצר דיבור «כמעט בכל שפה». באיכות ובבדיקות על 102 שפה, הבירור של הדיבור היה תואם לאדם, ולעיתים אף חרג ממנו. ב-24 שפות המודל התגבר על כמה מערכות מסחריות מבחינת דמיון וברירות. ארכיטקטורה רשת טרנספורמר דו‑כיוונית מופשטת ללא מודולים ביניים לחיזוי טוקנים. זה מקצר את זמן האימון ליום אחד על 100,000 שעות נתונים ומעלה מהירות התהליך (עד 40× בזמן אמת ב־PyTorch). טכנולוגיות • «הסתרה אקראית של קודים קוליים» – מזרזת אימון. • חיבור מודל שפה גדול באימון מקדים משפר את ההגייה וברירות.
יכולות מעשיות
1. כפל הקול
- יצירת דיבור על פי תכונות מתוארות (גיל, מגדר, טון, גוון, מד Dialect).
- אפשרות ליצור לחישה ושאר סגנונות ללא אודיו מקור.
2. עיבוד קלטים מקוריים
- הסרת רעש והפקת תכונות קול נקיות גם ממקורות לא אידיאליים.
3. ניהול טונציה
- הוספת נשימות, צחוקים ופרטים נוספים למראה טבעי יותר.
4. תיקון מדויק של הגייה
- התאמה ידנית של קולות מורכבים, כגון חיתוכים סילוקיים בסינית או שמות פרטיים באנגלית.
סיכום
OmniVoice מציע אלטרנטיבה תחרותית למערכות סינתזת דיבור מסחריות קיימות. בזכות עיצוב פשוט, מהירות אימון ותהליך גבוהה ויכולת התאמה רחבה, המודל מוכן לשילוב באפליקציות ושירותים לצרכן.
תגובות (0)
שתפו את דעתכם — אנא היו מנומסים והישארו בנושא.
התחברו כדי להגיב