Ile nagrań audio dziennie może transkrybować serwer domowy?

Eva Wong jest Technicznym pisarzem i stałym majsterkowiczem w ZimaSpace. Całe życie geek z pasją do homelabów i oprogramowania open-source, specjalizuje się w tłumaczeniu skomplikowanych koncepcji technicznych na przystępne, praktyczne przewodniki. Eva wierzy, że samodzielne hostowanie powinno być zabawą, a nie czymś onieśmielającym. Poprzez swoje samouczki umożliwia społeczności rozwiewanie tajemnic konfiguracji sprzętu, od budowy pierwszego NAS po opanowanie kontenerów Docker.

Serwer domowy może dokonywać transkrypcji od mniej niż jednej do setek godzin nagrań audio dziennie, zależnie od zmierzonego współczynnika czasu rzeczywistego i dostępnego cyklu pracy.

Współczynnik czasu rzeczywistego równy 0,25 oznacza, że godzina nagrania audio zajmuje 15 minut, czyli w ciągu godziny przetwarzania można obsłużyć cztery godziny nagrania. Jeśli transkrypcja może działać przez 20 godzin zegarowych, teoretyczna dzienna przepustowość wynosi 80 godzin nagrań, przed uwzględnieniem ponownych prób i narzutu związanego z pobieraniem danych. Same nazwy podzespołów nie pozwalają wiarygodnie określić tej wartości w całym planowanym nocnym oknie przetwarzania.

Współczynnik czasu rzeczywistego przelicza szybkość na dzienną przepustowość

Współczynnik czasu rzeczywistego to czas przetwarzania podzielony przez długość nagrania. Wartość RTF równa 1,0 oznacza działanie w czasie rzeczywistym; 0,5 oznacza przetwarzanie dwóch godzin nagrania w ciągu jednej godziny zegarowej; 0,1 — dziesięciu. Dzienna przepustowość jest równa liczbie zaplanowanych godzin przetwarzania podzielonej przez RTF.

Opublikowane testy przepustowości Whisper pokazują, że model, procesor graficzny, długość nagrania i przetwarzanie wsadowe mogą znacząco zmienić przepustowość. Zmierzona konfiguracja musi odpowiadać obciążeniu występującemu w domu.

Te obliczenia uwzględniają długość źródłowego nagrania audio, a nie czas upływający przy przetwarzaniu plików. Usuwanie ciszy może zmniejszyć ilość pracy, natomiast diarizacja, wyrównywanie, tłumaczenie i formatowanie napisów dodają kolejne etapy. 24-godzinne nagranie może zawierać zaledwie kilka godzin mowy, ale nadal wymagać dekodowania i segmentacji.

Model i rozmiar partii kształtują kompromis między szybkością a dokładnością

Mniejsze lub destylowane modele zwykle przetwarzają dane szybciej i zużywają mniej pamięci, podczas gdy większe modele wielojęzyczne mogą poprawiać dokładność w przypadku trudnych języków. Przetwarzanie wsadowe może zwiększyć wykorzystanie procesora graficznego przy wielu plikach, ale wydłuża oczekiwanie na pojedynczy pilny klip.

Zbiór pomiarów czasu działania wykonanych przez społeczność wskazuje, że teoretyczna moc obliczeniowa nie przekłada się liniowo na szybkość transkrypcji, jeśli nie uwzględni się przetwarzania wsadowego i wykorzystania całego potoku.

Krótkie klipy mają proporcjonalnie większy narzut związany z konfiguracją, otwieraniem plików i planowaniem niż długie nagrania. Wykrywanie języka i wyszukiwanie wiązkowe również mogą zmieniać czas działania. Większa liczba godzin audio dziennie nie jest automatycznie lepsza, jeśli liczba błędów słownych sprawia, że transkrypcje stają się nieużyteczne.

Gdzie wzór na przepustowość przestaje obowiązywać

RTF zmierzony dla czystej mowy mono może nie sprawdzić się w przypadku spotkań stereo, zaszumionych nagrań, wielu języków lub długich plików powodujących inne zachowanie pamięci. Dławienie termiczne i równoległe zadania NAS zmniejszają dostępną moc obliczeniową w ciągu całego dnia.

Praktyczny współczynnik czasu rzeczywistego pokazuje znaczne różnice między urządzeniami i potwierdza, że należy mierzyć rzeczywisty model, zamiast wyciągać wnioski o przepustowości wyłącznie na podstawie klasy procesora graficznego.

Wzór nie sprawdza się również w przypadku transkrypcji na żywo, jeśli opóźnienie musi pozostać krótsze niż napływ strumienia. Przetwarzanie offline może korzystać z partii i przyszłego kontekstu, z których nie może korzystać asystent działający w czasie rzeczywistym. Dzienna przepustowość i opóźnienie interaktywne to odrębne wyniki.

Przelicz zmierzony RTF na zakres dziennej przepustowości

Wybierz reprezentatywny zestaw krótkich notatek głosowych, długich spotkań, języków, poziomów hałasu i liczby kanałów. Zmierz czas przetwarzania kompleksowego, długość nagrania, liczbę błędów słownych na oznaczonym podzbiorze, szczytowe zużycie pamięci oraz energię przez co najmniej trzy godziny. Jeśli wymaga tego środowisko produkcyjne, uwzględnij diarizację lub wyrównywanie.

Uruchom test obok planowanych usług lokalnych obciążeń związanych z mową, aby zobaczyć rzeczywisty cykl pracy serwera. Zimne uruchomienia mierz oddzielnie od przepustowości po rozgrzaniu.

Oblicz dzienną przepustowość, dzieląc użyteczną liczbę godzin przetwarzania przez medianę RTF, a następnie do planowania zastosuj wolniejszy RTF p95 i 20-procentową rezerwę operacyjną. Jeśli dokładność nie osiąga celu, przejdź na mocniejszy model i wykonaj obliczenia ponownie, zamiast promować szybszy, lecz nieużyteczny wynik.

Centrum Technologii i Sztucznej Inteligencji

Więcej do przeczytania

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.