Dyktowanie w dowolne pole
Wołacz „Piszemy” i tekst trafia tam, gdzie mruga kursor — w dokument, mail albo formularz. Pole hasła Meduza zawsze pomija.
Polski asystent głosowy na Windows. Mówisz „Claude…”, „GPT…” albo „Meduza…”, a Meduza zamienia mowę w tekst na Twoim komputerze i wkleja go do czatu AI lub w dowolne pole — albo sama wykonuje polecenie. Zbudowaliśmy aplikację i jej stronę; orb, który widzisz, to jej prawdziwa mimika, uruchomiona kodem w Twojej przeglądarce.
1 943 dyktowania i 124 302 słowa w realnym użyciu od 20 lipca 2026 (stan na 11.10.2026) · aplikacja przed betą
Jedno słowo-wołacz mówi Meduzie, dokąd ma trafić tekst. Mowa zamienia się w tekst na karcie graficznej Twojego komputera; przez internet idzie dopiero tekst — do Claude, GPT albo do syntezy głosu Meduzy.
Wołacz „Piszemy” i tekst trafia tam, gdzie mruga kursor — w dokument, mail albo formularz. Pole hasła Meduza zawsze pomija.
Mówisz „Claude…” albo „GPT…”, a Meduza wkleja prompt do okna czatu, sprawdza, czy trafił, i wysyła. Twój schowek wraca do stanu sprzed wklejenia.
Wołacz „Meduza” to komenda, pytanie albo zadanie z kilku kroków. Odpowiada głosem, umie poszukać w sieci i pamięta wątek rozmowy.
Tekst i głosówki z Telegrama trafiają do Meduzy — wiadomość budzi nawet wyłączoną aplikację. Na telefonie widać podgląd ekranu komputera.
Rozumie polski zapis czasu, daty i powtórzenia, a przypomnienie potrafi zadzwonić w aplikacji na telefonie.
Głośność, urządzenia, jasność monitora i układ okien jak w Windows Snap — słownikiem, bez AI, w około 15 ms na zdanie.
zbudowane, czeka na test na żywoChcesz asystenta głosowego w swojej firmie?
Opisz, co Twój zespół robi dziś ręcznie — pokażemy, co może przejąć głos i AI. Wycena jest bezpłatna.
Tak Meduza prowadzi każdą wypowiedź. Nagrywanie zaczyna się wyłącznie od wołacza, a ten sam wołacz w jej własnym głosie z głośników jest ignorowany.
Mały model rozpoznawania słucha tylko słów-wołaczy. Reszta rozmów w pokoju nie uruchamia nagrywania.
„Claude”, „GPT”, „Meduza”, „Piszemy” — od wołacza zależy, czy tekst trafi do czatu AI, w dowolne pole, czy będzie poleceniem.
Mowa idzie w krótkich porcjach, a tekst pojawia się w dymku, zanim skończysz zdanie.
Detektor mowy liczony na bieżąco uznaje wypowiedź za skończoną dopiero po dłuższej ciszy (1,6–2,8 s), więc krótka pauza jej nie ucina.
Na końcu dokładny model rozpoznawania mowy dolicza ostatni fragment na karcie graficznej komputera i skleja go z wcześniejszymi porcjami w jeden tekst.
Tekst trafia do okna celu przez schowek; Meduza sprawdza wklejenie, wysyła i przywraca schowek. Polecenia wykonuje sama.
Masz proces, który da się wypowiedzieć?
Raporty, maile, notatki ze spotkań, wpisy do systemu — sprawdzimy, które z nich przejmie głos, a które agent AI.
Zaprojektowaliśmy i zbudowaliśmy stronę produktu w Next.js — z orbem i mimiką przeniesionymi 1:1 z aplikacji. Strona czeka na domenę i publikację, dlatego pokazujemy zrzuty z wersji roboczej — kliknij zrzut, by go powiększyć.

Siedem zakładek, każda ze sceną zbudowaną kodem, a nie klipem z banku — tu dyktowanie do dowolnego pola. Część opisanych funkcji jest jeszcze w budowie.

Fala głosu płynie od mikrofonu przez orba do aplikacji, w której piszesz — jedno słowo otwiera drogę.

Głos jako dostęp do komputera dla osób, dla których klawiatura i mysz są barierą — robocze teksty strony o potrzebach i odpowiedziach Meduzy.
Twój produkt też może mieć swój charakter
Strona, w której animacje pochodzą z produktu, a nie z banku klipów — zaprojektujemy i zbudujemy ją razem z Tobą.
Policzone w kodzie i w dzienniku użycia aplikacji — stan na 11 października 2026.
Pomiar pokazał 8,67 s „ciszy”, choć użytkownik cały czas mówił. Winny był przeciążony wątek okna, nie próg ciszy — detektor mowy liczymy teraz w wątku mikrofonu.
Bez 64 próbek kontekstu wykrywał 0% mowy zamiast 81% (pomiar na mowie syntetycznej). Zasadę odtworzyliśmy z kodu biblioteki, nie z dokumentacji.
Audyt bezpieczeństwa wykrył lukę wstrzykiwania komend. Agent pokazał działający atak, zanim ją zamknęliśmy.
Meduza sama nagrywała dalej po wysłaniu prompta. Teraz nagrywanie zaczyna wyłącznie wołacz, a jej własny głos z głośników go nie uruchamia.
Na szepcie syntetycznym (8 zdań) rozpoznane słowa wzrosły z 49% do 92%. Test na żywo 7 października: szeptany wołacz budzi Meduzę.
Zdanie „tryb ciemny jest fajny” włączało tryb ciemny — przez homonimy słownika. Za sterowaniem stoi katalog 1 629 funkcji Windows i słownik około 408 tysięcy form wyrazów.
Zbudujmy narzędzie na miarę Twojej pracy
Aplikacja na komputer, agent AI albo strona produktu — zaczynamy od rozmowy, a klikalny prototyp zobaczysz, zanim zapłacisz.
Asystent głosowy, aplikacja na komputer albo strona produktu — napisz, co chcesz zbudować. Odpowiadamy w ciągu 24 godzin.
Potwierdzimy termin mailem w ciągu 24 godzin.
Sprawdź skrzynkę (też folder spam).
Zobacz pozostałe realizacje XTN
SEOLDIER, Promocja SPA, agent AI do ofertowania, platforma B2B, Kokpit SEO i landingi sprzedażowe — każda pokazana od kuchni.