Przejdź do treści

Aplikacja i strona Meduza Copilot

Polski asystent głosowy na Windows. Mówisz „Claude…”, „GPT…” albo „Meduza…”, a Meduza zamienia mowę w tekst na Twoim komputerze i wkleja go do czatu AI lub w dowolne pole — albo sama wykonuje polecenie. Zbudowaliśmy aplikację i jej stronę; orb, który widzisz, to jej prawdziwa mimika, uruchomiona kodem w Twojej przeglądarce.

1 943 dyktowania i 124 302 słowa w realnym użyciu od 20 lipca 2026 (stan na 11.10.2026) · aplikacja przed betą

Co potrafi

Głos zamiast klawiatury i myszy

Jedno słowo-wołacz mówi Meduzie, dokąd ma trafić tekst. Mowa zamienia się w tekst na karcie graficznej Twojego komputera; przez internet idzie dopiero tekst — do Claude, GPT albo do syntezy głosu Meduzy.

Dyktowanie w dowolne pole

Wołacz „Piszemy” i tekst trafia tam, gdzie mruga kursor — w dokument, mail albo formularz. Pole hasła Meduza zawsze pomija.

Prompt do Claude i GPT

Mówisz „Claude…” albo „GPT…”, a Meduza wkleja prompt do okna czatu, sprawdza, czy trafił, i wysyła. Twój schowek wraca do stanu sprzed wklejenia.

Polecenia i pytania

Wołacz „Meduza” to komenda, pytanie albo zadanie z kilku kroków. Odpowiada głosem, umie poszukać w sieci i pamięta wątek rozmowy.

Most z telefonem

Tekst i głosówki z Telegrama trafiają do Meduzy — wiadomość budzi nawet wyłączoną aplikację. Na telefonie widać podgląd ekranu komputera.

Przypomnienia po polsku

Rozumie polski zapis czasu, daty i powtórzenia, a przypomnienie potrafi zadzwonić w aplikacji na telefonie.

Sterowanie Windows

Głośność, urządzenia, jasność monitora i układ okien jak w Windows Snap — słownikiem, bez AI, w około 15 ms na zdanie.

zbudowane, czeka na test na żywo

Chcesz asystenta głosowego w swojej firmie?

Opisz, co Twój zespół robi dziś ręcznie — pokażemy, co może przejąć głos i AI. Wycena jest bezpłatna.

Porozmawiajmy o podobnym projekcie
Droga głosu

Od słowa do wklejonego tekstu

Tak Meduza prowadzi każdą wypowiedź. Nagrywanie zaczyna się wyłącznie od wołacza, a ten sam wołacz w jej własnym głosie z głośników jest ignorowany.

  1. Czuwa na wołacz

    Mały model rozpoznawania słucha tylko słów-wołaczy. Reszta rozmów w pokoju nie uruchamia nagrywania.

  2. Rozpoznaje adresata

    „Claude”, „GPT”, „Meduza”, „Piszemy” — od wołacza zależy, czy tekst trafi do czatu AI, w dowolne pole, czy będzie poleceniem.

  3. Pisze w trakcie mówienia

    Mowa idzie w krótkich porcjach, a tekst pojawia się w dymku, zanim skończysz zdanie.

  4. Czeka, aż skończysz

    Detektor mowy liczony na bieżąco uznaje wypowiedź za skończoną dopiero po dłuższej ciszy (1,6–2,8 s), więc krótka pauza jej nie ucina.

  5. Składa całość

    Na końcu dokładny model rozpoznawania mowy dolicza ostatni fragment na karcie graficznej komputera i skleja go z wcześniejszymi porcjami w jeden tekst.

  6. Wkleja i sprawdza

    Tekst trafia do okna celu przez schowek; Meduza sprawdza wklejenie, wysyła i przywraca schowek. Polecenia wykonuje sama.

Masz proces, który da się wypowiedzieć?

Raporty, maile, notatki ze spotkań, wpisy do systemu — sprawdzimy, które z nich przejmie głos, a które agent AI.

Porozmawiajmy
Strona Meduzy

Strona, która ma twarz aplikacji

Zaprojektowaliśmy i zbudowaliśmy stronę produktu w Next.js — z orbem i mimiką przeniesionymi 1:1 z aplikacji. Strona czeka na domenę i publikację, dlatego pokazujemy zrzuty z wersji roboczej — kliknij zrzut, by go powiększyć.

Powiększ zrzut: sekcja Jak działa: zakładki funkcji i scena dyktowania do dowolnego pola

Zakładki ze scenami z kodu

Siedem zakładek, każda ze sceną zbudowaną kodem, a nie klipem z banku — tu dyktowanie do dowolnego pola. Część opisanych funkcji jest jeszcze w budowie.

Powiększ zrzut: sekcja Wołacze: fala głosu płynie przez orba do aplikacji

Wołacze

Fala głosu płynie od mikrofonu przez orba do aplikacji, w której piszesz — jedno słowo otwiera drogę.

Powiększ zrzut: sekcja Dostępność: nagłówek i dwie karty — ręce wolne od klawiatury, odpowiedzi głosem

Dostępność

Głos jako dostęp do komputera dla osób, dla których klawiatura i mysz są barierą — robocze teksty strony o potrzebach i odpowiedziach Meduzy.

Twój produkt też może mieć swój charakter

Strona, w której animacje pochodzą z produktu, a nie z banku klipów — zaprojektujemy i zbudujemy ją razem z Tobą.

Porozmawiajmy o stronie
Kulisy projektu

Aplikacja w liczbach

Policzone w kodzie i w dzienniku użycia aplikacji — stan na 11 października 2026.

1 943
dyktowania w realnym użyciu od 20 lipca 2026
124 302
podyktowane słowa — około 59 godzin pisania przy tempie 35 słów na minutę
74 471
linii kodu w Pythonie, w 219 plikach
1 208
testów automatycznych w 89 plikach testów

Historie z budowy

Ucinała zdania

Pomiar pokazał 8,67 s „ciszy”, choć użytkownik cały czas mówił. Winny był przeciążony wątek okna, nie próg ciszy — detektor mowy liczymy teraz w wątku mikrofonu.

Detektor, który milczał

Bez 64 próbek kontekstu wykrywał 0% mowy zamiast 81% (pomiar na mowie syntetycznej). Zasadę odtworzyliśmy z kodu biblioteki, nie z dokumentacji.

Luka znaleziona przed premierą

Audyt bezpieczeństwa wykrył lukę wstrzykiwania komend. Agent pokazał działający atak, zanim ją zamknęliśmy.

Nagrywa tylko na wołacz

Meduza sama nagrywała dalej po wysłaniu prompta. Teraz nagrywanie zaczyna wyłącznie wołacz, a jej własny głos z głośników go nie uruchamia.

Szept też się liczy

Na szepcie syntetycznym (8 zdań) rozpoznane słowa wzrosły z 49% do 92%. Test na żywo 7 października: szeptany wołacz budzi Meduzę.

Polszczyzna ma pułapki

Zdanie „tryb ciemny jest fajny” włączało tryb ciemny — przez homonimy słownika. Za sterowaniem stoi katalog 1 629 funkcji Windows i słownik około 408 tysięcy form wyrazów.

Gdzie jest projekt

Aplikacja
w użyciu od lipca 2026; trwają przygotowania do bety
Strona
gotowa w wersji roboczej; czeka na domenę i publikację
Płatności
przygotowane w kodzie strony, jeszcze nieuruchomione
W budowie
sterowanie Windows, mapa ekranu, rozmowa ciągła i tryb formularza — zbudowane, czekają na test na żywo

Technologie

Aplikacja
Python i PySide6 (Qt); orb to strona HTML w oknie aplikacji
Mowa na tekst
faster-whisper (model large-v3) na karcie graficznej — lokalnie
Czuwanie
Vosk i Whisper tiny jako czujki wołaczy, Silero VAD do wykrywania mowy
Głos
edge-tts, głos Zofia — synteza przez internet
AI
Claude (Haiku, Sonnet, Opus) i GPT przez API, Claude Code do zadań na komputerze
Telefon
Telegram i własna aplikacja na Androida (Kotlin), połączona przez Tailscale
Bezpieczeństwo
klucze API i hasła aplikacji szyfrowane mechanizmem DPAPI Windows
Strona
Next.js 16, React 19, Tailwind 4, framer-motion; orb w CSS i canvas

Zbudujmy narzędzie na miarę Twojej pracy

Aplikacja na komputer, agent AI albo strona produktu — zaczynamy od rozmowy, a klikalny prototyp zobaczysz, zanim zapłacisz.

Porozmawiajmy
Rozmowa

Porozmawiajmy o podobnym projekcie

Asystent głosowy, aplikacja na komputer albo strona produktu — napisz, co chcesz zbudować. Odpowiadamy w ciągu 24 godzin.

Pora dnia
Podaj imię (min. 2 znaki).
Podaj poprawny adres e-mail.

Administratorem danych jest Sellz Prosta Spółka Akcyjna z siedzibą w Warszawie (KRS 0001087452), kontakt: office@xtn.pl. Dane z formularza przetwarzamy wyłącznie po to, żeby umówić rozmowę i odpowiedzieć na zapytanie (art. 6 ust. 1 lit. b i f RODO) — przez czas rozmów, a przy współpracy przez czas umowy i okres przedawnienia roszczeń. Masz prawo dostępu do danych, ich sprostowania, usunięcia, ograniczenia przetwarzania, sprzeciwu oraz skargi do Prezesa UODO.

Formularz chroniony przed botami — bez cookies i zewnętrznych usług.

Nie udało się wysłać. Spróbuj ponownie albo napisz na office@xtn.pl.

Zobacz pozostałe realizacje XTN

SEOLDIER, Promocja SPA, agent AI do ofertowania, platforma B2B, Kokpit SEO i landingi sprzedażowe — każda pokazana od kuchni.

Wszystkie realizacje