← Python мануфактура

Після цього уроку ви зможете

Конспект і таймкоди

0:00

Diduny: диктування без meeting bot

Diduny виник як спосіб продиктувати prompt або повідомлення й одразу вставити розпізнаний текст у поточне поле. На відміну від багатьох meeting services, для запису зустрічі не потрібно долучати окремого bot-учасника. Це прибирає конфлікти кількох bots і незручність для інших учасників.

Окрема проблема — multilingual meetings, де розмова перемикається між українською, англійською, польською чи німецькою. Звичайні transcription services часто помиляються, якщо очікують одну мову на весь запис. У відео Diduny показано як macOS app із shortcuts для dictation, перекладу виділеного тексту та запису зустрічей.

Термін

SpeechAnalyzer

Apple API для asynchronous analysis live або prerecorded audio; transcription results надходять як sequence, locale assets керуються окремо, а analysis session має explicit finish/error lifecycle.

Термін

Capture authorization

Явний user permission, який application має отримати перед доступом до microphone або camera capture device. Permission state потрібно обробляти до початку recording workflow.

Термін

SpeechTranscriber

First-party on-device transcription module для SpeechAnalyzer з system-managed locale assets; support потрібно перевіряти для конкретної locale та device.

Практика

Спроєктувати безпечний transcription workflow

  1. Опишіть cloud і local paths від початку recording до готового transcript.
  2. Позначте permissions, temporary files, user-visible status і точку retry.
  3. Визначте, які дані не повинні залишати device без окремої згоди.

Результат: Flow diagram або таблиця states з privacy boundary та recovery path.

3:05

Cloud і local transcription modes

Cloud processing описано як швидший і якісніший режим. Local model дає більше контролю над даними та працює без стабільного інтернету, але суттєво навантажує CPU/GPU і споживає ресурси приблизно як важкий застосунок або гра.

Запис можна спочатку зберегти як audio, а транскрибувати пізніше — cloud або local model. Це корисно для лекцій та нестабільного зв’язку. Для диктування цінність не лише в «ідеальному» тексті, а у збереженні власної манери мовлення без характерного стилю згенерованого повідомлення.

Уточнення

Застереження

SpeechAnalyzer і on-device SpeechTranscriber уже були доступні до запису відео. Вони показують, що local transcription не має одного performance profile: latency, resource limits, locale support і code-switching потрібно вимірювати на цільових devices.

6:10

Papuga: виправлення неправильної розкладки

Papuga вирішує локальну проблему кількох keyboard layouts: користувач набрав фразу не тією мовою, виділяє її та shortcut-ом перетворює на правильну розкладку. У відео це позиціонується як безкоштовний macOS-аналог Punto Switcher із ручним запуском конвертації.

Ручна дія є свідомою межею показаної версії: автоматична заміна ще не готова. Такий режим зменшує ризик, що застосунок самовільно змінить коректний текст.

Увага

Застереження

Відео демонструє historical product state. Поточні назви, download URLs, pricing, access limits і platform support потребують окремого підтвердження автором перед публікацією.

8:35

Browser Kitty: правильний link у правильному профілі

Коли одночасно використовуються персональні, робочі й client accounts, відкриття link у default browser може змішати sessions або показати не той account під час screen sharing. Автор розділяє контексти через різні browser profiles і навіть різні browsers.

Browser Kitty перехоплює відкриття URL та дозволяє keyboard shortcut-ом вибрати потрібний browser, profile, desktop app або incognito mode. Практичний результат — менше ручних переходів і нижчий ризик випадково відкрити приватний або робочий ресурс у неправильному контексті.

11:15

AI sidebar і робота з HTML-контекстом

Ще один експеримент — sidebar, який об’єднує кілька LLM interfaces і передає їм виділений на сторінці текст або HTML fragment. Для automation engineer це скорочує шлях від inspect element до prompt: можна вибрати DOM block і попросити запропонувати locator або page object.

Це не замінює перевірку selector-а. Згенерований варіант треба оцінити за semantics, uniqueness і stability у реальному DOM, але інструмент прибирає кілька механічних copy/paste дій.

14:10

Доступ і межі демонстрації

Наприкінці показано account flow Diduny через email і one-time password та згадано тимчасовий розширений доступ для учасників курсу. Також наголошено на правильному виборі microphone і transcription mode в settings.

Усі продемонстровані продукти на той момент перебували в активній розробці: частина функцій, pricing і platform support могла змінитися після запису.

Джерела та додаткові матеріали