iiuniversitet.ruЦентр обучения нейросетямОткрыть каталог

Расшифровка аудио в текст

Расшифровывает аудио и видео в текст через OpenAI, при необходимости размечая, кто из говорящих что сказал.

СкиллOpenAICodexApache-2.0Нужен терминалПроверка не требуется
Что делает
Расшифровывает аудио и видео в текст через OpenAI, при необходимости размечая, кто из говорящих что сказал.
Когда брать
Когда нужно расшифровать запись, извлечь текст из интервью или совещания и подписать реплики по говорящим.
Когда не брать
Если нет ключа OpenAI API или нужна расшифровка без отправки аудио во внешний сервис.
Пример запроса
Расшифруй запись совещания meeting.m4a и подпиши, кто что говорит: Алиса и Боб.
Нужно подключить
терминал, Python, ключ OpenAI API

Как включить

  1. Скачайте архив и распакуйте его.
  2. Положите папку transcribe в ~/.agents/skills/.
  3. Вызовите скилл командой $transcribe или найдите его через /skills.

Текст

---
name: "transcribe"
description: "Расшифровывает аудиофайлы в текст с необязательным разделением по говорящим (диаризацией) и подсказками об известных говорящих. Используй, когда пользователь просит расшифровать речь из аудио или видео, извлечь текст из записей или разметить говорящих в интервью и совещаниях."
---

Расшифровка аудио

Расшифровывай аудио с помощью OpenAI, при необходимости с разделением по говорящим. Для детерминированных, повторяемых запусков предпочитай входящий в состав CLI.

Рабочий процесс

  1. Собери входные данные: путь или пути к аудиофайлам, нужный формат ответа (text/json/diarized_json), необязательную подсказку о языке и любые образцы известных говорящих.
  2. Убедись, что задана переменная OPENAI_API_KEY. Если её нет, попроси пользователя задать её локально (не проси вставлять ключ).
  3. Запусти входящий в состав CLI transcribe_diarize.py с разумными значениями по умолчанию (быстрая текстовая расшифровка).
  4. Проверь результат: качество расшифровки, метки говорящих и границы сегментов; при необходимости улучшай одним целевым изменением.
  5. Когда работаешь в этом репозитории, сохраняй результаты в output/transcribe/.

Правила выбора

  • По умолчанию используй gpt-4o-mini-transcribe с --response-format text для быстрой расшифровки.
  • Если пользователю нужны метки говорящих или диаризация, используй --model gpt-4o-transcribe-diarize --response-format diarized_json.
  • Если аудио длиннее примерно 30 секунд, оставляй --chunking-strategy auto.
  • Подсказки в запросе (prompting) для gpt-4o-transcribe-diarize не поддерживаются.

Соглашения о результатах

  • Для пробных запусков используй output/transcribe/<job-id>/.
  • Для нескольких файлов используй --out-dir, чтобы не перезаписывать результаты.

Зависимости (установи, если их нет)

Для управления зависимостями предпочитай uv.

uv pip install openai

Если uv недоступен:

python3 -m pip install openai

Окружение

  • Для реальных вызовов API должна быть задана переменная OPENAI_API_KEY.
  • Если ключа нет, попроси пользователя создать его в интерфейсе платформы OpenAI и экспортировать в своей оболочке.
  • Никогда не проси пользователя вставлять ключ целиком в чат.

Путь к скиллу (задаётся один раз)

export CODEX_HOME="${CODEX_HOME:-$HOME/.codex}"
export TRANSCRIBE_CLI="$CODEX_HOME/skills/transcribe/scripts/transcribe_diarize.py"

Скиллы уровня пользователя устанавливаются в $CODEX_HOME/skills (по умолчанию ~/.codex/skills).

Быстрый старт с CLI

Один файл (быстрый текст по умолчанию):

python3 "$TRANSCRIBE_CLI" \
  path/to/audio.wav \
  --out transcript.txt

Диаризация с известными говорящими (до 4):

python3 "$TRANSCRIBE_CLI" \
  meeting.m4a \
  --model gpt-4o-transcribe-diarize \
  --known-speaker "Alice=refs/alice.wav" \
  --known-speaker "Bob=refs/bob.wav" \
  --response-format diarized_json \
  --out-dir output/transcribe/meeting

Вывод простым текстом (явно):

python3 "$TRANSCRIBE_CLI" \
  interview.mp3 \
  --response-format text \
  --out interview.txt

Карта справочных материалов

  • references/api.md: поддерживаемые форматы, ограничения, форматы ответа и заметки об известных говорящих.

Перевод: iiuniversitet. Оригинал: https://github.com/openai/skills/tree/main/skills/.curated/transcribe, лицензия Apache-2.0. Изменения: перевод на русский язык.

Оригинал на английском
---
name: "transcribe"
description: "Transcribe audio files to text with optional diarization and known-speaker hints. Use when a user asks to transcribe speech from audio/video, extract text from recordings, or label speakers in interviews or meetings."
---


# Audio Transcribe

Transcribe audio using OpenAI, with optional speaker diarization when requested. Prefer the bundled CLI for deterministic, repeatable runs.

## Workflow
1. Collect inputs: audio file path(s), desired response format (text/json/diarized_json), optional language hint, and any known speaker references.
2. Verify `OPENAI_API_KEY` is set. If missing, ask the user to set it locally (do not ask them to paste the key).
3. Run the bundled `transcribe_diarize.py` CLI with sensible defaults (fast text transcription).
4. Validate the output: transcription quality, speaker labels, and segment boundaries; iterate with a single targeted change if needed.
5. Save outputs under `output/transcribe/` when working in this repo.

## Decision rules
- Default to `gpt-4o-mini-transcribe` with `--response-format text` for fast transcription.
- If the user wants speaker labels or diarization, use `--model gpt-4o-transcribe-diarize --response-format diarized_json`.
- If audio is longer than ~30 seconds, keep `--chunking-strategy auto`.
- Prompting is not supported for `gpt-4o-transcribe-diarize`.

## Output conventions
- Use `output/transcribe/<job-id>/` for evaluation runs.
- Use `--out-dir` for multiple files to avoid overwriting.

## Dependencies (install if missing)
Prefer `uv` for dependency management.

```
uv pip install openai
```
If `uv` is unavailable:
```
python3 -m pip install openai
```

## Environment
- `OPENAI_API_KEY` must be set for live API calls.
- If the key is missing, instruct the user to create one in the OpenAI platform UI and export it in their shell.
- Never ask the user to paste the full key in chat.

## Skill path (set once)

```bash
export CODEX_HOME="${CODEX_HOME:-$HOME/.codex}"
export TRANSCRIBE_CLI="$CODEX_HOME/skills/transcribe/scripts/transcribe_diarize.py"
```

User-scoped skills install under `$CODEX_HOME/skills` (default: `~/.codex/skills`).

## CLI quick start
Single file (fast text default):
```
python3 "$TRANSCRIBE_CLI" \
  path/to/audio.wav \
  --out transcript.txt
```

Diarization with known speakers (up to 4):
```
python3 "$TRANSCRIBE_CLI" \
  meeting.m4a \
  --model gpt-4o-transcribe-diarize \
  --known-speaker "Alice=refs/alice.wav" \
  --known-speaker "Bob=refs/bob.wav" \
  --response-format diarized_json \
  --out-dir output/transcribe/meeting
```

Plain text output (explicit):
```
python3 "$TRANSCRIBE_CLI" \
  interview.mp3 \
  --response-format text \
  --out interview.txt
```

## Reference map
- `references/api.md`: supported formats, limits, response formats, and known-speaker notes.

Источник: openai/skills / transcribe ↗. Ссылка проверена 2026-10-10.