iiuniversitet.ruЦентр обучения нейросетямОткрыть каталог

Данные лабораторных приборов в Allotrope

Преобразует файлы лабораторных приборов в стандартный формат Allotrope ASM JSON или плоский CSV и создаёт код разбора для инженеров.

СкиллAnthropicClaudeApache-2.0Нужен терминалПроверка не требуется
Что делает
Преобразует файлы лабораторных приборов в стандартный формат Allotrope ASM JSON или плоский CSV и создаёт код разбора для инженеров.
Когда брать
Когда нужно привести выгрузки приборов (PDF, CSV, Excel, TXT) к единому стандарту для LIMS, ELN, озёр данных или анализа.
Пример запроса
Преобразуй эти данные подсчёта клеток с Vi-CELL BLU в формат Allotrope и сделай плоский CSV для нашей LIMS.
Нужно подключить
Python, терминал
Работает лучше с
LIMS или каталог данных (через MCP-сервер)

Входит в плагин bio-research. В Cowork и Claude Code можно поставить плагин целиком.

Как включить

  1. Скачайте архив и распакуйте его.
  2. Положите папку instrument-data-to-allotrope в ~/.claude/skills/.
  3. Откройте Claude Code и опишите задачу своими словами: Claude подхватит скилл по описанию.

Текст

---
name: instrument-data-to-allotrope
description: Преобразуй файлы с результатами лабораторных приборов (PDF, CSV, Excel, TXT) в формат Allotrope Simple Model (ASM) JSON или в «плоский» двумерный CSV. Используй этот скилл, когда учёным нужно привести данные приборов к единому стандарту для систем LIMS, озёр данных (data lakes) или последующего анализа. Поддерживает автоопределение типа прибора. На выходе — полный ASM JSON, плоский CSV для лёгкого импорта и экспортируемый код на Python для инженеров по данным. Типичные поводы: преобразование файлов приборов, стандартизация лабораторных данных, подготовка данных к загрузке в системы LIMS/ELN или создание кода разбора для промышленных конвейеров данных.
---

Конвертер данных приборов в Allotrope

Преобразуй файлы приборов в стандартизованный формат Allotrope Simple Model (ASM) для загрузки в LIMS, озёра данных или передачи командам инженеров по данным.

Примечание: это учебный пример скилла Этот скилл показывает, как скиллы могут поддерживать задачи инженерии данных: автоматизировать преобразование схем, разбирать выгрузки приборов и создавать готовый к промышленной эксплуатации код. Как настроить под свою организацию: - Измени файлы в references/, чтобы в них вошли схемы или сопоставления с онтологией, принятые в твоей компании - Используй MCP-сервер, чтобы подключиться к системам, задающим твои схемы (например, к LIMS, каталогу данных или реестру схем) - Расширь scripts/, чтобы они работали с собственными форматами приборов или внутренними стандартами данных Этот подход можно адаптировать для любого рабочего процесса преобразования данных, где нужно переводить из одного формата в другой или проверять данные на соответствие стандартам организации.

Обзор рабочего процесса

  1. Определи тип прибора по содержимому файла (автоопределение или по указанию пользователя)
  2. Разбери файл с помощью библиотеки allotropy (нативно) или гибкого запасного парсера
  3. Создай результаты:
  4. ASM JSON (полная семантическая структура)
  5. Плоский CSV (двумерный табличный формат)
  6. Код парсера на Python (для передачи инженеру по данным)
  7. Передай файлы с кратким описанием и инструкцией по использованию

Если не уверен: если ты не уверен, как сопоставить поле с ASM (например, это сырые данные или вычисленные? настройка прибора или условие среды?), спроси пользователя. Ориентируйся на references/field_classification_guide.md, но если неоднозначность остаётся, уточни у пользователя, а не гадай.

Быстрый старт

# Install requirements first
pip install allotropy pandas openpyxl pdfplumber --break-system-packages

# Core conversion
from allotropy.parser_factory import Vendor
from allotropy.to_allotrope import allotrope_from_file

# Convert with allotropy
asm = allotrope_from_file("instrument_data.csv", Vendor.BECKMAN_VI_CELL_BLU)

Выбор формата результата

ASM JSON (по умолчанию) — полная семантическая структура с URI онтологии

  • Лучше всего подходит для: систем LIMS, ожидающих ASM, озёр данных, долгосрочного архивирования
  • Проверяется по схемам Allotrope

Плоский CSV — двумерное табличное представление

  • Лучше всего подходит для: быстрого анализа, пользователей Excel, систем без поддержки JSON
  • Каждое измерение становится одной строкой, метаданные повторяются

Оба — создай оба формата для максимальной гибкости

Работа с вычисленными данными

ВАЖНО: Отделяй сырые измерения от вычисленных или производных значений.

  • Сырые данные → measurement-document (прямые показания прибора)
  • Вычисленные данные → calculated-data-aggregate-document (производные значения)

Вычисленные значения ОБЯЗАТЕЛЬНО должны содержать прослеживаемость через data-source-aggregate-document:

"calculated-data-aggregate-document": {
  "calculated-data-document": [{
    "calculated-data-identifier": "SAMPLE_B1_DIN_001",
    "calculated-data-name": "DNA integrity number",
    "calculated-result": {"value": 9.5, "unit": "(unitless)"},
    "data-source-aggregate-document": {
      "data-source-document": [{
        "data-source-identifier": "SAMPLE_B1_MEASUREMENT",
        "data-source-feature": "electrophoresis trace"
      }]
    }
  }]
}

Типичные вычисляемые поля по типам приборов:

ПриборВычисляемые поля
Счётчик клетокЖизнеспособность в %, плотность клеток с поправкой на разведение
СпектрофотометрКонцентрация (по поглощению), отношение 260/280
Планшетный ридерКонцентрации по стандартной кривой, %CV
ЭлектрофорезDIN/RIN, концентрации по областям, средние размеры
qPCRОтносительные количества, кратность изменения

Подробнее о разделении на сырые и вычисленные данные — в references/field_classification_guide.md.

Проверка

Всегда проверяй результат ASM, прежде чем передавать его пользователю:

python scripts/validate_asm.py output.json
python scripts/validate_asm.py output.json --reference known_good.json  # Compare to reference
python scripts/validate_asm.py output.json --strict  # Treat warnings as errors

Правила проверки:

Мягкий подход к проверке: Неизвестные методы, единицы измерения или роли образцов порождают предупреждения (не ошибки), чтобы сохранить совместимость с будущим. Если Allotrope добавит новые значения после декабря 2024 года, валидатор их не заблокирует — он пометит их для ручной проверки. Если нужна более строгая проверка, используй режим --strict, при котором предупреждения считаются ошибками.

Что проверяется:

  • Верный выбор метода (например, мультианалитное профилирование или планшетный ридер)
  • Соглашения об именовании полей (через пробел, а не через дефис)
  • У вычисленных данных есть прослеживаемость (data-source-aggregate-document)
  • Для измерений и вычисленных значений есть уникальные идентификаторы
  • Обязательные метаданные на месте
  • Допустимые единицы измерения и роли образцов (мягкая проверка для неизвестных значений)

Поддерживаемые приборы

Полный список — в references/supported_instruments.md. Основные приборы:

КатегорияПриборы
Подсчёт клетокVi-CELL BLU, Vi-CELL XR, NucleoCounter
СпектрофотометрияNanoDrop One/Eight/8000, Lunatic
Планшетные ридерыSoftMax Pro, EnVision, Gen5, CLARIOstar
ИФА (ELISA)SoftMax Pro, BMG MARS, MSD Workbench
qPCRQuantStudio, Bio-Rad CFX
ХроматографияEmpower, Chromeleon

Стратегия определения и разбора

Уровень 1: нативный разбор через allotropy (ПРЕДПОЧТИТЕЛЬНО)

Всегда сначала пробуй allotropy. Проверь доступных производителей прямо в коде:

from allotropy.parser_factory import Vendor

# List all supported vendors
for v in Vendor:
    print(f"{v.name}")

# Common vendors:
# AGILENT_TAPESTATION_ANALYSIS  (for TapeStation XML)
# BECKMAN_VI_CELL_BLU
# THERMO_FISHER_NANODROP_EIGHT
# MOLDEV_SOFTMAX_PRO
# APPBIO_QUANTSTUDIO
# ... many more

Когда пользователь даёт файл, проверь, поддерживает ли его allotropy, прежде чем переходить к ручному разбору. Автоопределение в scripts/convert_to_asm.py охватывает лишь часть производителей allotropy.

Уровень 2: гибкий запасной разбор

Используй, только если allotropy не поддерживает прибор. Этот запасной вариант:

  • НЕ создаёт calculated-data-aggregate-document
  • НЕ обеспечивает полную прослеживаемость
  • Даёт упрощённую структуру ASM

Используй гибкий парсер с:

  • нечётким сопоставлением названий столбцов
  • извлечением единиц измерения из заголовков
  • извлечением метаданных из структуры файла

Уровень 3: извлечение из PDF

Для файлов, существующих только в виде PDF, извлеки таблицы с помощью pdfplumber, затем примени разбор уровня 2.

Чек-лист перед разбором

Прежде чем писать собственный парсер, ВСЕГДА:

  1. Проверь, поддерживает ли это allotropy — если есть нативный парсер, используй его
  2. Найди эталонный файл ASM — посмотри в references/examples/ или спроси пользователя
  3. Просмотри руководство по конкретному прибору — загляни в references/instrument_guides/
  4. Сверься с эталоном — запусти validate_asm.py --reference <file>

Частые ошибки, которых нужно избегать

ОшибкаКак правильно
Манифест в виде объектаИспользовать строку с URL
Типы детектирования строчными буквамиПисать "Absorbance", а не "absorbance"
"emission wavelength setting"Для эмиссии использовать "detector wavelength setting"
Все измерения в одном документеГруппировать по лунке или месту образца
Нет метаданных процедурыИзвлекать ВСЕ настройки прибора для каждого измерения

Экспорт кода для инженеров по данным

Создавай автономные скрипты на Python, которые учёные могут передать дальше:

# Export parser code
python scripts/export_parser.py --input "data.csv" --vendor "VI_CELL_BLU" --output "parser_script.py"

Экспортированный скрипт:

  • Не имеет внешних зависимостей, кроме pandas/allotropy
  • Содержит встроенную документацию
  • Может работать в блокнотах Jupyter
  • Готов к промышленной эксплуатации в конвейерах данных

Структура файлов

instrument-data-to-allotrope/
├── SKILL.md                          # Этот файл
├── scripts/
│   ├── convert_to_asm.py            # Основной скрипт преобразования
│   ├── flatten_asm.py               # Преобразование ASM → двумерный CSV
│   ├── export_parser.py             # Создание автономного кода парсера
│   └── validate_asm.py              # Проверка качества результата ASM
└── references/
    ├── supported_instruments.md     # Полный список приборов с перечислениями Vendor
    ├── asm_schema_overview.md       # Справочник по структуре ASM
    ├── field_classification_guide.md # Куда помещать поля разных типов
    └── flattening_guide.md          # Как работает преобразование в плоский вид

Примеры использования

Пример 1: файл Vi-CELL BLU

Пользователь: «Преобразуй эти данные подсчёта клеток в формат Allotrope»
[загружает viCell_Results.xlsx]

Claude:
1. Определяет Vi-CELL BLU (уверенность 95%)
2. Преобразует нативным парсером allotropy
3. Выдаёт:
   - viCell_Results_asm.json (полный ASM)
   - viCell_Results_flat.csv (двумерный формат)
   - viCell_parser.py (экспортируемый код)

Пример 2: запрос на передачу кода

Пользователь: «Мне нужно передать нашему инженеру по данным код для разбора файлов NanoDrop»

Claude:
1. Создаёт автономный скрипт на Python
2. Добавляет пример входных и выходных данных
3. Документирует все допущения
4. Даёт версию в виде блокнота Jupyter

Пример 3: плоский файл для загрузки в LIMS

Пользователь: «Преобразуй эти данные ИФА в CSV, который я смогу загрузить в нашу LIMS»

Claude:
1. Разбирает данные планшетного ридера
2. Создаёт плоский CSV со столбцами:
   - sample_identifier, well_position, measurement_value, measurement_unit
   - instrument_serial_number, analysis_datetime, assay_type
3. Проверяет по типичным требованиям импорта в LIMS

Примечания по реализации

Установка allotropy

pip install allotropy --break-system-packages

Обработка сбоев разбора

Если нативный разбор через allotropy не удался:

  1. Запиши ошибку в журнал для отладки
  2. Перейди к гибкому парсеру
  3. Сообщи пользователю о пониженной полноте метаданных
  4. Предложи экспортировать с прибора другой формат

Проверка по схеме ASM

По возможности проверяй результат по схемам Allotrope:

import jsonschema
# Schema URLs in references/asm_schema_overview.md

Перевод: iiuniversitet. Оригинал: https://github.com/anthropics/knowledge-work-plugins/tree/main/bio-research/skills/instrument-data-to-allotrope, лицензия Apache-2.0. Изменения: перевод на русский язык.

Оригинал на английском
---
name: instrument-data-to-allotrope
description: Convert laboratory instrument output files (PDF, CSV, Excel, TXT) to Allotrope Simple Model (ASM) JSON format or flattened 2D CSV. Use this skill when scientists need to standardize instrument data for LIMS systems, data lakes, or downstream analysis. Supports auto-detection of instrument types. Outputs include full ASM JSON, flattened CSV for easy import, and exportable Python code for data engineers. Common triggers include converting instrument files, standardizing lab data, preparing data for upload to LIMS/ELN systems, or generating parser code for production pipelines.
---

# Instrument Data to Allotrope Converter

Convert instrument files into standardized Allotrope Simple Model (ASM) format for LIMS upload, data lakes, or handoff to data engineering teams.

> **Note: This is an Example Skill**
>
> This skill demonstrates how skills can support your data engineering tasks—automating schema transformations, parsing instrument outputs, and generating production-ready code.
>
> **To customize for your organization:**
> - Modify the `references/` files to include your company's specific schemas or ontology mappings
> - Use an MCP server to connect to systems that define your schemas (e.g., your LIMS, data catalog, or schema registry)
> - Extend the `scripts/` to handle proprietary instrument formats or internal data standards
>
> This pattern can be adapted for any data transformation workflow where you need to convert between formats or validate against organizational standards.

## Workflow Overview

1. **Detect instrument type** from file contents (auto-detect or user-specified)
2. **Parse file** using allotropy library (native) or flexible fallback parser
3. **Generate outputs**:
   - ASM JSON (full semantic structure)
   - Flattened CSV (2D tabular format)
   - Python parser code (for data engineer handoff)
4. **Deliver** files with summary and usage instructions

> **When Uncertain:** If you're unsure how to map a field to ASM (e.g., is this raw data or calculated? device setting or environmental condition?), ask the user for clarification. Refer to `references/field_classification_guide.md` for guidance, but when ambiguity remains, confirm with the user rather than guessing.

## Quick Start

```python
# Install requirements first
pip install allotropy pandas openpyxl pdfplumber --break-system-packages

# Core conversion
from allotropy.parser_factory import Vendor
from allotropy.to_allotrope import allotrope_from_file

# Convert with allotropy
asm = allotrope_from_file("instrument_data.csv", Vendor.BECKMAN_VI_CELL_BLU)
```

## Output Format Selection

**ASM JSON (default)** - Full semantic structure with ontology URIs
- Best for: LIMS systems expecting ASM, data lakes, long-term archival
- Validates against Allotrope schemas

**Flattened CSV** - 2D tabular representation
- Best for: Quick analysis, Excel users, systems without JSON support
- Each measurement becomes one row with metadata repeated

**Both** - Generate both formats for maximum flexibility

## Calculated Data Handling

**IMPORTANT:** Separate raw measurements from calculated/derived values.

- **Raw data** → `measurement-document` (direct instrument readings)
- **Calculated data** → `calculated-data-aggregate-document` (derived values)

Calculated values MUST include traceability via `data-source-aggregate-document`:

```json
"calculated-data-aggregate-document": {
  "calculated-data-document": [{
    "calculated-data-identifier": "SAMPLE_B1_DIN_001",
    "calculated-data-name": "DNA integrity number",
    "calculated-result": {"value": 9.5, "unit": "(unitless)"},
    "data-source-aggregate-document": {
      "data-source-document": [{
        "data-source-identifier": "SAMPLE_B1_MEASUREMENT",
        "data-source-feature": "electrophoresis trace"
      }]
    }
  }]
}
```

**Common calculated fields by instrument type:**
| Instrument | Calculated Fields |
|------------|-------------------|
| Cell counter | Viability %, cell density dilution-adjusted values |
| Spectrophotometer | Concentration (from absorbance), 260/280 ratio |
| Plate reader | Concentrations from standard curve, %CV |
| Electrophoresis | DIN/RIN, region concentrations, average sizes |
| qPCR | Relative quantities, fold change |

See `references/field_classification_guide.md` for detailed guidance on raw vs. calculated classification.

## Validation

Always validate ASM output before delivering to the user:

```bash
python scripts/validate_asm.py output.json
python scripts/validate_asm.py output.json --reference known_good.json  # Compare to reference
python scripts/validate_asm.py output.json --strict  # Treat warnings as errors
```

**Validation Rules:**
- Based on Allotrope ASM specification (December 2024)
- Last updated: 2026-01-07
- Source: https://gitlab.com/allotrope-public/asm

**Soft Validation Approach:**
Unknown techniques, units, or sample roles generate **warnings** (not errors) to allow for forward compatibility. If Allotrope adds new values after December 2024, the validator won't block them—it will flag them for manual verification. Use `--strict` mode to treat warnings as errors if you need stricter validation.

**What it checks:**
- Correct technique selection (e.g., multi-analyte profiling vs plate reader)
- Field naming conventions (space-separated, not hyphenated)
- Calculated data has traceability (`data-source-aggregate-document`)
- Unique identifiers exist for measurements and calculated values
- Required metadata present
- Valid units and sample roles (with soft validation for unknown values)

## Supported Instruments

See `references/supported_instruments.md` for complete list. Key instruments:

| Category | Instruments |
|----------|-------------|
| Cell Counting | Vi-CELL BLU, Vi-CELL XR, NucleoCounter |
| Spectrophotometry | NanoDrop One/Eight/8000, Lunatic |
| Plate Readers | SoftMax Pro, EnVision, Gen5, CLARIOstar |
| ELISA | SoftMax Pro, BMG MARS, MSD Workbench |
| qPCR | QuantStudio, Bio-Rad CFX |
| Chromatography | Empower, Chromeleon |

## Detection & Parsing Strategy

### Tier 1: Native allotropy parsing (PREFERRED)
**Always try allotropy first.** Check available vendors directly:

```python
from allotropy.parser_factory import Vendor

# List all supported vendors
for v in Vendor:
    print(f"{v.name}")

# Common vendors:
# AGILENT_TAPESTATION_ANALYSIS  (for TapeStation XML)
# BECKMAN_VI_CELL_BLU
# THERMO_FISHER_NANODROP_EIGHT
# MOLDEV_SOFTMAX_PRO
# APPBIO_QUANTSTUDIO
# ... many more
```

**When the user provides a file, check if allotropy supports it before falling back to manual parsing.** The `scripts/convert_to_asm.py` auto-detection only covers a subset of allotropy vendors.

### Tier 2: Flexible fallback parsing
**Only use if allotropy doesn't support the instrument.** This fallback:
- Does NOT generate `calculated-data-aggregate-document`
- Does NOT include full traceability
- Produces simplified ASM structure

Use flexible parser with:
- Column name fuzzy matching
- Unit extraction from headers
- Metadata extraction from file structure

### Tier 3: PDF extraction
For PDF-only files, extract tables using pdfplumber, then apply Tier 2 parsing.

## Pre-Parsing Checklist

Before writing a custom parser, ALWAYS:

1. **Check if allotropy supports it** - Use native parser if available
2. **Find a reference ASM file** - Check `references/examples/` or ask user
3. **Review instrument-specific guide** - Check `references/instrument_guides/`
4. **Validate against reference** - Run `validate_asm.py --reference <file>`

## Common Mistakes to Avoid

| Mistake | Correct Approach |
|---------|------------------|
| Manifest as object | Use URL string |
| Lowercase detection types | Use "Absorbance" not "absorbance" |
| "emission wavelength setting" | Use "detector wavelength setting" for emission |
| All measurements in one document | Group by well/sample location |
| Missing procedure metadata | Extract ALL device settings per measurement |

## Code Export for Data Engineers

Generate standalone Python scripts that scientists can hand off:

```python
# Export parser code
python scripts/export_parser.py --input "data.csv" --vendor "VI_CELL_BLU" --output "parser_script.py"
```

The exported script:
- Has no external dependencies beyond pandas/allotropy
- Includes inline documentation
- Can run in Jupyter notebooks
- Is production-ready for data pipelines

## File Structure

```
instrument-data-to-allotrope/
├── SKILL.md                          # This file
├── scripts/
│   ├── convert_to_asm.py            # Main conversion script
│   ├── flatten_asm.py               # ASM → 2D CSV conversion
│   ├── export_parser.py             # Generate standalone parser code
│   └── validate_asm.py              # Validate ASM output quality
└── references/
    ├── supported_instruments.md     # Full instrument list with Vendor enums
    ├── asm_schema_overview.md       # ASM structure reference
    ├── field_classification_guide.md # Where to put different field types
    └── flattening_guide.md          # How flattening works
```

## Usage Examples

### Example 1: Vi-CELL BLU file
```
User: "Convert this cell counting data to Allotrope format"
[uploads viCell_Results.xlsx]

Claude:
1. Detects Vi-CELL BLU (95% confidence)
2. Converts using allotropy native parser
3. Outputs:
   - viCell_Results_asm.json (full ASM)
   - viCell_Results_flat.csv (2D format)
   - viCell_parser.py (exportable code)
```

### Example 2: Request for code handoff
```
User: "I need to give our data engineer code to parse NanoDrop files"

Claude:
1. Generates self-contained Python script
2. Includes sample input/output
3. Documents all assumptions
4. Provides Jupyter notebook version
```

### Example 3: LIMS-ready flattened output
```
User: "Convert this ELISA data to a CSV I can upload to our LIMS"

Claude:
1. Parses plate reader data
2. Generates flattened CSV with columns:
   - sample_identifier, well_position, measurement_value, measurement_unit
   - instrument_serial_number, analysis_datetime, assay_type
3. Validates against common LIMS import requirements
```

## Implementation Notes

### Installing allotropy
```bash
pip install allotropy --break-system-packages
```

### Handling parse failures
If allotropy native parsing fails:
1. Log the error for debugging
2. Fall back to flexible parser
3. Report reduced metadata completeness to user
4. Suggest exporting different format from instrument

### ASM Schema Validation
Validate output against Allotrope schemas when available:
```python
import jsonschema
# Schema URLs in references/asm_schema_overview.md
```

Источник: anthropics/knowledge-work-plugins / bio-research / instrument-data-to-allotrope ↗. Ссылка проверена 2026-10-10.