diff --git a/.gitignore b/.gitignore index d43361d..85ca7bc 100644 --- a/.gitignore +++ b/.gitignore @@ -5,7 +5,7 @@ __pycache__/ # Local ChEMBL download (about 738 MB); obtain it separately before running. chembl_*.txt -# Files generated by molmesh.py +# Files generated by scimesh.py *_similarities.csv test_results.csv test_structures/ diff --git a/README.md b/README.md index 686185d..4edcc3c 100644 --- a/README.md +++ b/README.md @@ -1,4 +1,4 @@ -# MolMesh +# SciMesh Минимальный локальный поиск молекул ChEMBL, похожих на гефитиниб (`CHEMBL939`). @@ -21,20 +21,20 @@ conda install -c conda-forge rdkit ## Запуск ```bash -python molmesh.py chembl_37_chemreps.txt -o gefitinib_similarities.csv +python scimesh.py chembl_37_chemreps.txt -o gefitinib_similarities.csv ``` По умолчанию создаётся CSV с колонками `rank,chembl_id,canonical_smiles,similarity` и выводится тот же top-20 в терминал. Для другого размера выборки: ```bash -python molmesh.py chembl_37_chemreps.txt --top 50 -o top_50.csv +python scimesh.py chembl_37_chemreps.txt --top 50 -o top_50.csv ``` Во время поиска статус выводится в `stderr` каждые 100 000 строк: количество обработанных строк, текущая и средняя скорость, прошедшее время и число пропущенных невалидных SMILES. Период можно изменить или отключить: ```bash -python molmesh.py chembl_37_chemreps.txt --progress-every 500000 -python molmesh.py chembl_37_chemreps.txt --progress-every 0 +python scimesh.py chembl_37_chemreps.txt --progress-every 500000 +python scimesh.py chembl_37_chemreps.txt --progress-every 0 ``` ## Быстрый тест на части базы @@ -42,7 +42,7 @@ python molmesh.py chembl_37_chemreps.txt --progress-every 0 Опция `--max-rows` ограничивает второй проход первыми `N` строками TSV. Сам `CHEMBL939` перед этим всё равно находится в отдельном потоковом проходе, поэтому эталон остаётся тем же. Получившийся CSV — это top‑20 только по обработанной части, а не по полной базе. ```bash -python molmesh.py chembl_37_chemreps.txt --max-rows 10000 -o test_results.csv +python scimesh.py chembl_37_chemreps.txt --max-rows 10000 -o test_results.csv ``` ## Изображения структур @@ -50,7 +50,7 @@ python molmesh.py chembl_37_chemreps.txt --max-rows 10000 -o test_results.csv Передайте каталог в `--images-dir`, чтобы создать `CHEMBL939_gefitinib.png` с гефитинибом и `top_candidates.png` с сеткой top‑кандидатов. На изображениях кандидатов указаны ранг, ChEMBL ID и Tanimoto similarity. ```bash -python molmesh.py chembl_37_chemreps.txt --images-dir structures +python scimesh.py chembl_37_chemreps.txt --images-dir structures ``` Опция `--image-columns` задаёт число структур в строке сетки (по умолчанию `4`). diff --git a/molmesh.py b/scimesh.py similarity index 98% rename from molmesh.py rename to scimesh.py index 7f7f9f8..7368671 100644 --- a/molmesh.py +++ b/scimesh.py @@ -1,5 +1,5 @@ #!/usr/bin/env python3 -"""Потоковый поиск молекул ChEMBL, похожих на гефитиниб (CHEMBL939).""" +"""SciMesh: потоковый поиск молекул ChEMBL, похожих на гефитиниб (CHEMBL939).""" from __future__ import annotations