Rename project to SciMesh

This commit is contained in:
Emil
2026-07-13 22:26:44 +03:00
parent b3ff218dfb
commit e182a614f0
3 changed files with 9 additions and 9 deletions
+1 -1
View File
@@ -5,7 +5,7 @@ __pycache__/
# Local ChEMBL download (about 738 MB); obtain it separately before running.
chembl_*.txt
# Files generated by molmesh.py
# Files generated by scimesh.py
*_similarities.csv
test_results.csv
test_structures/
+7 -7
View File
@@ -1,4 +1,4 @@
# MolMesh
# SciMesh
Минимальный локальный поиск молекул ChEMBL, похожих на гефитиниб (`CHEMBL939`).
@@ -21,20 +21,20 @@ conda install -c conda-forge rdkit
## Запуск
```bash
python molmesh.py chembl_37_chemreps.txt -o gefitinib_similarities.csv
python scimesh.py chembl_37_chemreps.txt -o gefitinib_similarities.csv
```
По умолчанию создаётся CSV с колонками `rank,chembl_id,canonical_smiles,similarity` и выводится тот же top-20 в терминал. Для другого размера выборки:
```bash
python molmesh.py chembl_37_chemreps.txt --top 50 -o top_50.csv
python scimesh.py chembl_37_chemreps.txt --top 50 -o top_50.csv
```
Во время поиска статус выводится в `stderr` каждые 100 000 строк: количество обработанных строк, текущая и средняя скорость, прошедшее время и число пропущенных невалидных SMILES. Период можно изменить или отключить:
```bash
python molmesh.py chembl_37_chemreps.txt --progress-every 500000
python molmesh.py chembl_37_chemreps.txt --progress-every 0
python scimesh.py chembl_37_chemreps.txt --progress-every 500000
python scimesh.py chembl_37_chemreps.txt --progress-every 0
```
## Быстрый тест на части базы
@@ -42,7 +42,7 @@ python molmesh.py chembl_37_chemreps.txt --progress-every 0
Опция `--max-rows` ограничивает второй проход первыми `N` строками TSV. Сам `CHEMBL939` перед этим всё равно находится в отдельном потоковом проходе, поэтому эталон остаётся тем же. Получившийся CSV — это top‑20 только по обработанной части, а не по полной базе.
```bash
python molmesh.py chembl_37_chemreps.txt --max-rows 10000 -o test_results.csv
python scimesh.py chembl_37_chemreps.txt --max-rows 10000 -o test_results.csv
```
## Изображения структур
@@ -50,7 +50,7 @@ python molmesh.py chembl_37_chemreps.txt --max-rows 10000 -o test_results.csv
Передайте каталог в `--images-dir`, чтобы создать `CHEMBL939_gefitinib.png` с гефитинибом и `top_candidates.png` с сеткой top‑кандидатов. На изображениях кандидатов указаны ранг, ChEMBL ID и Tanimoto similarity.
```bash
python molmesh.py chembl_37_chemreps.txt --images-dir structures
python scimesh.py chembl_37_chemreps.txt --images-dir structures
```
Опция `--image-columns` задаёт число структур в строке сетки (по умолчанию `4`).
+1 -1
View File
@@ -1,5 +1,5 @@
#!/usr/bin/env python3
"""Потоковый поиск молекул ChEMBL, похожих на гефитиниб (CHEMBL939)."""
"""SciMesh: потоковый поиск молекул ChEMBL, похожих на гефитиниб (CHEMBL939)."""
from __future__ import annotations