feat(flask): E1.0–E1.3, E1.8 — миграция на Python/Flask + AI v2

Этап 1 миграции TestingWebApp на целевой стек (Python/Flask/Jinja),
БД остаётся clinic_tests.

E1.0 — База Flask-приложения: SQLAlchemy/psycopg2 пул, Flask sessions,
фабрика create_app, blueprint main с / и /health, base.html в стиле
кабинета HR (Tailwind CDN + Manrope + Material Symbols), 404/500.

E1.1 — Auth + /api/me: Flask sessions (signed cookie) вместо JWT,
bcrypt + Werkzeug, опц. HR_AUTH=1 с UPSERT в clinic_tests.users по
staff_id. UI /login, JSON /api/auth/{login,logout,me}, декораторы
@login_required / @require_role.

E1.2 — Тесты: список + редактор. 10 эндпоинтов, сервисы test_draft,
test_access, test_chain, ai_editor, llm_client, draft_validator,
editor_content. UI /tests (каталог + создание) и /tests/<id>/edit
(редактор с AI). Полный мобильный UX (аккордеоны/drag-n-drop) — в E1.7.

E1.3 — Импорт документов: pypdf + python-docx, эндпоинт
POST /api/tests/import/document, кнопка «Импорт документа» в
AI-панели редактора, лимит 16 МБ.

E1.8 — AI v2: страница /settings (статус ENV-ключа + ping),
ai/generate-by-title (без сетки), ai/check (рецензия), ai/improve
(массовое было→стало с чекбоксами). Унифицированный ответ AI-ошибок:
{ error, code, settingsUrl }.

Docker:
- docker-compose.dev.yml: добавлены DATABASE_URL, HR_AUTH/HR_DATABASE_URL,
  DEEPSEEK_API_KEY/OPENAI_API_KEY/LLM_BASE_URL/LLM_MODEL и сеть postgres
  для testing-flask.

Документация:
- docs/migration-final.md — двух-этапный план (Этап 1: унификация
  стека внутри TestingWebApp; Этап 2: слияние с tgFlaskForm).
- docs/migration-final-inventory.md — карта 22 эндпоинтов Express.

Made-with: Cursor
This commit is contained in:
Константин Лебединский
2026-04-27 23:29:26 +05:00
parent 31b51b7768
commit 4b0d56ff0e
48 changed files with 4170 additions and 203 deletions
@@ -0,0 +1,89 @@
"""Извлечение текста из PDF/DOCX/TXT/MD (порт `services/documentExtractService.js`)."""
from __future__ import annotations
from io import BytesIO
from typing import Optional
class HttpError(Exception):
def __init__(self, status: int, message: str):
super().__init__(message)
self.status = status
self.message = message
SUPPORTED_MIME = {
'application/pdf': 'pdf',
'application/vnd.openxmlformats-officedocument.wordprocessingml.document': 'docx',
'text/plain': 'text',
'text/markdown': 'text',
}
SUPPORTED_EXT = {
'.pdf': 'pdf',
'.docx': 'docx',
'.txt': 'text',
'.md': 'text',
}
def resolve_document_kind(mimetype: str | None, original_name: str | None = '') -> Optional[str]:
m = (mimetype or '').lower()
n = (original_name or '').lower()
if m in SUPPORTED_MIME:
return SUPPORTED_MIME[m]
for ext, kind in SUPPORTED_EXT.items():
if n.endswith(ext):
return kind
return None
def extract_text_from_buffer(kind: str, buf: bytes) -> str:
if kind == 'text':
try:
return buf.decode('utf-8')
except UnicodeDecodeError:
return buf.decode('utf-8', errors='replace')
if kind == 'docx':
try:
from docx import Document
except ImportError:
raise HttpError(500, 'python-docx не установлен (см. requirements.txt).')
doc = Document(BytesIO(buf))
parts = []
for p in doc.paragraphs:
if p.text:
parts.append(p.text)
for table in doc.tables:
for row in table.rows:
for cell in row.cells:
if cell.text:
parts.append(cell.text)
return '\n'.join(parts).replace('\r\n', '\n').strip()
if kind == 'pdf':
try:
from pypdf import PdfReader
except ImportError:
raise HttpError(500, 'pypdf не установлен (см. requirements.txt).')
reader = PdfReader(BytesIO(buf))
parts = []
for page in reader.pages:
try:
t = page.extract_text() or ''
except Exception:
t = ''
if t:
parts.append(t)
return '\n'.join(parts).replace('\r\n', '\n').strip()
return ''
def extract_text_from_file(mimetype: str | None, file_storage, original_name: str | None) -> str:
"""`file_storage` — werkzeug FileStorage. Читает целиком в память (≤16 МБ)."""
kind = resolve_document_kind(mimetype, original_name)
if not kind:
raise HttpError(400, 'Неподдерживаемый формат. Допустимы: PDF, DOCX, TXT, MD.')
buf = file_storage.read()
return extract_text_from_buffer(kind, buf)