feat(flask): E1.0–E1.3, E1.8 — миграция на Python/Flask + AI v2
Этап 1 миграции TestingWebApp на целевой стек (Python/Flask/Jinja),
БД остаётся clinic_tests.
E1.0 — База Flask-приложения: SQLAlchemy/psycopg2 пул, Flask sessions,
фабрика create_app, blueprint main с / и /health, base.html в стиле
кабинета HR (Tailwind CDN + Manrope + Material Symbols), 404/500.
E1.1 — Auth + /api/me: Flask sessions (signed cookie) вместо JWT,
bcrypt + Werkzeug, опц. HR_AUTH=1 с UPSERT в clinic_tests.users по
staff_id. UI /login, JSON /api/auth/{login,logout,me}, декораторы
@login_required / @require_role.
E1.2 — Тесты: список + редактор. 10 эндпоинтов, сервисы test_draft,
test_access, test_chain, ai_editor, llm_client, draft_validator,
editor_content. UI /tests (каталог + создание) и /tests/<id>/edit
(редактор с AI). Полный мобильный UX (аккордеоны/drag-n-drop) — в E1.7.
E1.3 — Импорт документов: pypdf + python-docx, эндпоинт
POST /api/tests/import/document, кнопка «Импорт документа» в
AI-панели редактора, лимит 16 МБ.
E1.8 — AI v2: страница /settings (статус ENV-ключа + ping),
ai/generate-by-title (без сетки), ai/check (рецензия), ai/improve
(массовое было→стало с чекбоксами). Унифицированный ответ AI-ошибок:
{ error, code, settingsUrl }.
Docker:
- docker-compose.dev.yml: добавлены DATABASE_URL, HR_AUTH/HR_DATABASE_URL,
DEEPSEEK_API_KEY/OPENAI_API_KEY/LLM_BASE_URL/LLM_MODEL и сеть postgres
для testing-flask.
Документация:
- docs/migration-final.md — двух-этапный план (Этап 1: унификация
стека внутри TestingWebApp; Этап 2: слияние с tgFlaskForm).
- docs/migration-final-inventory.md — карта 22 эндпоинтов Express.
Made-with: Cursor
This commit is contained in:
@@ -0,0 +1,89 @@
|
||||
"""Извлечение текста из PDF/DOCX/TXT/MD (порт `services/documentExtractService.js`)."""
|
||||
from __future__ import annotations
|
||||
|
||||
from io import BytesIO
|
||||
from typing import Optional
|
||||
|
||||
|
||||
class HttpError(Exception):
|
||||
def __init__(self, status: int, message: str):
|
||||
super().__init__(message)
|
||||
self.status = status
|
||||
self.message = message
|
||||
|
||||
|
||||
SUPPORTED_MIME = {
|
||||
'application/pdf': 'pdf',
|
||||
'application/vnd.openxmlformats-officedocument.wordprocessingml.document': 'docx',
|
||||
'text/plain': 'text',
|
||||
'text/markdown': 'text',
|
||||
}
|
||||
SUPPORTED_EXT = {
|
||||
'.pdf': 'pdf',
|
||||
'.docx': 'docx',
|
||||
'.txt': 'text',
|
||||
'.md': 'text',
|
||||
}
|
||||
|
||||
|
||||
def resolve_document_kind(mimetype: str | None, original_name: str | None = '') -> Optional[str]:
|
||||
m = (mimetype or '').lower()
|
||||
n = (original_name or '').lower()
|
||||
if m in SUPPORTED_MIME:
|
||||
return SUPPORTED_MIME[m]
|
||||
for ext, kind in SUPPORTED_EXT.items():
|
||||
if n.endswith(ext):
|
||||
return kind
|
||||
return None
|
||||
|
||||
|
||||
def extract_text_from_buffer(kind: str, buf: bytes) -> str:
|
||||
if kind == 'text':
|
||||
try:
|
||||
return buf.decode('utf-8')
|
||||
except UnicodeDecodeError:
|
||||
return buf.decode('utf-8', errors='replace')
|
||||
|
||||
if kind == 'docx':
|
||||
try:
|
||||
from docx import Document
|
||||
except ImportError:
|
||||
raise HttpError(500, 'python-docx не установлен (см. requirements.txt).')
|
||||
doc = Document(BytesIO(buf))
|
||||
parts = []
|
||||
for p in doc.paragraphs:
|
||||
if p.text:
|
||||
parts.append(p.text)
|
||||
for table in doc.tables:
|
||||
for row in table.rows:
|
||||
for cell in row.cells:
|
||||
if cell.text:
|
||||
parts.append(cell.text)
|
||||
return '\n'.join(parts).replace('\r\n', '\n').strip()
|
||||
|
||||
if kind == 'pdf':
|
||||
try:
|
||||
from pypdf import PdfReader
|
||||
except ImportError:
|
||||
raise HttpError(500, 'pypdf не установлен (см. requirements.txt).')
|
||||
reader = PdfReader(BytesIO(buf))
|
||||
parts = []
|
||||
for page in reader.pages:
|
||||
try:
|
||||
t = page.extract_text() or ''
|
||||
except Exception:
|
||||
t = ''
|
||||
if t:
|
||||
parts.append(t)
|
||||
return '\n'.join(parts).replace('\r\n', '\n').strip()
|
||||
|
||||
return ''
|
||||
|
||||
|
||||
def extract_text_from_file(mimetype: str | None, file_storage, original_name: str | None) -> str:
|
||||
"""`file_storage` — werkzeug FileStorage. Читает целиком в память (≤16 МБ)."""
|
||||
kind = resolve_document_kind(mimetype, original_name)
|
||||
if not kind:
|
||||
raise HttpError(400, 'Неподдерживаемый формат. Допустимы: PDF, DOCX, TXT, MD.')
|
||||
buf = file_storage.read()
|
||||
return extract_text_from_buffer(kind, buf)
|
||||
Reference in New Issue
Block a user