Compare commits

..

1 Commits

Author SHA1 Message Date
gitea 98b311c26d feat(astrololo): Postgres jako lustro baz w SQL + runbook (DAN-28)
Manifest, wpięcie w kustomization i runbook krok po kroku.

DECYZJE ZAPISANE W MANIFEŚCIE, ŻEBY NIE TRZEBA ICH BYŁO ODTWARZAĆ Z GŁOWY:

local-path, NIE NFS. Postgres zakłada semantykę blokad i fsync, której NFS nie
gwarantuje — to klasyczne źródło uszkodzenia bazy przy nagłym restarcie. Ceną
jest przywiązanie do węzła; przy luście odtwarzalnym z Excela to akceptowalne.

strategy: Recreate. Wolumen jest ReadWriteOnce, a dwa procesy Postgresa na jednym
katalogu danych to uszkodzona baza — rolling próbowałby wstać z nowym podem,
zanim stary zejdzie.

PGDATA w PODKATALOGU wolumenu: katalog główny potrafi zawierać wpisy systemu
plików, a initdb odmawia pracy w niepustym katalogu.

Wersja PRZYPIĘTA i poza image-updaterem: podbicie majora wymaga migracji katalogu
danych, więc nie może się zdarzyć samo, w nocy, przy okazji builda aplikacji.

C.UTF-8 zamiast pl_PL.UTF-8: dopasowanie tekstu robimy przez unaccent i pg_trgm,
nie przez collation, a pl_PL wymagałby obrazu z wygenerowanymi lokalizacjami.

DATA_PROVIDER zostaje na `excel`. Postgres można wdrożyć i obejrzeć BEZ ryzyka
dla działającego wyszukiwania; przełączenie to osobna, późniejsza decyzja.

SPRAWDZONE PRZED ODDANIEM: `kubectl kustomize astrololo` składa komplet 21
zasobów bez błędu, YAML parsuje się poprawnie, audyt odwołań potwierdza, że
jedynym brakującym sekretem jest astrololo-postgres (oba klucze), a DSN
postgresql+psycopg:// jest rozpoznawany przez SQLAlchemy z psycopg 3.

NIE SPRAWDZONE: skrypt inicjalizujący nie biegł przeciwko prawdziwemu Postgresowi
— na maszynie, na której to powstawało, nie ma Dockera. Zapisane wprost
w runbooku; krok 4 jest tam prawdziwym testem.

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
2026-08-07 15:16:44 +02:00
7 changed files with 18 additions and 345 deletions
-133
View File
@@ -1,133 +0,0 @@
# Zarządzanie plikami baz — otwarcie udziału na zapis (DAN-27)
Ekran „Pliki" pozwala wgrywać bazy, archiwizować je i (dla administratora)
kasować, a stan użycia jest **klikany**, więc musi być trwały. Wymaga to zapisu
do udziału z bazami — a ten jest dziś wyeksportowany tylko do odczytu.
---
## Co świadomie tracimy
DAN-25 dawał gwarancję, że **baz nie da się zmienić przez NFS**. DAN-27 tę
gwarancję z definicji znosi — nie da się mieć obu naraz.
**Co zostaje:**
| zabezpieczenie | działa nadal |
|---|---|
| eksport zawężony do trzech węzłów k8s | ✅ |
| token międzywarstwowy | ✅ |
| szyfrowane łącze prezentacja ↔ logika ↔ dane | ✅ |
| kasowanie plików wyłącznie z konta administracyjnego (PRE-27) | ✅ |
| dziennik audytowy (kto, kiedy, co) | ✅ |
Ryzyko, które przybywa: **przejęcie warstwy danych pozwala teraz nie tylko
odczytać bazy, ale i je zmienić.**
---
## Krok 1 — otwórz udział na zapis
```bash
midclt call sharing.nfs.query '[["path","=","/mnt/Tank1/astrololo"]]' \
| python3 -c "import sys,json;[print(s['id'], '| ro:', s['ro'], '| mapall:', s.get('mapall_user')) for s in json.load(sys.stdin)]"
```
Weź `id` i podstaw za `<ID>`:
```bash
midclt call sharing.nfs.update <ID> '{"ro": false, "mapall_user": "root", "mapall_group": "root"}'
```
> **Dlaczego `mapall_user`, skoro katalog ma `drwxrwxrwx`?** Samo `ro: false`
> wystarczyłoby do zapisu — zmapowany `nobody` mieści się w prawach „innych".
> Ale nowe pliki należałyby wtedy do `nobody`, a istniejące bazy do `root`.
> Mieszana własność zemści się przy pierwszym zaostrzeniu praw. `mapall_user:
> root` daje spójność i jest tym samym ustawieniem, co na udziale `astrololo-state`.
```bash
midclt call service.restart nfs
```
Sprawdź, że zmiana **faktycznie trafiła do jądra** — sama konfiguracja to za mało:
```bash
sudo exportfs -v | grep -A1 "Tank1/astrololo "
```
Przy `/mnt/Tank1/astrololo` musi być `rw`, nie `ro`.
---
## Krok 2 — zmerguj oba PR-y
* aplikacja: `feat/zarzadzanie-plikami`
* deploy: `feat/pliki-zapis` (zdejmuje `readOnly` z montowania w podzie)
Bez tego drugiego pod nadal montuje udział tylko do odczytu, choćby serwer
pozwalał pisać.
---
## Krok 3 — przeładuj warstwę danych PRZEZ ZERO REPLIK
> ⚠️ **`rollout restart` NIE WYSTARCZY.** Stary i nowy pod na chwilę
> współistnieją, więc montowanie NFS ani na moment nie zostaje bez użytkownika
> i nowy pod dziedziczy uprawnienia sprzed zmiany eksportu. To kosztowało
> najwięcej czasu przy udziale `astrololo-state` — patrz
> [README-stan-prezentacji.md](README-stan-prezentacji.md).
```bash
kubectl -n astrololo scale deploy/data --replicas=0
kubectl -n astrololo wait --for=delete pod -l app=data --timeout=90s
kubectl -n astrololo scale deploy/data --replicas=1
kubectl -n astrololo rollout status deploy/data
```
---
## Krok 4 — sprawdź, w tej kolejności
**Czy warstwa danych może pisać:**
```bash
kubectl -n astrololo exec deploy/data -- sh -c 'touch /app/data_files/proba && echo ZAPIS-OK && rm /app/data_files/proba'
```
**Czy powstał plik stanu i czy bazy zostały przyjęte jako aktywne:**
```bash
kubectl -n astrololo exec deploy/data -- sh -c 'cat /app/data_files/.files-state.json' | head -20
```
Oczekiwane: każda baza ze `"status": "active"`. Przy pierwszym uruchomieniu bazy
zastane na udziale są przyjmowane automatycznie — **bez tego wyszukiwanie
przestałoby cokolwiek znajdować**, bo plik bez wpisu w rejestrze nie bierze
udziału w wynikach.
**Czy wyszukiwanie NADAL DZIAŁA** — to jest najważniejszy sprawdzian tego
wdrożenia, bo właśnie tu zmiana mogłaby przejść niezauważona:
```bash
kubectl -n astrololo logs deploy/data --tail=20
```
a potem w przeglądarce: zakładka **Sygnifikatory**, dowolne wyszukanie. Musi
zwracać wyniki jak przedtem. Jeśli nagle nic nie znajduje — zajrzyj do
`.files-state.json` z komendy wyżej.
**Czy ekran „Pliki" działa:** zakładka **Pliki**, lista baz, przełącznik przy
każdej. Wgraj testowy plik, zarchiwizuj go, skasuj.
---
## Odkręcenie
```bash
midclt call sharing.nfs.update <ID> '{"ro": true, "mapall_user": null, "mapall_group": null}'
midclt call service.restart nfs
```
plus cofnięcie deploy `feat/pliki-zapis`. Ekran „Pliki" zostanie, ale wgrywanie
i kasowanie przestaną działać — a stan użycia przestanie się zapisywać, więc bazy
będą przyjmowane od nowa przy każdym starcie (czyli wszystkie aktywne).
-135
View File
@@ -1,135 +0,0 @@
# Udział na stan prezentacji — `astrololo-state`
Potrzebny do kont zakładanych z ekranu „Konta" (PRE-27). **Bez niego pod
`presentation` nie wstanie.**
---
## Dlaczego osobny udział, a nie podkatalog
Pierwsza wersja montowała `/mnt/Tank1/astrololo` z `subPath: presentation-state`
i pod stanął w `CreateContainerConfigError`:
```
failed to create subPath directory for volumeMount "state" of container "presentation"
```
Przyczyna była podwójna i za każdym razem ta sama: udział z bazami jest
wyeksportowany **`ro: true` z `root_squash`** (patrz runbook DAN-25 w repo
aplikacji). Zatem:
1. kubelet nie mógł utworzyć podkatalogu — bo udział jest tylko do odczytu,
2. a gdyby nawet mógł, aplikacja i tak nie zapisałaby tam pliku kont.
**Osobny udział rozwiązuje to bez ruszania DAN-25.** Udział z bazami zostaje tylko
do odczytu; konta dostają własne, małe miejsce. Przy okazji znika `subPath`, czyli
znika potrzeba, żeby kubelet cokolwiek zakładał — katalog istnieje, bo jest
korzeniem udziału.
---
## Krok 1 — dataset i udział na TrueNAS
Po SSH na NAS (192.168.1.34). Konwencja jak w DAN-25: **nie edytujemy
`/etc/exports` ręcznie**, tylko przez `midclt`.
```bash
# dataset
sudo zfs create Tank1/astrololo-state
```
Jeśli `Tank1` nie jest pulą ZFS albo wolisz zwykły katalog:
```bash
sudo mkdir -p /mnt/Tank1/astrololo-state
```
### Właściciel i prawa
Kontenery aplikacji działają **jako root**, a eksport ma `root_squash`, więc root
z klienta NIE jest rootem na udziale. Żeby zapis działał, przypinamy cały ruch
z tych hostów do jednego, nieuprzywilejowanego użytkownika — to bezpieczniejsze
niż `no_root_squash`, bo nie oddaje roota.
```bash
# użytkownik, na którego mapujemy (jeśli nie istnieje — utwórz w UI TrueNAS)
sudo chown -R apps:apps /mnt/Tank1/astrololo-state
sudo chmod 770 /mnt/Tank1/astrololo-state
```
> Podstaw swojego użytkownika w miejsce `apps`. Sprawdzisz istniejących:
> `midclt call user.query | python3 -c "import sys,json;[print(u['uid'], u['username']) for u in json.load(sys.stdin)]"`
### Eksport NFS
```bash
midclt call sharing.nfs.create '{
"path": "/mnt/Tank1/astrololo-state",
"comment": "astrololo — stan prezentacji (konta PRE-27)",
"hosts": ["192.168.1.73", "192.168.1.80", "192.168.1.81"],
"ro": false,
"mapall_user": "apps",
"mapall_group": "apps"
}'
```
| ustawienie | po co |
|---|---|
| `hosts` zawężone | te same trzy węzły k8s co w DAN-25 — nikt inny nie zamontuje |
| `ro: false` | **musi być zapisywalny**, inaczej konta się nie zapiszą |
| `mapall_user` | cały ruch pisze jako jeden nieuprzywilejowany użytkownik, niezależnie od UID w kontenerze |
> Podstaw swoje adresy węzłów, jeśli się zmieniły. Aktualne:
> `kubectl get nodes -o wide`
---
## Krok 2 — sprawdź z węzła, ZANIM wdrożysz
To jest ten test, którego zabrakło za pierwszym razem:
```bash
ssh 192.168.1.73 'sudo mount -t nfs 192.168.1.34:/mnt/Tank1/astrololo-state /mnt/test \
&& sudo touch /mnt/test/proba && echo "ZAPIS DZIAŁA" \
&& sudo rm /mnt/test/proba; sudo umount /mnt/test'
```
Musi wypisać **`ZAPIS DZIAŁA`**. Jeśli zamiast tego widzisz `Permission denied`
wróć do praw katalogu i `mapall_user` w kroku 1.
---
## Krok 3 — wdróż i sprawdź
```bash
kubectl apply -k astrololo
kubectl -n astrololo rollout status deploy/presentation
```
Sprawdź, że aplikacja faktycznie umie tam zapisać — załóż konto testowe
na ekranie „Konta", a potem:
```bash
kubectl -n astrololo exec deploy/presentation -- ls -l /app/state/
```
Oczekiwane: plik `accounts.json`.
---
## Odkręcenie
```bash
# ID udziału
midclt call sharing.nfs.query | python3 -c "import sys,json;[print(s['id'], s.get('path')) for s in json.load(sys.stdin)]"
midclt call sharing.nfs.delete <ID>
```
---
## Uwaga na przyszłość: DAN-27 uderzy w tę samą ścianę
Zarządzanie plikami baz (wgrywanie, archiwizacja, kasowanie) wymaga zapisu do
**udziału z bazami** — a ten jest `ro: true`. Ten runbook tego **nie rozwiązuje**
i celowo nie rusza DAN-25: to osobna decyzja, bo oznacza rezygnację z gwarancji,
że baz nie da się zmienić przez NFS. Patrz PR `feat/pliki-zapis`.
+6 -46
View File
@@ -23,54 +23,14 @@ Ten plik **celowo nie jest w `kustomization.yaml`**: resource stoi w ns `argocd`
(poza namespace docelowym aplikacji), a to konfiguracja kontrolera, który wdraża tę
aplikację — nakładamy go ręcznie, w repo trzymamy dla odtwarzalności i historii.
## Pliki baz — udział otwarty na zapis (DAN-27)
## Postgres — lustro baz w SQL (DAN-28)
Runbook: **[README-pliki.md](README-pliki.md)**. Ekran „Pliki" wymaga zapisu do
udziału z bazami, więc znosi gwarancję z DAN-25, że baz nie da się zmienić przez
NFS. Co zostaje z zabezpieczeń i jak to wdrożyć — w runbooku.
Osobny runbook: **[README-postgres.md](README-postgres.md)** — co zrobiono w repo,
co musisz zrobić ręcznie (sekret `astrololo-postgres`), jak sprawdzić rozszerzenia
`pg_trgm`/`unaccent` i jak odtworzyć całość bez ArgoCD.
## ⚠️ Wymóg węzłów: klient NFS
Wszystkie warstwy montują udziały z NAS-a, więc **każdy węzeł, na którym może
wylądować pod, musi mieć klienta NFS**. Bez niego kubelet nie zamontuje wolumenu:
```
mount: ... bad option; for several filesystems (e.g. nfs, cifs) you might need
a /sbin/mount.<type> helper program
```
Ten komunikat **nie oznacza problemu z udziałem ani z uprawnieniami** — serwer
w ogóle nie został zapytany. Jądro nie znalazło programu pomocniczego
`/sbin/mount.nfs`.
### Sprawdzenie
```bash
for N in 192.168.1.73 192.168.1.80 192.168.1.81; do
printf "%-15s " "$N"
ssh hammer@$N 'test -x /sbin/mount.nfs && echo MA-KLIENTA || echo BRAK-KLIENTA'
done
```
### Instalacja
```bash
ssh hammer@<węzeł> 'sudo apt-get update && sudo apt-get install -y nfs-common'
```
> **Na WSZYSTKICH węzłach, nie tylko na tym, gdzie pod stoi teraz.** Braku na
> pozostałych nie widać, dopóki scheduler tam czegoś nie przeniesie — a wtedy
> awaria wygląda na nagłą, choć przyczyna leżała od dawna. Dokładnie tak wyszło
> za pierwszym razem: pody działały miesiącami na jednym węźle, aż zejście do
> zera replik przy innej naprawie przeplanowało je gdzie indziej.
### Skąd wiadomo, że to TO
| komunikat | co znaczy |
|---|---|
| `bad option ... mount.<type> helper program` | **brak `nfs-common` na węźle** — serwer niepytany |
| `access denied by server while mounting` | serwer odmawia: eksport nieprzeładowany, węzła nie ma na liście `hosts`, albo udział wyłączony |
| `Permission denied` przy zapisie | montowanie działa, brakuje praw — patrz `mapall_user` i właściciel katalogu |
Postgres trzyma LUSTRO plików Excela, nie źródło prawdy — jego utrata nie jest
utratą danych, więc kopie zapasowe są opcjonalne.
## ⚠️ Sekret `astrololo-auth` — utwórz PRZED wdrożeniem
+1 -10
View File
@@ -57,18 +57,9 @@ spec:
volumeMounts:
- name: cache
mountPath: /app/.cache
# ZAPISYWALNY od DAN-27. Wcześniej read-only, bo warstwa danych tylko
# czytała bazy — teraz ekran „Pliki" pozwala je wgrywać, archiwizować
# i (dla administratora) kasować, a stan użycia jest KLIKANY, więc musi
# przetrwać restart poda.
#
# ŚWIADOMY KOSZT: znika jedna warstwa obrony w głąb. Przejęcie warstwy
# danych pozwala teraz nie tylko odczytać bazy, ale i je zmienić.
# Zostaje reszta: token międzywarstwowy, szyfrowane łącze, ograniczenie
# eksportu NFS do konkretnych hostów (DAN-25) i to, że kasować może
# wyłącznie konto administracyjne (PRE-27).
- name: excel
mountPath: /app/data_files
readOnly: true
resources:
requests: { cpu: "100m", memory: "256Mi" }
limits: { cpu: "500m", memory: "512Mi" }
+4 -4
View File
@@ -11,10 +11,10 @@ resources:
- ingress.yaml # wejście po https + przekierowanie z http
images:
- name: gitea.czernobog.pl/gitea/astrololo-data
newTag: 71bb3b9c
newTag: baf4e0e3
- name: gitea.czernobog.pl/gitea/astrololo-logic
newTag: 71bb3b9c
newTag: baf4e0e3
- name: gitea.czernobog.pl/gitea/astrololo-render
newTag: latest
newTag: aec3f843
- name: gitea.czernobog.pl/gitea/astrololo-presentation
newTag: 71bb3b9c
newTag: baf4e0e3
+5 -15
View File
@@ -66,20 +66,12 @@ spec:
- name: ACCOUNTS_FILE
value: "/app/state/accounts.json"
volumeMounts:
# OSOBNY UDZIAŁ, nie podkatalog udziału z bazami. Pierwsza wersja
# montowała /mnt/Tank1/astrololo z subPath — i nie wstała:
# „failed to create subPath directory”. Powód był podwójny i oba razy
# ten sam brak: udział z bazami jest wyeksportowany `ro: true`
# z `root_squash` (DAN-25), więc (1) kubelet nie mógł utworzyć
# podkatalogu, a (2) gdyby nawet mógł, aplikacja i tak nie zapisałaby
# tam pliku kont.
#
# Osobny udział rozwiązuje to bez naruszania DAN-25: udział z bazami
# ZOSTAJE tylko do odczytu, a konta mają własne, małe miejsce.
# Przy okazji znika subPath, czyli znika potrzeba, żeby kubelet
# cokolwiek zakładał — katalog istnieje, bo jest korzeniem udziału.
# subPath, NIE cały udział: prezentacja dostaje wyłącznie własny
# podkatalog i nie widzi baz interpretacyjnych. Zamontowanie tu całego
# /mnt/Tank1/astrololo obeszłoby bokiem zamknięcie dostępu z DAN-25.
- name: state
mountPath: /app/state
subPath: presentation-state
resources:
requests: { cpu: "100m", memory: "128Mi" }
limits: { cpu: "300m", memory: "256Mi" }
@@ -87,9 +79,7 @@ spec:
- name: state
nfs:
server: 192.168.1.34
# Udział WYŁĄCZNIE na stan prezentacji (konta z PRE-27). Wymaga
# utworzenia na TrueNAS — patrz README-stan-prezentacji.md.
path: /mnt/Tank1/astrololo-state
path: /mnt/Tank1/astrololo
---
apiVersion: v1
kind: Service
+2 -2
View File
@@ -8,9 +8,9 @@ resources:
- deploy-bot-backup.yaml
images:
- name: gitea.czernobog.pl/gitea/conjurer-librarian
newTag: d0c7ab61
newTag: ae1bd677
- name: gitea.czernobog.pl/gitea/conjurer-bot
newTag: d0c7ab61
newTag: fbd1ec9f
# Production bot channel - only bumped when a [deploy]-tagged build appears.
# Bootstrapped to fbd1ec9f: that's the image the first [deploy] build (merge
# of conjurer#20) promoted to conjurer-bot-deploy. From here the image-updater