Compare commits

...

11 Commits

Author SHA1 Message Date
gitea ff0a1c8256 docs(węzły): klient NFS jako jawny wymóg wdrożenia
Pody przestały wstawać z komunikatem „bad option ... you might need
a /sbin/mount.<type> helper program". To NIE jest problem z udziałem ani
z uprawnieniami — serwer w ogóle nie został zapytany; jądro nie znalazło programu
pomocniczego, bo na węźle brakowało nfs-common.

Wymogu klienta NFS nie było w żadnym runbooku, choć wszystkie trzy warstwy
montują udziały z NAS-a. Luka była uśpiona: wszystko stało na jednym węźle, który
klienta miał, więc braku na pozostałych nie było jak zauważyć. Ujawniło się
dopiero, gdy zejście do zera replik — przy zupełnie innej naprawie —
przeplanowało pody gdzie indziej.

Dopisana tabela odróżniająca trzy komunikaty, które łatwo pomylić, bo wszystkie
kończą się niewstającym podem: brak klienta na węźle, odmowa serwera i brak praw
do zapisu. Każdy ma inną przyczynę i inne miejsce naprawy.

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
2026-08-21 12:40:24 +02:00
argocd-image-updater ffeb639d62 build: automatic update of astrololo
updates image gitea/astrololo-data tag 'ee3c515d' to '71bb3b9c'
updates image gitea/astrololo-logic tag 'ee3c515d' to '71bb3b9c'
updates image gitea/astrololo-presentation tag 'ee3c515d' to '71bb3b9c'
2026-08-20 23:56:37 +00:00
argocd-image-updater 3ea509b13a build: automatic update of conjurer
updates image gitea/conjurer-librarian tag 'c2e6b8e6' to 'd0c7ab61'
updates image gitea/conjurer-bot tag 'c2e6b8e6' to 'd0c7ab61'
2026-08-12 15:46:05 +00:00
argocd-image-updater 70f4d298ff build: automatic update of conjurer
updates image gitea/conjurer-librarian tag 'ae1bd677' to 'c2e6b8e6'
updates image gitea/conjurer-bot tag 'fbd1ec9f' to 'c2e6b8e6'
2026-08-12 15:16:03 +00:00
argocd-image-updater 7dd32b1fd4 build: automatic update of conjurer
updates image gitea/conjurer-librarian tag 'ae1bd677' to 'c2e6b8e6'
2026-08-12 15:14:02 +00:00
argocd-image-updater 1f9ea03ca6 build: automatic update of astrololo
updates image gitea/astrololo-data tag 'ac8a0e9f' to 'ee3c515d'
updates image gitea/astrololo-logic tag 'e2b50b28' to 'ee3c515d'
updates image gitea/astrololo-presentation tag 'e2b50b28' to 'ee3c515d'
2026-08-11 14:38:44 +00:00
argocd-image-updater 466d3cb8e7 build: automatic update of astrololo
updates image gitea/astrololo-data tag 'b838cf47' to 'ac8a0e9f'
2026-08-11 13:40:38 +00:00
argocd-image-updater bd0948f7a5 build: automatic update of astrololo
updates image gitea/astrololo-data tag '003deb94' to 'b838cf47'
updates image gitea/astrololo-logic tag '003deb94' to 'e2b50b28'
updates image gitea/astrololo-presentation tag '003deb94' to 'e2b50b28'
2026-08-11 09:18:11 +00:00
argocd-image-updater ba6e3bc9ee build: automatic update of astrololo
updates image gitea/astrololo-data tag 'baf4e0e3' to '003deb94'
updates image gitea/astrololo-logic tag 'baf4e0e3' to '003deb94'
updates image gitea/astrololo-presentation tag 'a8339659' to '003deb94'
2026-08-09 15:54:27 +00:00
argocd-image-updater 02ab25e39e build: automatic update of astrololo
updates image gitea/astrololo-data tag 'baf4e0e3' to '003deb94'
updates image gitea/astrololo-logic tag 'baf4e0e3' to '003deb94'
2026-08-09 15:51:02 +00:00
gitea 94f059d090 docs(pliki): runbook otwarcia udziału z bazami na zapis (zgubiony przy merge'u)
Treść powstała jako commit na gałęzi feat/pliki-zapis JUŻ PO zmergowaniu jej
PR-a, więc nigdy nie trafiła na master — został tam wyłącznie manifest.
Sam manifest jest w porządku (readOnly zdjęte), brakowało tylko opisu, co z tym
zrobić po stronie NAS-a.

Runbook zawiera: komendy midclt otwierające udział z bazami na zapis, sprawdzenie
przez exportfs (bo konfiguracja udziału i stan eksportu to dwie różne rzeczy),
ostrzeżenie, że przeładowanie musi iść przez zero replik zamiast rollout restart,
oraz listę kontrolną po wdrożeniu — z wyszukiwaniem jako punktem NAJWAŻNIEJSZYM,
bo to jedyne miejsce, w którym ta zmiana mogłaby przejść niezauważona.

Osobno wyliczone, co świadomie tracimy: DAN-25 dawał gwarancję, że baz nie da się
zmienić przez NFS, i tych dwóch rzeczy nie da się mieć naraz.

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
2026-08-09 12:22:49 +02:00
4 changed files with 181 additions and 18 deletions
+133
View File
@@ -0,0 +1,133 @@
# Zarządzanie plikami baz — otwarcie udziału na zapis (DAN-27)
Ekran „Pliki" pozwala wgrywać bazy, archiwizować je i (dla administratora)
kasować, a stan użycia jest **klikany**, więc musi być trwały. Wymaga to zapisu
do udziału z bazami — a ten jest dziś wyeksportowany tylko do odczytu.
---
## Co świadomie tracimy
DAN-25 dawał gwarancję, że **baz nie da się zmienić przez NFS**. DAN-27 tę
gwarancję z definicji znosi — nie da się mieć obu naraz.
**Co zostaje:**
| zabezpieczenie | działa nadal |
|---|---|
| eksport zawężony do trzech węzłów k8s | ✅ |
| token międzywarstwowy | ✅ |
| szyfrowane łącze prezentacja ↔ logika ↔ dane | ✅ |
| kasowanie plików wyłącznie z konta administracyjnego (PRE-27) | ✅ |
| dziennik audytowy (kto, kiedy, co) | ✅ |
Ryzyko, które przybywa: **przejęcie warstwy danych pozwala teraz nie tylko
odczytać bazy, ale i je zmienić.**
---
## Krok 1 — otwórz udział na zapis
```bash
midclt call sharing.nfs.query '[["path","=","/mnt/Tank1/astrololo"]]' \
| python3 -c "import sys,json;[print(s['id'], '| ro:', s['ro'], '| mapall:', s.get('mapall_user')) for s in json.load(sys.stdin)]"
```
Weź `id` i podstaw za `<ID>`:
```bash
midclt call sharing.nfs.update <ID> '{"ro": false, "mapall_user": "root", "mapall_group": "root"}'
```
> **Dlaczego `mapall_user`, skoro katalog ma `drwxrwxrwx`?** Samo `ro: false`
> wystarczyłoby do zapisu — zmapowany `nobody` mieści się w prawach „innych".
> Ale nowe pliki należałyby wtedy do `nobody`, a istniejące bazy do `root`.
> Mieszana własność zemści się przy pierwszym zaostrzeniu praw. `mapall_user:
> root` daje spójność i jest tym samym ustawieniem, co na udziale `astrololo-state`.
```bash
midclt call service.restart nfs
```
Sprawdź, że zmiana **faktycznie trafiła do jądra** — sama konfiguracja to za mało:
```bash
sudo exportfs -v | grep -A1 "Tank1/astrololo "
```
Przy `/mnt/Tank1/astrololo` musi być `rw`, nie `ro`.
---
## Krok 2 — zmerguj oba PR-y
* aplikacja: `feat/zarzadzanie-plikami`
* deploy: `feat/pliki-zapis` (zdejmuje `readOnly` z montowania w podzie)
Bez tego drugiego pod nadal montuje udział tylko do odczytu, choćby serwer
pozwalał pisać.
---
## Krok 3 — przeładuj warstwę danych PRZEZ ZERO REPLIK
> ⚠️ **`rollout restart` NIE WYSTARCZY.** Stary i nowy pod na chwilę
> współistnieją, więc montowanie NFS ani na moment nie zostaje bez użytkownika
> i nowy pod dziedziczy uprawnienia sprzed zmiany eksportu. To kosztowało
> najwięcej czasu przy udziale `astrololo-state` — patrz
> [README-stan-prezentacji.md](README-stan-prezentacji.md).
```bash
kubectl -n astrololo scale deploy/data --replicas=0
kubectl -n astrololo wait --for=delete pod -l app=data --timeout=90s
kubectl -n astrololo scale deploy/data --replicas=1
kubectl -n astrololo rollout status deploy/data
```
---
## Krok 4 — sprawdź, w tej kolejności
**Czy warstwa danych może pisać:**
```bash
kubectl -n astrololo exec deploy/data -- sh -c 'touch /app/data_files/proba && echo ZAPIS-OK && rm /app/data_files/proba'
```
**Czy powstał plik stanu i czy bazy zostały przyjęte jako aktywne:**
```bash
kubectl -n astrololo exec deploy/data -- sh -c 'cat /app/data_files/.files-state.json' | head -20
```
Oczekiwane: każda baza ze `"status": "active"`. Przy pierwszym uruchomieniu bazy
zastane na udziale są przyjmowane automatycznie — **bez tego wyszukiwanie
przestałoby cokolwiek znajdować**, bo plik bez wpisu w rejestrze nie bierze
udziału w wynikach.
**Czy wyszukiwanie NADAL DZIAŁA** — to jest najważniejszy sprawdzian tego
wdrożenia, bo właśnie tu zmiana mogłaby przejść niezauważona:
```bash
kubectl -n astrololo logs deploy/data --tail=20
```
a potem w przeglądarce: zakładka **Sygnifikatory**, dowolne wyszukanie. Musi
zwracać wyniki jak przedtem. Jeśli nagle nic nie znajduje — zajrzyj do
`.files-state.json` z komendy wyżej.
**Czy ekran „Pliki" działa:** zakładka **Pliki**, lista baz, przełącznik przy
każdej. Wgraj testowy plik, zarchiwizuj go, skasuj.
---
## Odkręcenie
```bash
midclt call sharing.nfs.update <ID> '{"ro": true, "mapall_user": null, "mapall_group": null}'
midclt call service.restart nfs
```
plus cofnięcie deploy `feat/pliki-zapis`. Ekran „Pliki" zostanie, ale wgrywanie
i kasowanie przestaną działać — a stan użycia przestanie się zapisywać, więc bazy
będą przyjmowane od nowa przy każdym starcie (czyli wszystkie aktywne).
+43 -13
View File
@@ -23,24 +23,54 @@ Ten plik **celowo nie jest w `kustomization.yaml`**: resource stoi w ns `argocd`
(poza namespace docelowym aplikacji), a to konfiguracja kontrolera, który wdraża tę (poza namespace docelowym aplikacji), a to konfiguracja kontrolera, który wdraża tę
aplikację — nakładamy go ręcznie, w repo trzymamy dla odtwarzalności i historii. aplikację — nakładamy go ręcznie, w repo trzymamy dla odtwarzalności i historii.
## Postgres — lustro baz w SQL (DAN-28) ## Pliki baz — udział otwarty na zapis (DAN-27)
Osobny runbook: **[README-postgres.md](README-postgres.md)** — co zrobiono w repo, Runbook: **[README-pliki.md](README-pliki.md)**. Ekran „Pliki" wymaga zapisu do
co musisz zrobić ręcznie (sekret `astrololo-postgres`), jak sprawdzić rozszerzenia udziału z bazami, więc znosi gwarancję z DAN-25, że baz nie da się zmienić przez
`pg_trgm`/`unaccent` i jak odtworzyć całość bez ArgoCD. NFS. Co zostaje z zabezpieczeń i jak to wdrożyć — w runbooku.
Postgres trzyma LUSTRO plików Excela, nie źródło prawdy — jego utrata nie jest ## ⚠️ Wymóg węzłów: klient NFS
utratą danych, więc kopie zapasowe są opcjonalne.
## ⚠️ Udział `astrololo-state` — wymagany przez konta (PRE-27) Wszystkie warstwy montują udziały z NAS-a, więc **każdy węzeł, na którym może
wylądować pod, musi mieć klienta NFS**. Bez niego kubelet nie zamontuje wolumenu:
Pod `presentation` **nie wstanie bez niego** (`CreateContainerConfigError: ```
failed to create subPath directory`). Osobny runbook: mount: ... bad option; for several filesystems (e.g. nfs, cifs) you might need
**[README-stan-prezentacji.md](README-stan-prezentacji.md)**. a /sbin/mount.<type> helper program
```
Krótko: udział z bazami jest wyeksportowany `ro` (DAN-25), więc konta nie mogą tam Ten komunikat **nie oznacza problemu z udziałem ani z uprawnieniami** — serwer
mieszkać — dostają własny, mały udział `/mnt/Tank1/astrololo-state`, zapisywalny, w ogóle nie został zapytany. Jądro nie znalazło programu pomocniczego
zawężony do tych samych węzłów. `/sbin/mount.nfs`.
### Sprawdzenie
```bash
for N in 192.168.1.73 192.168.1.80 192.168.1.81; do
printf "%-15s " "$N"
ssh hammer@$N 'test -x /sbin/mount.nfs && echo MA-KLIENTA || echo BRAK-KLIENTA'
done
```
### Instalacja
```bash
ssh hammer@<węzeł> 'sudo apt-get update && sudo apt-get install -y nfs-common'
```
> **Na WSZYSTKICH węzłach, nie tylko na tym, gdzie pod stoi teraz.** Braku na
> pozostałych nie widać, dopóki scheduler tam czegoś nie przeniesie — a wtedy
> awaria wygląda na nagłą, choć przyczyna leżała od dawna. Dokładnie tak wyszło
> za pierwszym razem: pody działały miesiącami na jednym węźle, aż zejście do
> zera replik przy innej naprawie przeplanowało je gdzie indziej.
### Skąd wiadomo, że to TO
| komunikat | co znaczy |
|---|---|
| `bad option ... mount.<type> helper program` | **brak `nfs-common` na węźle** — serwer niepytany |
| `access denied by server while mounting` | serwer odmawia: eksport nieprzeładowany, węzła nie ma na liście `hosts`, albo udział wyłączony |
| `Permission denied` przy zapisie | montowanie działa, brakuje praw — patrz `mapall_user` i właściciel katalogu |
## ⚠️ Sekret `astrololo-auth` — utwórz PRZED wdrożeniem ## ⚠️ Sekret `astrololo-auth` — utwórz PRZED wdrożeniem
+3 -3
View File
@@ -11,10 +11,10 @@ resources:
- ingress.yaml # wejście po https + przekierowanie z http - ingress.yaml # wejście po https + przekierowanie z http
images: images:
- name: gitea.czernobog.pl/gitea/astrololo-data - name: gitea.czernobog.pl/gitea/astrololo-data
newTag: baf4e0e3 newTag: 71bb3b9c
- name: gitea.czernobog.pl/gitea/astrololo-logic - name: gitea.czernobog.pl/gitea/astrololo-logic
newTag: baf4e0e3 newTag: 71bb3b9c
- name: gitea.czernobog.pl/gitea/astrololo-render - name: gitea.czernobog.pl/gitea/astrololo-render
newTag: latest newTag: latest
- name: gitea.czernobog.pl/gitea/astrololo-presentation - name: gitea.czernobog.pl/gitea/astrololo-presentation
newTag: a8339659 newTag: 71bb3b9c
+2 -2
View File
@@ -8,9 +8,9 @@ resources:
- deploy-bot-backup.yaml - deploy-bot-backup.yaml
images: images:
- name: gitea.czernobog.pl/gitea/conjurer-librarian - name: gitea.czernobog.pl/gitea/conjurer-librarian
newTag: ae1bd677 newTag: d0c7ab61
- name: gitea.czernobog.pl/gitea/conjurer-bot - name: gitea.czernobog.pl/gitea/conjurer-bot
newTag: fbd1ec9f newTag: d0c7ab61
# Production bot channel - only bumped when a [deploy]-tagged build appears. # Production bot channel - only bumped when a [deploy]-tagged build appears.
# Bootstrapped to fbd1ec9f: that's the image the first [deploy] build (merge # Bootstrapped to fbd1ec9f: that's the image the first [deploy] build (merge
# of conjurer#20) promoted to conjurer-bot-deploy. From here the image-updater # of conjurer#20) promoted to conjurer-bot-deploy. From here the image-updater