Compare commits
15 Commits
| Author | SHA1 | Date | |
|---|---|---|---|
| a802b90617 | |||
| aeb9bb5940 | |||
| f968eb0340 | |||
| f754831f54 | |||
| ff0a1c8256 | |||
| ffeb639d62 | |||
| 3ea509b13a | |||
| 70f4d298ff | |||
| 7dd32b1fd4 | |||
| 1f9ea03ca6 | |||
| 466d3cb8e7 | |||
| bd0948f7a5 | |||
| ba6e3bc9ee | |||
| 02ab25e39e | |||
| 94f059d090 |
@@ -0,0 +1,133 @@
|
|||||||
|
# Zarządzanie plikami baz — otwarcie udziału na zapis (DAN-27)
|
||||||
|
|
||||||
|
Ekran „Pliki" pozwala wgrywać bazy, archiwizować je i (dla administratora)
|
||||||
|
kasować, a stan użycia jest **klikany**, więc musi być trwały. Wymaga to zapisu
|
||||||
|
do udziału z bazami — a ten jest dziś wyeksportowany tylko do odczytu.
|
||||||
|
|
||||||
|
---
|
||||||
|
|
||||||
|
## Co świadomie tracimy
|
||||||
|
|
||||||
|
DAN-25 dawał gwarancję, że **baz nie da się zmienić przez NFS**. DAN-27 tę
|
||||||
|
gwarancję z definicji znosi — nie da się mieć obu naraz.
|
||||||
|
|
||||||
|
**Co zostaje:**
|
||||||
|
|
||||||
|
| zabezpieczenie | działa nadal |
|
||||||
|
|---|---|
|
||||||
|
| eksport zawężony do trzech węzłów k8s | ✅ |
|
||||||
|
| token międzywarstwowy | ✅ |
|
||||||
|
| szyfrowane łącze prezentacja ↔ logika ↔ dane | ✅ |
|
||||||
|
| kasowanie plików wyłącznie z konta administracyjnego (PRE-27) | ✅ |
|
||||||
|
| dziennik audytowy (kto, kiedy, co) | ✅ |
|
||||||
|
|
||||||
|
Ryzyko, które przybywa: **przejęcie warstwy danych pozwala teraz nie tylko
|
||||||
|
odczytać bazy, ale i je zmienić.**
|
||||||
|
|
||||||
|
---
|
||||||
|
|
||||||
|
## Krok 1 — otwórz udział na zapis
|
||||||
|
|
||||||
|
```bash
|
||||||
|
midclt call sharing.nfs.query '[["path","=","/mnt/Tank1/astrololo"]]' \
|
||||||
|
| python3 -c "import sys,json;[print(s['id'], '| ro:', s['ro'], '| mapall:', s.get('mapall_user')) for s in json.load(sys.stdin)]"
|
||||||
|
```
|
||||||
|
|
||||||
|
Weź `id` i podstaw za `<ID>`:
|
||||||
|
|
||||||
|
```bash
|
||||||
|
midclt call sharing.nfs.update <ID> '{"ro": false, "mapall_user": "root", "mapall_group": "root"}'
|
||||||
|
```
|
||||||
|
|
||||||
|
> **Dlaczego `mapall_user`, skoro katalog ma `drwxrwxrwx`?** Samo `ro: false`
|
||||||
|
> wystarczyłoby do zapisu — zmapowany `nobody` mieści się w prawach „innych".
|
||||||
|
> Ale nowe pliki należałyby wtedy do `nobody`, a istniejące bazy do `root`.
|
||||||
|
> Mieszana własność zemści się przy pierwszym zaostrzeniu praw. `mapall_user:
|
||||||
|
> root` daje spójność i jest tym samym ustawieniem, co na udziale `astrololo-state`.
|
||||||
|
|
||||||
|
```bash
|
||||||
|
midclt call service.restart nfs
|
||||||
|
```
|
||||||
|
|
||||||
|
Sprawdź, że zmiana **faktycznie trafiła do jądra** — sama konfiguracja to za mało:
|
||||||
|
|
||||||
|
```bash
|
||||||
|
sudo exportfs -v | grep -A1 "Tank1/astrololo "
|
||||||
|
```
|
||||||
|
|
||||||
|
Przy `/mnt/Tank1/astrololo` musi być `rw`, nie `ro`.
|
||||||
|
|
||||||
|
---
|
||||||
|
|
||||||
|
## Krok 2 — zmerguj oba PR-y
|
||||||
|
|
||||||
|
* aplikacja: `feat/zarzadzanie-plikami`
|
||||||
|
* deploy: `feat/pliki-zapis` (zdejmuje `readOnly` z montowania w podzie)
|
||||||
|
|
||||||
|
Bez tego drugiego pod nadal montuje udział tylko do odczytu, choćby serwer
|
||||||
|
pozwalał pisać.
|
||||||
|
|
||||||
|
---
|
||||||
|
|
||||||
|
## Krok 3 — przeładuj warstwę danych PRZEZ ZERO REPLIK
|
||||||
|
|
||||||
|
> ⚠️ **`rollout restart` NIE WYSTARCZY.** Stary i nowy pod na chwilę
|
||||||
|
> współistnieją, więc montowanie NFS ani na moment nie zostaje bez użytkownika
|
||||||
|
> i nowy pod dziedziczy uprawnienia sprzed zmiany eksportu. To kosztowało
|
||||||
|
> najwięcej czasu przy udziale `astrololo-state` — patrz
|
||||||
|
> [README-stan-prezentacji.md](README-stan-prezentacji.md).
|
||||||
|
|
||||||
|
```bash
|
||||||
|
kubectl -n astrololo scale deploy/data --replicas=0
|
||||||
|
kubectl -n astrololo wait --for=delete pod -l app=data --timeout=90s
|
||||||
|
kubectl -n astrololo scale deploy/data --replicas=1
|
||||||
|
kubectl -n astrololo rollout status deploy/data
|
||||||
|
```
|
||||||
|
|
||||||
|
---
|
||||||
|
|
||||||
|
## Krok 4 — sprawdź, w tej kolejności
|
||||||
|
|
||||||
|
**Czy warstwa danych może pisać:**
|
||||||
|
|
||||||
|
```bash
|
||||||
|
kubectl -n astrololo exec deploy/data -- sh -c 'touch /app/data_files/proba && echo ZAPIS-OK && rm /app/data_files/proba'
|
||||||
|
```
|
||||||
|
|
||||||
|
**Czy powstał plik stanu i czy bazy zostały przyjęte jako aktywne:**
|
||||||
|
|
||||||
|
```bash
|
||||||
|
kubectl -n astrololo exec deploy/data -- sh -c 'cat /app/data_files/.files-state.json' | head -20
|
||||||
|
```
|
||||||
|
|
||||||
|
Oczekiwane: każda baza ze `"status": "active"`. Przy pierwszym uruchomieniu bazy
|
||||||
|
zastane na udziale są przyjmowane automatycznie — **bez tego wyszukiwanie
|
||||||
|
przestałoby cokolwiek znajdować**, bo plik bez wpisu w rejestrze nie bierze
|
||||||
|
udziału w wynikach.
|
||||||
|
|
||||||
|
**Czy wyszukiwanie NADAL DZIAŁA** — to jest najważniejszy sprawdzian tego
|
||||||
|
wdrożenia, bo właśnie tu zmiana mogłaby przejść niezauważona:
|
||||||
|
|
||||||
|
```bash
|
||||||
|
kubectl -n astrololo logs deploy/data --tail=20
|
||||||
|
```
|
||||||
|
|
||||||
|
a potem w przeglądarce: zakładka **Sygnifikatory**, dowolne wyszukanie. Musi
|
||||||
|
zwracać wyniki jak przedtem. Jeśli nagle nic nie znajduje — zajrzyj do
|
||||||
|
`.files-state.json` z komendy wyżej.
|
||||||
|
|
||||||
|
**Czy ekran „Pliki" działa:** zakładka **Pliki**, lista baz, przełącznik przy
|
||||||
|
każdej. Wgraj testowy plik, zarchiwizuj go, skasuj.
|
||||||
|
|
||||||
|
---
|
||||||
|
|
||||||
|
## Odkręcenie
|
||||||
|
|
||||||
|
```bash
|
||||||
|
midclt call sharing.nfs.update <ID> '{"ro": true, "mapall_user": null, "mapall_group": null}'
|
||||||
|
midclt call service.restart nfs
|
||||||
|
```
|
||||||
|
|
||||||
|
plus cofnięcie deploy `feat/pliki-zapis`. Ekran „Pliki" zostanie, ale wgrywanie
|
||||||
|
i kasowanie przestaną działać — a stan użycia przestanie się zapisywać, więc bazy
|
||||||
|
będą przyjmowane od nowa przy każdym starcie (czyli wszystkie aktywne).
|
||||||
+59
-14
@@ -23,24 +23,54 @@ Ten plik **celowo nie jest w `kustomization.yaml`**: resource stoi w ns `argocd`
|
|||||||
(poza namespace docelowym aplikacji), a to konfiguracja kontrolera, który wdraża tę
|
(poza namespace docelowym aplikacji), a to konfiguracja kontrolera, który wdraża tę
|
||||||
aplikację — nakładamy go ręcznie, w repo trzymamy dla odtwarzalności i historii.
|
aplikację — nakładamy go ręcznie, w repo trzymamy dla odtwarzalności i historii.
|
||||||
|
|
||||||
## Postgres — lustro baz w SQL (DAN-28)
|
## Pliki baz — udział otwarty na zapis (DAN-27)
|
||||||
|
|
||||||
Osobny runbook: **[README-postgres.md](README-postgres.md)** — co zrobiono w repo,
|
Runbook: **[README-pliki.md](README-pliki.md)**. Ekran „Pliki" wymaga zapisu do
|
||||||
co musisz zrobić ręcznie (sekret `astrololo-postgres`), jak sprawdzić rozszerzenia
|
udziału z bazami, więc znosi gwarancję z DAN-25, że baz nie da się zmienić przez
|
||||||
`pg_trgm`/`unaccent` i jak odtworzyć całość bez ArgoCD.
|
NFS. Co zostaje z zabezpieczeń i jak to wdrożyć — w runbooku.
|
||||||
|
|
||||||
Postgres trzyma LUSTRO plików Excela, nie źródło prawdy — jego utrata nie jest
|
## ⚠️ Wymóg węzłów: klient NFS
|
||||||
utratą danych, więc kopie zapasowe są opcjonalne.
|
|
||||||
|
|
||||||
## ⚠️ Udział `astrololo-state` — wymagany przez konta (PRE-27)
|
Wszystkie warstwy montują udziały z NAS-a, więc **każdy węzeł, na którym może
|
||||||
|
wylądować pod, musi mieć klienta NFS**. Bez niego kubelet nie zamontuje wolumenu:
|
||||||
|
|
||||||
Pod `presentation` **nie wstanie bez niego** (`CreateContainerConfigError:
|
```
|
||||||
failed to create subPath directory`). Osobny runbook:
|
mount: ... bad option; for several filesystems (e.g. nfs, cifs) you might need
|
||||||
**[README-stan-prezentacji.md](README-stan-prezentacji.md)**.
|
a /sbin/mount.<type> helper program
|
||||||
|
```
|
||||||
|
|
||||||
Krótko: udział z bazami jest wyeksportowany `ro` (DAN-25), więc konta nie mogą tam
|
Ten komunikat **nie oznacza problemu z udziałem ani z uprawnieniami** — serwer
|
||||||
mieszkać — dostają własny, mały udział `/mnt/Tank1/astrololo-state`, zapisywalny,
|
w ogóle nie został zapytany. Jądro nie znalazło programu pomocniczego
|
||||||
zawężony do tych samych węzłów.
|
`/sbin/mount.nfs`.
|
||||||
|
|
||||||
|
### Sprawdzenie
|
||||||
|
|
||||||
|
```bash
|
||||||
|
for N in 192.168.1.73 192.168.1.80 192.168.1.81; do
|
||||||
|
printf "%-15s " "$N"
|
||||||
|
ssh hammer@$N 'test -x /sbin/mount.nfs && echo MA-KLIENTA || echo BRAK-KLIENTA'
|
||||||
|
done
|
||||||
|
```
|
||||||
|
|
||||||
|
### Instalacja
|
||||||
|
|
||||||
|
```bash
|
||||||
|
ssh hammer@<węzeł> 'sudo apt-get update && sudo apt-get install -y nfs-common'
|
||||||
|
```
|
||||||
|
|
||||||
|
> **Na WSZYSTKICH węzłach, nie tylko na tym, gdzie pod stoi teraz.** Braku na
|
||||||
|
> pozostałych nie widać, dopóki scheduler tam czegoś nie przeniesie — a wtedy
|
||||||
|
> awaria wygląda na nagłą, choć przyczyna leżała od dawna. Dokładnie tak wyszło
|
||||||
|
> za pierwszym razem: pody działały miesiącami na jednym węźle, aż zejście do
|
||||||
|
> zera replik przy innej naprawie przeplanowało je gdzie indziej.
|
||||||
|
|
||||||
|
### Skąd wiadomo, że to TO
|
||||||
|
|
||||||
|
| komunikat | co znaczy |
|
||||||
|
|---|---|
|
||||||
|
| `bad option ... mount.<type> helper program` | **brak `nfs-common` na węźle** — serwer niepytany |
|
||||||
|
| `access denied by server while mounting` | serwer odmawia: eksport nieprzeładowany, węzła nie ma na liście `hosts`, albo udział wyłączony |
|
||||||
|
| `Permission denied` przy zapisie | montowanie działa, brakuje praw — patrz `mapall_user` i właściciel katalogu |
|
||||||
|
|
||||||
## ⚠️ Sekret `astrololo-auth` — utwórz PRZED wdrożeniem
|
## ⚠️ Sekret `astrololo-auth` — utwórz PRZED wdrożeniem
|
||||||
|
|
||||||
@@ -60,11 +90,26 @@ read -rs -p "Hasło do aplikacji (APP_PASSWORD): " APP_PASSWORD; echo
|
|||||||
|
|
||||||
kubectl -n astrololo create secret generic astrololo-auth \
|
kubectl -n astrololo create secret generic astrololo-auth \
|
||||||
--from-literal=APP_PASSWORD="$APP_PASSWORD" \
|
--from-literal=APP_PASSWORD="$APP_PASSWORD" \
|
||||||
--from-literal=INTERNAL_TOKEN="$(openssl rand -hex 32)"
|
--from-literal=INTERNAL_TOKEN="$(openssl rand -hex 32)" \
|
||||||
|
--from-literal=SESSION_SECRET="$(openssl rand -hex 32)"
|
||||||
|
|
||||||
unset APP_PASSWORD
|
unset APP_PASSWORD
|
||||||
```
|
```
|
||||||
|
|
||||||
|
`SESSION_SECRET` podpisuje ciasteczka sesji (LOG-34). **Pod bez niego celowo nie
|
||||||
|
wstanie**: usługa z kontami, ale bez klucza, nie odróżniłaby ważnej sesji od
|
||||||
|
podrobionej. Nikt go nigdy nie musi oglądać.
|
||||||
|
|
||||||
|
> **Rotacja tego klucza wylogowuje WSZYSTKICH.** To nie usterka, tylko awaryjny
|
||||||
|
> wyłącznik: gdy podejrzewasz, że ktoś przechwycił cudzą sesję, podmiana klucza
|
||||||
|
> unieważnia je wszystkie naraz.
|
||||||
|
>
|
||||||
|
> ```bash
|
||||||
|
> kubectl -n astrololo patch secret astrololo-auth --type=json \
|
||||||
|
> -p="[{\"op\":\"replace\",\"path\":\"/data/SESSION_SECRET\",\"value\":\"$(openssl rand -hex 32 | base64 | tr -d '\n')\"}]"
|
||||||
|
> kubectl -n astrololo rollout restart deploy/presentation
|
||||||
|
> ```
|
||||||
|
|
||||||
`INTERNAL_TOKEN` jest losowany i **nikt go nigdy nie musi oglądać** — służy tylko
|
`INTERNAL_TOKEN` jest losowany i **nikt go nigdy nie musi oglądać** — służy tylko
|
||||||
usługom do rozmowy między sobą. `APP_PASSWORD` wpisujesz w przeglądarce
|
usługom do rozmowy między sobą. `APP_PASSWORD` wpisujesz w przeglądarce
|
||||||
(użytkownik: `astrololo`, zmienny przez `APP_USER` w `presentation.yaml`).
|
(użytkownik: `astrololo`, zmienny przez `APP_USER` w `presentation.yaml`).
|
||||||
|
|||||||
@@ -11,10 +11,10 @@ resources:
|
|||||||
- ingress.yaml # wejście po https + przekierowanie z http
|
- ingress.yaml # wejście po https + przekierowanie z http
|
||||||
images:
|
images:
|
||||||
- name: gitea.czernobog.pl/gitea/astrololo-data
|
- name: gitea.czernobog.pl/gitea/astrololo-data
|
||||||
newTag: baf4e0e3
|
newTag: f0d07ee8
|
||||||
- name: gitea.czernobog.pl/gitea/astrololo-logic
|
- name: gitea.czernobog.pl/gitea/astrololo-logic
|
||||||
newTag: baf4e0e3
|
newTag: f0d07ee8
|
||||||
- name: gitea.czernobog.pl/gitea/astrololo-render
|
- name: gitea.czernobog.pl/gitea/astrololo-render
|
||||||
newTag: latest
|
newTag: latest
|
||||||
- name: gitea.czernobog.pl/gitea/astrololo-presentation
|
- name: gitea.czernobog.pl/gitea/astrololo-presentation
|
||||||
newTag: a8339659
|
newTag: f0d07ee8
|
||||||
|
|||||||
@@ -32,6 +32,13 @@ spec:
|
|||||||
secretKeyRef: { name: astrololo-auth, key: INTERNAL_TOKEN }
|
secretKeyRef: { name: astrololo-auth, key: INTERNAL_TOKEN }
|
||||||
- name: APP_USER
|
- name: APP_USER
|
||||||
value: "astrololo"
|
value: "astrololo"
|
||||||
|
# Klucz podpisu ciasteczek sesji (LOG-34). WYMAGANY — pod bez niego
|
||||||
|
# celowo nie wstaje: usługa z kontami, ale bez klucza, nie umiałaby
|
||||||
|
# odróżnić ważnej sesji od podrobionej. Rotacja tego klucza WYLOGOWUJE
|
||||||
|
# WSZYSTKICH, i tak ma być — to jest awaryjny wyłącznik.
|
||||||
|
- name: SESSION_SECRET
|
||||||
|
valueFrom:
|
||||||
|
secretKeyRef: { name: astrololo-auth, key: SESSION_SECRET }
|
||||||
- name: RATE_LIMIT_PER_MIN
|
- name: RATE_LIMIT_PER_MIN
|
||||||
value: "120" # 0 = bez limitu
|
value: "120" # 0 = bez limitu
|
||||||
# Aplikacja stoi za Ingressem, więc bezpośrednim rozmówcą jest zawsze
|
# Aplikacja stoi za Ingressem, więc bezpośrednim rozmówcą jest zawsze
|
||||||
|
|||||||
@@ -31,6 +31,19 @@ spec:
|
|||||||
# Where the librarian sends THIS bot's results/pongs back to (its own
|
# Where the librarian sends THIS bot's results/pongs back to (its own
|
||||||
# NodePort). Lets one librarian serve both bots - see deploy-bot.yaml.
|
# NodePort). Lets one librarian serve both bots - see deploy-bot.yaml.
|
||||||
- { name: CONJURER_SELF_CALLBACK, value: "http://192.168.1.73:32442" }
|
- { name: CONJURER_SELF_CALLBACK, value: "http://192.168.1.73:32442" }
|
||||||
|
# Self-hosted models (Ollama). No API key - the endpoint IS the
|
||||||
|
# configuration, and the backend stays unselectable while unset.
|
||||||
|
# Pick a model at runtime with: $gadaj_teraz ollama <model>
|
||||||
|
# ($modele_ai lists what the server actually has pulled).
|
||||||
|
- { name: CONJURER_OLLAMA_URL, value: "http://192.168.1.72:11434" }
|
||||||
|
# The server currently has exactly one model pulled (verified via
|
||||||
|
# /v1/models): gemma4:e2b. Without this the built-in default
|
||||||
|
# (llama3.1:8b) would be requested and every reply would fail.
|
||||||
|
- { name: CONJURER_OLLAMA_MODEL, value: "gemma4:e2b" }
|
||||||
|
# Self-hosted generation is far slower than a hosted API, especially
|
||||||
|
# the first request after the model is evicted from VRAM. Applies to
|
||||||
|
# every backend, so keep it only as high as you actually need.
|
||||||
|
- { name: CONJURER_AI_TIMEOUT_SECONDS, value: "240" }
|
||||||
volumeMounts:
|
volumeMounts:
|
||||||
- { name: data, mountPath: /data }
|
- { name: data, mountPath: /data }
|
||||||
- { name: netrc, mountPath: /secrets, readOnly: true }
|
- { name: netrc, mountPath: /secrets, readOnly: true }
|
||||||
|
|||||||
@@ -51,6 +51,19 @@ spec:
|
|||||||
# query and answers results/pongs HERE - so it serves this bot AND the
|
# query and answers results/pongs HERE - so it serves this bot AND the
|
||||||
# test bot from one instance, no CONJURER_MAIN_BOT repointing needed.
|
# test bot from one instance, no CONJURER_MAIN_BOT repointing needed.
|
||||||
- { name: CONJURER_SELF_CALLBACK, value: "http://192.168.1.73:32443" }
|
- { name: CONJURER_SELF_CALLBACK, value: "http://192.168.1.73:32443" }
|
||||||
|
# Self-hosted models (Ollama). No API key - the endpoint IS the
|
||||||
|
# configuration, and the backend stays unselectable while unset.
|
||||||
|
# Pick a model at runtime with: $gadaj_teraz ollama <model>
|
||||||
|
# ($modele_ai lists what the server actually has pulled).
|
||||||
|
- { name: CONJURER_OLLAMA_URL, value: "http://192.168.1.72:11434" }
|
||||||
|
# The server currently has exactly one model pulled (verified via
|
||||||
|
# /v1/models): gemma4:e2b. Without this the built-in default
|
||||||
|
# (llama3.1:8b) would be requested and every reply would fail.
|
||||||
|
- { name: CONJURER_OLLAMA_MODEL, value: "gemma4:e2b" }
|
||||||
|
# Self-hosted generation is far slower than a hosted API, especially
|
||||||
|
# the first request after the model is evicted from VRAM. Applies to
|
||||||
|
# every backend, so keep it only as high as you actually need.
|
||||||
|
- { name: CONJURER_AI_TIMEOUT_SECONDS, value: "240" }
|
||||||
volumeMounts:
|
volumeMounts:
|
||||||
- { name: data, mountPath: /data }
|
- { name: data, mountPath: /data }
|
||||||
- { name: netrc, mountPath: /secrets, readOnly: true }
|
- { name: netrc, mountPath: /secrets, readOnly: true }
|
||||||
|
|||||||
@@ -8,9 +8,9 @@ resources:
|
|||||||
- deploy-bot-backup.yaml
|
- deploy-bot-backup.yaml
|
||||||
images:
|
images:
|
||||||
- name: gitea.czernobog.pl/gitea/conjurer-librarian
|
- name: gitea.czernobog.pl/gitea/conjurer-librarian
|
||||||
newTag: ae1bd677
|
newTag: d0c7ab61
|
||||||
- name: gitea.czernobog.pl/gitea/conjurer-bot
|
- name: gitea.czernobog.pl/gitea/conjurer-bot
|
||||||
newTag: fbd1ec9f
|
newTag: d0c7ab61
|
||||||
# Production bot channel - only bumped when a [deploy]-tagged build appears.
|
# Production bot channel - only bumped when a [deploy]-tagged build appears.
|
||||||
# Bootstrapped to fbd1ec9f: that's the image the first [deploy] build (merge
|
# Bootstrapped to fbd1ec9f: that's the image the first [deploy] build (merge
|
||||||
# of conjurer#20) promoted to conjurer-bot-deploy. From here the image-updater
|
# of conjurer#20) promoted to conjurer-bot-deploy. From here the image-updater
|
||||||
|
|||||||
Reference in New Issue
Block a user