Compare commits

...

3 Commits

Author SHA1 Message Date
gitea 34947f8871 docs(nfs): po zmianie eksportu rollout restart nie wystarcza
Najdroższy czasowo moment pierwszego wdrożenia, więc zapisany wprost.

FAKT: eksport poprawiony (mapall_user), usługa NFS zrestartowana, pod
zrestartowany przez `rollout restart` — a zapis z poda nadal odbijał się
o Permission denied. Jednocześnie ręczne zamontowanie TEGO SAMEGO eksportu
z TEGO SAMEGO węzła pozwalało pisać.

HIPOTEZA (niepotwierdzona u źródła): jądro współdzieli strukturę montowania NFS
między montowania tego samego eksportu na węźle, razem z cache odpowiedzi ACCESS.
`rollout restart` zostawia stary i nowy pod na chwilę współistniejące — widać to
w jego własnym logu jako „1 old replicas are pending termination" — więc
montowanie ani na moment nie zostaje bez użytkownika i nowy pod dziedziczy
odpowiedź sprzed zmiany.

ROZWIĄZANIE (zweryfikowane): zejść do zera replik, poczekać na zniknięcie podów,
wrócić do jednej. W ArgoCD ten sam skutek daje force delete poda.

Dopisany też test rozdzielający winę serwera od winy klienta: ręczny montaż
z węzła z pominięciem Kubernetesa. SERWER-OK przy jednoczesnej odmowie w podzie
znaczy, że na NAS-ie nie ma czego poprawiać — i oszczędza rundy zmian
w konfiguracji udziału, które niczego nie dają.

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
2026-08-09 11:53:14 +02:00
gitea 4ae06364d6 docs(nfs): prawa do udziału opisane zgodnie z tym, co jest naprawdę
Runbook kazał robić `chown apps:apps` na użytkownika, którego na tym NAS-ie nie
ma, i nie tłumaczył, DLACZEGO zapis się nie udaje. A przyczyna jest myląca:
kontener działa jako root, NFS domyślnie stosuje root_squash, więc root z klienta
ląduje jako `nobody` — czyli w kategorii „inni", dla której świeży dataset
(drwxrwx--- root root) nie daje żadnych praw. `ls` w podzie pokazuje przy tym
„root root", co sugeruje, że wszystko jest w porządku.

Teraz są dwa jawne warianty: prostszy (mapall_user: root, katalog bez zmian —
squash wyłączony dla TEGO JEDNEGO udziału, w którym leży jeden plik) i czystszy
(dedykowany użytkownik + chown). Dopisane, czego nie robić: chmod 777 zadziała,
ale uczyni katalog zapisywalnym dla każdego lokalnego użytkownika NAS-a, a leżą
tam hashe haseł.

Dołożona sekcja rozstrzygająca „jeśli mimo wszystko Permission denied": trzy
komendy pokazujące jednocześnie stronę kontenera, stronę eksportu i stronę
katalogu, plus opis zestawu, który działa.

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
2026-08-09 11:43:54 +02:00
gitea ddec1ee5a7 docs(nfs): runbook radzi sobie z udziałem, który już istnieje
Instrukcja kazała wołać sharing.nfs.create, co przy istniejącym udziale odbija się
komunikatem „Export conflict" — i zostawia człowieka bez następnego kroku.
Teraz najpierw query, potem create ALBO update, zależnie od wyniku.

Dołożony sprawdzian `exportfs -v`: zapisana konfiguracja udziału i stan eksportu
to dwie różne rzeczy, a „access denied by server" przy poprawnej liście hostów
najczęściej znaczy właśnie, że usługa nie przeładowała eksportów.

Tabela objawów rozróżnia cztery przypadki, które łatwo pomylić: brak praw, brak
wpuszczenia przez serwer, brak katalogu i negocjację wersji NFS.

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
2026-08-07 18:48:44 +02:00
+157 -13
View File
@@ -44,46 +44,116 @@ Jeśli `Tank1` nie jest pulą ZFS albo wolisz zwykły katalog:
sudo mkdir -p /mnt/Tank1/astrololo-state sudo mkdir -p /mnt/Tank1/astrololo-state
``` ```
### Właściciel i prawa ### Właściciel i prawa — TU JEST NAJCZĘSTSZY BŁĄD
Kontenery aplikacji działają **jako root**, a eksport ma `root_squash`, więc root Kontenery aplikacji działają **jako root** (`uid=0`), a NFS domyślnie stosuje
z klienta NIE jest rootem na udziale. Żeby zapis działał, przypinamy cały ruch **`root_squash`**: root z klienta NIE jest rootem na udziale — ląduje jako
z tych hostów do jednego, nieuprzywilejowanego użytkownika — to bezpieczniejsze `nobody`. Świeży dataset ma prawa `drwxrwx--- root root`, czyli **nic dla
niż `no_root_squash`, bo nie oddaje roota. „innych"** — i dlatego zapis odbija się o `Permission denied`, mimo że `ls`
w podzie pokazuje `root root`.
To myli, bo `ls` pokazuje właściciela KATALOGU, a nie to, kim jest dla serwera
proces, który próbuje pisać.
Do wyboru dwa rozwiązania. Oba trzeba ustawić **przy eksporcie** (niżej), tu
tylko przygotowujemy katalog.
**A. Prościej — bez zakładania użytkownika.** Katalog zostaje `root:root 770`,
a przy eksporcie ustawiamy `mapall_user: "root"`. To wyłącza squash **dla tego
jednego udziału**. Zasięg jest wąski: eksportowany jest wyłącznie ten katalog,
montują go tylko trzy węzły k8s, leży w nim jeden plik. Nic nie trzeba robić —
świeży dataset ma już właściwe prawa.
**B. Czyściej — dedykowany użytkownik.** Zakładasz w UI TrueNAS
nieuprzywilejowanego użytkownika (np. `astrololo`), a potem:
```bash ```bash
# użytkownik, na którego mapujemy (jeśli nie istnieje — utwórz w UI TrueNAS) sudo chown -R astrololo:astrololo /mnt/Tank1/astrololo-state
sudo chown -R apps:apps /mnt/Tank1/astrololo-state
sudo chmod 770 /mnt/Tank1/astrololo-state sudo chmod 770 /mnt/Tank1/astrololo-state
``` ```
> Podstaw swojego użytkownika w miejsce `apps`. Sprawdzisz istniejących: i przy eksporcie podstawiasz go w `mapall_user`. Efekt ten sam, bez oddawania
roota — kosztem jednego użytkownika więcej do pamiętania.
> Istniejących użytkowników sprawdzisz przez:
> `midclt call user.query | python3 -c "import sys,json;[print(u['uid'], u['username']) for u in json.load(sys.stdin)]"` > `midclt call user.query | python3 -c "import sys,json;[print(u['uid'], u['username']) for u in json.load(sys.stdin)]"`
> **Czego NIE robić:** `chmod 777`. Zadziała, ale uczyni katalog zapisywalnym dla
> każdego lokalnego użytkownika NAS-a — a leżą tam hashe haseł, więc jest to plik
> wrażliwszy niż same bazy Excela.
### Eksport NFS ### Eksport NFS
> **Najpierw sprawdź, czy udziału już nie ma.** `sharing.nfs.create` odmawia
> z komunikatem `Export conflict`, jeśli ten sam katalog jest już eksportowany —
> wtedy trzeba go **zaktualizować**, nie tworzyć.
```bash
midclt call sharing.nfs.query '[["path","=","/mnt/Tank1/astrololo-state"]]' \
| python3 -m json.tool
```
**Pusta lista `[]`** — udziału nie ma, twórz:
```bash ```bash
midclt call sharing.nfs.create '{ midclt call sharing.nfs.create '{
"path": "/mnt/Tank1/astrololo-state", "path": "/mnt/Tank1/astrololo-state",
"comment": "astrololo — stan prezentacji (konta PRE-27)", "comment": "astrololo — stan prezentacji (konta PRE-27)",
"hosts": ["192.168.1.73", "192.168.1.80", "192.168.1.81"], "hosts": ["192.168.1.73", "192.168.1.80", "192.168.1.81"],
"enabled": true,
"ro": false, "ro": false,
"mapall_user": "apps", "mapall_user": "root",
"mapall_group": "apps" "mapall_group": "root"
}' }'
``` ```
**Coś zwróciło** — weź `id` z wyniku i zaktualizuj (podstaw `<ID>`):
```bash
midclt call sharing.nfs.update <ID> '{
"hosts": ["192.168.1.73", "192.168.1.80", "192.168.1.81"],
"enabled": true,
"ro": false,
"mapall_user": "root",
"mapall_group": "root"
}'
```
> Wybrałeś wariant B? Podstaw swojego użytkownika zamiast `root` w obu polach.
| ustawienie | po co | | ustawienie | po co |
|---|---| |---|---|
| `hosts` zawężone | te same trzy węzły k8s co w DAN-25 — nikt inny nie zamontuje | | `hosts` zawężone | te same trzy węzły k8s co w DAN-25 — nikt inny nie zamontuje |
| `ro: false` | **musi być zapisywalny**, inaczej konta się nie zapiszą | | `ro: false` | **musi być zapisywalny**, inaczej konta się nie zapiszą |
| `mapall_user` | cały ruch pisze jako jeden nieuprzywilejowany użytkownik, niezależnie od UID w kontenerze | | `mapall_user` | cały ruch z tych hostów pisze jako JEDEN użytkownik, niezależnie od UID w kontenerze — bez tego `root_squash` zamienia roota z poda na `nobody`, który nie ma praw do katalogu |
> Podstaw swoje adresy węzłów, jeśli się zmieniły. Aktualne: > Podstaw swoje adresy węzłów, jeśli się zmieniły. Aktualne:
> `kubectl get nodes -o wide` > `kubectl get nodes -o wide`
--- ---
### Sprawdź, co serwer FAKTYCZNIE eksportuje
Konfiguracja udziału i stan eksportu to **dwie różne rzeczy**: zapisana
konfiguracja nie znaczy, że usługa ją przeładowała. To jest prawda:
```bash
sudo exportfs -v | grep -A1 astrololo
```
Muszą być **dwa** wpisy: `/mnt/Tank1/astrololo` (z `ro`) oraz
`/mnt/Tank1/astrololo-state` (z `rw`), oba z listą trzech węzłów.
Jeśli `astrololo-state` **nie ma na liście**, mimo że `sharing.nfs.query` go
pokazuje — usługa nie przeładowała eksportów:
```bash
midclt call service.restart nfs
sudo exportfs -v | grep astrololo-state
```
---
## Krok 2 — sprawdź z węzła, ZANIM wdrożysz ## Krok 2 — sprawdź z węzła, ZANIM wdrożysz
To jest ten test, którego zabrakło za pierwszym razem: To jest ten test, którego zabrakło za pierwszym razem:
@@ -94,8 +164,18 @@ ssh 192.168.1.73 'sudo mount -t nfs 192.168.1.34:/mnt/Tank1/astrololo-state /mnt
&& sudo rm /mnt/test/proba; sudo umount /mnt/test' && sudo rm /mnt/test/proba; sudo umount /mnt/test'
``` ```
Musi wypisać **`ZAPIS DZIAŁA`**. Jeśli zamiast tego widzisz `Permission denied` Musi wypisać **`ZAPIS DZIAŁA`**.
wróć do praw katalogu i `mapall_user` w kroku 1.
| co widzisz | co to znaczy |
|---|---|
| `Permission denied` przy `touch` | montowanie działa, brakuje praw — wróć do właściciela katalogu i `mapall_user` |
| `access denied by server while mounting` | serwer nie wpuszcza w ogóle: sprawdź `exportfs -v` (czy eksport istnieje i przeładowany), `enabled: true` w udziale oraz czy adres węzła jest na liście `hosts` |
| `No such file or directory` | katalog `/mnt/Tank1/astrololo-state` nie istnieje na NAS-ie |
| montuje się tylko z `-o vers=3` | negocjacja wersji: dopisz `mountOptions` w manifeście albo włącz NFSv4 w `midclt call nfs.config` |
Adresy węzłów sprawdzisz przez `kubectl get nodes -o wide` — jeśli któryś się
zmienił od czasu DAN-25, lista `hosts` jest nieaktualna i to wystarczy, żeby
serwer odmówił.
--- ---
@@ -117,6 +197,70 @@ Oczekiwane: plik `accounts.json`.
--- ---
## Jeśli mimo wszystko `Permission denied`
Trzy komendy, w tej kolejności:
```bash
kubectl -n astrololo exec deploy/presentation -- sh -c 'id; ls -ld /app/state; touch /app/state/proba && echo ZAPIS-OK || echo ZAPIS-NIE'
```
```bash
midclt call sharing.nfs.query '[["path","=","/mnt/Tank1/astrololo-state"]]' \
| python3 -c "import sys,json;[print('ro:', s['ro'], '| mapall:', s.get('mapall_user'), '| hosts:', s['hosts']) for s in json.load(sys.stdin)]"
```
```bash
sudo ls -ld /mnt/Tank1/astrololo-state
```
Zestaw, który DZIAŁA: kontener jako `uid=0(root)`, udział z `ro: false`
i `mapall: root`, katalog `drwxrwx--- root root`.
### ⚠️ Po zmianie eksportu `rollout restart` NIE WYSTARCZA
To kosztowało najwięcej czasu przy pierwszym wdrożeniu, więc zapisane wprost.
**Objaw:** eksport poprawiony, `service.restart nfs` wykonany, pod zrestartowany —
a zapis z poda nadal odbija się o `Permission denied`. Przy czym **ręczne
zamontowanie tego samego eksportu z tego samego węzła działa** i pozwala pisać.
**Co z tym zrobić:** doprowadzić do stanu, w którym ŻADEN pod nie trzyma tego
montowania.
```bash
kubectl -n astrololo scale deploy/presentation --replicas=0
kubectl -n astrololo wait --for=delete pod -l app=presentation --timeout=90s
kubectl -n astrololo scale deploy/presentation --replicas=1
kubectl -n astrololo rollout status deploy/presentation
```
`rollout restart` tego nie osiąga, bo stary i nowy pod na chwilę WSPÓŁISTNIEJĄ —
w logu widać `1 old replicas are pending termination`. Montowanie ani na moment
nie zostaje bez użytkownika. (W ArgoCD ten sam skutek daje `force delete` poda.)
**Dlaczego (hipoteza, nie potwierdzona u źródła):** jądro współdzieli strukturę
montowania NFS między montowania tego samego eksportu na węźle, razem z cache
odpowiedzi ACCESS. Nowy pod podpina się do żywego montowania i dziedziczy
odpowiedź sprzed zmiany eksportu.
**Test, który rozstrzyga, czy winny jest serwer czy klient** — montaż ręczny
z węzła, z pominięciem Kubernetesa:
```bash
ssh <węzeł> 'sudo mkdir -p /mnt/t && sudo mount -t nfs 192.168.1.34:/mnt/Tank1/astrololo-state /mnt/t \
&& sudo touch /mnt/t/proba && echo SERWER-OK || echo SERWER-NIE; sudo umount /mnt/t'
```
`SERWER-OK` przy jednoczesnym `Permission denied` w podzie znaczy, że konfiguracja
NAS-a jest dobra i **nie ma czego na nim poprawiać** — problem jest po stronie
klienta.
Osobno pamiętaj: sama zmiana konfiguracji udziału nie przeładowuje eksportów.
Po każdej zmianie `midclt call service.restart nfs`.
---
## Odkręcenie ## Odkręcenie
```bash ```bash