Compare commits

..

3 Commits

Author SHA1 Message Date
gitea fd7e5c81b0 conjurer: deploy bot on its own [deploy]-gated image channel
The production bot now tracks conjurer-bot-deploy instead of conjurer-bot,
so it updates only when the conjurer CI promotes a build (commit message
contains [deploy]). Adds the image-updater 'deploy-bot' alias and the
kustomization images entry for it; DEPLOY-BOT.md documents the channel and
the one-time bootstrap. Test bot + librarian keep tracking every build.

Pairs with conjurer#20 (the CI promotion step).

Co-Authored-By: Claude Opus 4.8 <noreply@anthropic.com>
2026-08-03 20:12:29 +02:00
gitea e60473318d conjurer: add CONJURER_SELF_CALLBACK to both bots (per-origin librarian answers)
Pairs with conjurer#18: each bot advertises its own callback so the shared
librarian answers results/pongs back to the bot that asked - test bot
http://192.168.1.73:32442, deploy bot :32443. No CONJURER_MAIN_BOT
repointing needed for the librarian anymore; DEPLOY-BOT.md updated (only
the musician stays single-target).

Co-Authored-By: Claude Opus 4.8 <noreply@anthropic.com>
2026-08-03 18:38:45 +02:00
gitea 24fdae4f15 conjurer: add production ('deploy') bot + data seeding/backup
A second Conjurer bot alongside the test one, sharing librarian/musician/
radio and the API key, differing only in:
 * Discord token from the deploy-conjurer-netrc secret,
 * distinct names/labels (deploy-bot) and NodePort 32443,
 * /data on an NFS export (RWX) instead of a block PVC - so config/state
   can be uploaded while it runs (copy onto the share) and backed up
   concurrently.

deploy-bot-backup: a daily CronJob that mirrors /data and keeps 30 days of
dated snapshots of the critical small state (both memories, settings,
accident log, transcripts) on NFS. Production only - the test bot's
amnesia is fine. DEPLOY-BOT.md documents seeding, backup/restore, and the
librarian/musician callback routing (they push to one bot; repoint
CONJURER_MAIN_BOT to :32443 to feed this one).

kubectl kustomize builds cleanly (10 objects).

Co-Authored-By: Claude Opus 4.8 <noreply@anthropic.com>
2026-08-03 18:07:53 +02:00
9 changed files with 16 additions and 353 deletions
-279
View File
@@ -1,279 +0,0 @@
# Udział na stan prezentacji — `astrololo-state`
Potrzebny do kont zakładanych z ekranu „Konta" (PRE-27). **Bez niego pod
`presentation` nie wstanie.**
---
## Dlaczego osobny udział, a nie podkatalog
Pierwsza wersja montowała `/mnt/Tank1/astrololo` z `subPath: presentation-state`
i pod stanął w `CreateContainerConfigError`:
```
failed to create subPath directory for volumeMount "state" of container "presentation"
```
Przyczyna była podwójna i za każdym razem ta sama: udział z bazami jest
wyeksportowany **`ro: true` z `root_squash`** (patrz runbook DAN-25 w repo
aplikacji). Zatem:
1. kubelet nie mógł utworzyć podkatalogu — bo udział jest tylko do odczytu,
2. a gdyby nawet mógł, aplikacja i tak nie zapisałaby tam pliku kont.
**Osobny udział rozwiązuje to bez ruszania DAN-25.** Udział z bazami zostaje tylko
do odczytu; konta dostają własne, małe miejsce. Przy okazji znika `subPath`, czyli
znika potrzeba, żeby kubelet cokolwiek zakładał — katalog istnieje, bo jest
korzeniem udziału.
---
## Krok 1 — dataset i udział na TrueNAS
Po SSH na NAS (192.168.1.34). Konwencja jak w DAN-25: **nie edytujemy
`/etc/exports` ręcznie**, tylko przez `midclt`.
```bash
# dataset
sudo zfs create Tank1/astrololo-state
```
Jeśli `Tank1` nie jest pulą ZFS albo wolisz zwykły katalog:
```bash
sudo mkdir -p /mnt/Tank1/astrololo-state
```
### Właściciel i prawa — TU JEST NAJCZĘSTSZY BŁĄD
Kontenery aplikacji działają **jako root** (`uid=0`), a NFS domyślnie stosuje
**`root_squash`**: root z klienta NIE jest rootem na udziale — ląduje jako
`nobody`. Świeży dataset ma prawa `drwxrwx--- root root`, czyli **nic dla
„innych"** — i dlatego zapis odbija się o `Permission denied`, mimo że `ls`
w podzie pokazuje `root root`.
To myli, bo `ls` pokazuje właściciela KATALOGU, a nie to, kim jest dla serwera
proces, który próbuje pisać.
Do wyboru dwa rozwiązania. Oba trzeba ustawić **przy eksporcie** (niżej), tu
tylko przygotowujemy katalog.
**A. Prościej — bez zakładania użytkownika.** Katalog zostaje `root:root 770`,
a przy eksporcie ustawiamy `mapall_user: "root"`. To wyłącza squash **dla tego
jednego udziału**. Zasięg jest wąski: eksportowany jest wyłącznie ten katalog,
montują go tylko trzy węzły k8s, leży w nim jeden plik. Nic nie trzeba robić —
świeży dataset ma już właściwe prawa.
**B. Czyściej — dedykowany użytkownik.** Zakładasz w UI TrueNAS
nieuprzywilejowanego użytkownika (np. `astrololo`), a potem:
```bash
sudo chown -R astrololo:astrololo /mnt/Tank1/astrololo-state
sudo chmod 770 /mnt/Tank1/astrololo-state
```
i przy eksporcie podstawiasz go w `mapall_user`. Efekt ten sam, bez oddawania
roota — kosztem jednego użytkownika więcej do pamiętania.
> Istniejących użytkowników sprawdzisz przez:
> `midclt call user.query | python3 -c "import sys,json;[print(u['uid'], u['username']) for u in json.load(sys.stdin)]"`
> **Czego NIE robić:** `chmod 777`. Zadziała, ale uczyni katalog zapisywalnym dla
> każdego lokalnego użytkownika NAS-a — a leżą tam hashe haseł, więc jest to plik
> wrażliwszy niż same bazy Excela.
### Eksport NFS
> **Najpierw sprawdź, czy udziału już nie ma.** `sharing.nfs.create` odmawia
> z komunikatem `Export conflict`, jeśli ten sam katalog jest już eksportowany —
> wtedy trzeba go **zaktualizować**, nie tworzyć.
```bash
midclt call sharing.nfs.query '[["path","=","/mnt/Tank1/astrololo-state"]]' \
| python3 -m json.tool
```
**Pusta lista `[]`** — udziału nie ma, twórz:
```bash
midclt call sharing.nfs.create '{
"path": "/mnt/Tank1/astrololo-state",
"comment": "astrololo — stan prezentacji (konta PRE-27)",
"hosts": ["192.168.1.73", "192.168.1.80", "192.168.1.81"],
"enabled": true,
"ro": false,
"mapall_user": "root",
"mapall_group": "root"
}'
```
**Coś zwróciło** — weź `id` z wyniku i zaktualizuj (podstaw `<ID>`):
```bash
midclt call sharing.nfs.update <ID> '{
"hosts": ["192.168.1.73", "192.168.1.80", "192.168.1.81"],
"enabled": true,
"ro": false,
"mapall_user": "root",
"mapall_group": "root"
}'
```
> Wybrałeś wariant B? Podstaw swojego użytkownika zamiast `root` w obu polach.
| ustawienie | po co |
|---|---|
| `hosts` zawężone | te same trzy węzły k8s co w DAN-25 — nikt inny nie zamontuje |
| `ro: false` | **musi być zapisywalny**, inaczej konta się nie zapiszą |
| `mapall_user` | cały ruch z tych hostów pisze jako JEDEN użytkownik, niezależnie od UID w kontenerze — bez tego `root_squash` zamienia roota z poda na `nobody`, który nie ma praw do katalogu |
> Podstaw swoje adresy węzłów, jeśli się zmieniły. Aktualne:
> `kubectl get nodes -o wide`
---
### Sprawdź, co serwer FAKTYCZNIE eksportuje
Konfiguracja udziału i stan eksportu to **dwie różne rzeczy**: zapisana
konfiguracja nie znaczy, że usługa ją przeładowała. To jest prawda:
```bash
sudo exportfs -v | grep -A1 astrololo
```
Muszą być **dwa** wpisy: `/mnt/Tank1/astrololo` (z `ro`) oraz
`/mnt/Tank1/astrololo-state` (z `rw`), oba z listą trzech węzłów.
Jeśli `astrololo-state` **nie ma na liście**, mimo że `sharing.nfs.query` go
pokazuje — usługa nie przeładowała eksportów:
```bash
midclt call service.restart nfs
sudo exportfs -v | grep astrololo-state
```
---
## Krok 2 — sprawdź z węzła, ZANIM wdrożysz
To jest ten test, którego zabrakło za pierwszym razem:
```bash
ssh 192.168.1.73 'sudo mount -t nfs 192.168.1.34:/mnt/Tank1/astrololo-state /mnt/test \
&& sudo touch /mnt/test/proba && echo "ZAPIS DZIAŁA" \
&& sudo rm /mnt/test/proba; sudo umount /mnt/test'
```
Musi wypisać **`ZAPIS DZIAŁA`**.
| co widzisz | co to znaczy |
|---|---|
| `Permission denied` przy `touch` | montowanie działa, brakuje praw — wróć do właściciela katalogu i `mapall_user` |
| `access denied by server while mounting` | serwer nie wpuszcza w ogóle: sprawdź `exportfs -v` (czy eksport istnieje i przeładowany), `enabled: true` w udziale oraz czy adres węzła jest na liście `hosts` |
| `No such file or directory` | katalog `/mnt/Tank1/astrololo-state` nie istnieje na NAS-ie |
| montuje się tylko z `-o vers=3` | negocjacja wersji: dopisz `mountOptions` w manifeście albo włącz NFSv4 w `midclt call nfs.config` |
Adresy węzłów sprawdzisz przez `kubectl get nodes -o wide` — jeśli któryś się
zmienił od czasu DAN-25, lista `hosts` jest nieaktualna i to wystarczy, żeby
serwer odmówił.
---
## Krok 3 — wdróż i sprawdź
```bash
kubectl apply -k astrololo
kubectl -n astrololo rollout status deploy/presentation
```
Sprawdź, że aplikacja faktycznie umie tam zapisać — załóż konto testowe
na ekranie „Konta", a potem:
```bash
kubectl -n astrololo exec deploy/presentation -- ls -l /app/state/
```
Oczekiwane: plik `accounts.json`.
---
## Jeśli mimo wszystko `Permission denied`
Trzy komendy, w tej kolejności:
```bash
kubectl -n astrololo exec deploy/presentation -- sh -c 'id; ls -ld /app/state; touch /app/state/proba && echo ZAPIS-OK || echo ZAPIS-NIE'
```
```bash
midclt call sharing.nfs.query '[["path","=","/mnt/Tank1/astrololo-state"]]' \
| python3 -c "import sys,json;[print('ro:', s['ro'], '| mapall:', s.get('mapall_user'), '| hosts:', s['hosts']) for s in json.load(sys.stdin)]"
```
```bash
sudo ls -ld /mnt/Tank1/astrololo-state
```
Zestaw, który DZIAŁA: kontener jako `uid=0(root)`, udział z `ro: false`
i `mapall: root`, katalog `drwxrwx--- root root`.
### ⚠️ Po zmianie eksportu `rollout restart` NIE WYSTARCZA
To kosztowało najwięcej czasu przy pierwszym wdrożeniu, więc zapisane wprost.
**Objaw:** eksport poprawiony, `service.restart nfs` wykonany, pod zrestartowany —
a zapis z poda nadal odbija się o `Permission denied`. Przy czym **ręczne
zamontowanie tego samego eksportu z tego samego węzła działa** i pozwala pisać.
**Co z tym zrobić:** doprowadzić do stanu, w którym ŻADEN pod nie trzyma tego
montowania.
```bash
kubectl -n astrololo scale deploy/presentation --replicas=0
kubectl -n astrololo wait --for=delete pod -l app=presentation --timeout=90s
kubectl -n astrololo scale deploy/presentation --replicas=1
kubectl -n astrololo rollout status deploy/presentation
```
`rollout restart` tego nie osiąga, bo stary i nowy pod na chwilę WSPÓŁISTNIEJĄ —
w logu widać `1 old replicas are pending termination`. Montowanie ani na moment
nie zostaje bez użytkownika. (W ArgoCD ten sam skutek daje `force delete` poda.)
**Dlaczego (hipoteza, nie potwierdzona u źródła):** jądro współdzieli strukturę
montowania NFS między montowania tego samego eksportu na węźle, razem z cache
odpowiedzi ACCESS. Nowy pod podpina się do żywego montowania i dziedziczy
odpowiedź sprzed zmiany eksportu.
**Test, który rozstrzyga, czy winny jest serwer czy klient** — montaż ręczny
z węzła, z pominięciem Kubernetesa:
```bash
ssh <węzeł> 'sudo mkdir -p /mnt/t && sudo mount -t nfs 192.168.1.34:/mnt/Tank1/astrololo-state /mnt/t \
&& sudo touch /mnt/t/proba && echo SERWER-OK || echo SERWER-NIE; sudo umount /mnt/t'
```
`SERWER-OK` przy jednoczesnym `Permission denied` w podzie znaczy, że konfiguracja
NAS-a jest dobra i **nie ma czego na nim poprawiać** — problem jest po stronie
klienta.
Osobno pamiętaj: sama zmiana konfiguracji udziału nie przeładowuje eksportów.
Po każdej zmianie `midclt call service.restart nfs`.
---
## Odkręcenie
```bash
# ID udziału
midclt call sharing.nfs.query | python3 -c "import sys,json;[print(s['id'], s.get('path')) for s in json.load(sys.stdin)]"
midclt call sharing.nfs.delete <ID>
```
---
## Uwaga na przyszłość: DAN-27 uderzy w tę samą ścianę
Zarządzanie plikami baz (wgrywanie, archiwizacja, kasowanie) wymaga zapisu do
**udziału z bazami** — a ten jest `ro: true`. Ten runbook tego **nie rozwiązuje**
i celowo nie rusza DAN-25: to osobna decyzja, bo oznacza rezygnację z gwarancji,
że baz nie da się zmienić przez NFS. Patrz PR `feat/pliki-zapis`.
-10
View File
@@ -23,16 +23,6 @@ Ten plik **celowo nie jest w `kustomization.yaml`**: resource stoi w ns `argocd`
(poza namespace docelowym aplikacji), a to konfiguracja kontrolera, który wdraża tę
aplikację — nakładamy go ręcznie, w repo trzymamy dla odtwarzalności i historii.
## ⚠️ Udział `astrololo-state` — wymagany przez konta (PRE-27)
Pod `presentation` **nie wstanie bez niego** (`CreateContainerConfigError:
failed to create subPath directory`). Osobny runbook:
**[README-stan-prezentacji.md](README-stan-prezentacji.md)**.
Krótko: udział z bazami jest wyeksportowany `ro` (DAN-25), więc konta nie mogą tam
mieszkać — dostają własny, mały udział `/mnt/Tank1/astrololo-state`, zapisywalny,
zawężony do tych samych węzłów.
## ⚠️ Sekret `astrololo-auth` — utwórz PRZED wdrożeniem
Aplikacja wystawia treść **oryginalnych baz interpretacyjnych**, dlatego wymaga
-4
View File
@@ -9,10 +9,6 @@ spec:
template:
metadata: { labels: { app: data } }
spec:
# LOG-33: pody nie rozmawiają z API Kubernetesa, więc token konta
# serwisowego jest im niepotrzebny — a zamontowany byłby gotowym
# punktem wyjścia do klastra dla kogoś, kto przejmie kontener.
automountServiceAccountToken: false
imagePullSecrets: [{ name: gitea-registry }]
containers:
- name: data
+4 -4
View File
@@ -10,10 +10,10 @@ resources:
- ingress.yaml # wejście po https + przekierowanie z http
images:
- name: gitea.czernobog.pl/gitea/astrololo-data
newTag: baf4e0e3
newTag: b36b3bee
- name: gitea.czernobog.pl/gitea/astrololo-logic
newTag: baf4e0e3
newTag: b36b3bee
- name: gitea.czernobog.pl/gitea/astrololo-render
newTag: aec3f843
newTag: latest
- name: gitea.czernobog.pl/gitea/astrololo-presentation
newTag: a8339659
newTag: b36b3bee
-4
View File
@@ -9,10 +9,6 @@ spec:
template:
metadata: { labels: { app: logic } }
spec:
# LOG-33: pody nie rozmawiają z API Kubernetesa, więc token konta
# serwisowego jest im niepotrzebny — a zamontowany byłby gotowym
# punktem wyjścia do klastra dla kogoś, kto przejmie kontener.
automountServiceAccountToken: false
imagePullSecrets: [{ name: gitea-registry }]
containers:
- name: logic
-31
View File
@@ -9,10 +9,6 @@ spec:
template:
metadata: { labels: { app: presentation } }
spec:
# LOG-33: pody nie rozmawiają z API Kubernetesa, więc token konta
# serwisowego jest im niepotrzebny — a zamontowany byłby gotowym
# punktem wyjścia do klastra dla kogoś, kto przejmie kontener.
automountServiceAccountToken: false
imagePullSecrets: [{ name: gitea-registry }]
containers:
- name: presentation
@@ -60,36 +56,9 @@ spec:
secretKeyRef: { name: astrololo-link, key: LINK_KEY_PRESENTATION_RENDER }
- name: LINK_ENCRYPTION_REQUIRED
value: "true"
# Konta zakładane z ekranu „Konta" (PRE-26). Konto administracyjne
# zostaje w APP_USER/APP_PASSWORD powyżej — celowo, bo dzięki temu
# NIE DA SIĘ go skasować ani ograniczyć z aplikacji.
- name: ACCOUNTS_FILE
value: "/app/state/accounts.json"
volumeMounts:
# OSOBNY UDZIAŁ, nie podkatalog udziału z bazami. Pierwsza wersja
# montowała /mnt/Tank1/astrololo z subPath — i nie wstała:
# „failed to create subPath directory”. Powód był podwójny i oba razy
# ten sam brak: udział z bazami jest wyeksportowany `ro: true`
# z `root_squash` (DAN-25), więc (1) kubelet nie mógł utworzyć
# podkatalogu, a (2) gdyby nawet mógł, aplikacja i tak nie zapisałaby
# tam pliku kont.
#
# Osobny udział rozwiązuje to bez naruszania DAN-25: udział z bazami
# ZOSTAJE tylko do odczytu, a konta mają własne, małe miejsce.
# Przy okazji znika subPath, czyli znika potrzeba, żeby kubelet
# cokolwiek zakładał — katalog istnieje, bo jest korzeniem udziału.
- name: state
mountPath: /app/state
resources:
requests: { cpu: "100m", memory: "128Mi" }
limits: { cpu: "300m", memory: "256Mi" }
volumes:
- name: state
nfs:
server: 192.168.1.34
# Udział WYŁĄCZNIE na stan prezentacji (konta z PRE-27). Wymaga
# utworzenia na TrueNAS — patrz README-stan-prezentacji.md.
path: /mnt/Tank1/astrololo-state
---
apiVersion: v1
kind: Service
-4
View File
@@ -19,10 +19,6 @@ spec:
template:
metadata: { labels: { app: render } }
spec:
# LOG-33: pody nie rozmawiają z API Kubernetesa, więc token konta
# serwisowego jest im niepotrzebny — a zamontowany byłby gotowym
# punktem wyjścia do klastra dla kogoś, kto przejmie kontener.
automountServiceAccountToken: false
imagePullSecrets: [{ name: gitea-registry }]
containers:
- name: render
+9 -11
View File
@@ -23,19 +23,17 @@ bytes). The image-updater's `deploy-bot` alias then bumps this bot's tag.
So: normal commits update the test bot + librarian; a commit with `[deploy]` in
its message is the one that also rolls the production bot.
**Already bootstrapped:** the channel was seeded by the first `[deploy]` commit
(the merge of conjurer#20), which promoted `conjurer-bot-deploy:fbd1ec9f` the
tag pinned in `kustomization.yaml`. From here the image-updater keeps it current
on each future `[deploy]` commit. Note the librarian is shared and still tracks
latest, so mind large bot⇄librarian version skews.
If you ever need to seed a tag by hand:
**Bootstrap (first run):** `conjurer-bot-deploy` doesn't exist until the first
`[deploy]` build. Either land one commit with `[deploy]` in the message, or seed
it once by hand:
```bash
docker pull gitea.czernobog.pl/gitea/conjurer-bot:<sha>
docker tag gitea.czernobog.pl/gitea/conjurer-bot:<sha> \
gitea.czernobog.pl/gitea/conjurer-bot-deploy:<sha>
docker push gitea.czernobog.pl/gitea/conjurer-bot-deploy:<sha>
docker pull gitea.czernobog.pl/gitea/conjurer-bot:ac16b77f
docker tag gitea.czernobog.pl/gitea/conjurer-bot:ac16b77f \
gitea.czernobog.pl/gitea/conjurer-bot-deploy:ac16b77f
docker push gitea.czernobog.pl/gitea/conjurer-bot-deploy:ac16b77f
```
(match the tag in `kustomization.yaml`). Note the librarian is shared, so it
still tracks latest — mind large bot⇄librarian version skews.
## One-time setup
+3 -6
View File
@@ -8,12 +8,9 @@ resources:
- deploy-bot-backup.yaml
images:
- name: gitea.czernobog.pl/gitea/conjurer-librarian
newTag: ae1bd677
newTag: ac16b77f
- name: gitea.czernobog.pl/gitea/conjurer-bot
newTag: fbd1ec9f
newTag: ac16b77f
# Production bot channel - only bumped when a [deploy]-tagged build appears.
# Bootstrapped to fbd1ec9f: that's the image the first [deploy] build (merge
# of conjurer#20) promoted to conjurer-bot-deploy. From here the image-updater
# keeps it current across future [deploy] commits.
- name: gitea.czernobog.pl/gitea/conjurer-bot-deploy
newTag: fbd1ec9f
newTag: ac16b77f