Le symptôme
- Description de l'incident : DDL qui ne se termine jamais, réplicas désynchronisés.
- Rappel du mécanisme de distribution des DDL via Keeper/ZooKeeper.
-- Exemple de requête ON CLUSTER à insérer
ALTER TABLE my_table ON CLUSTER my_cluster ADD COLUMN ...
Où regarder pour diagnostiquer
system.distributed_ddl_queue
- Logs Keeper / ZooKeeper
- État des réplicas (
system.replicas)
Cas rencontrés
- Cas n°1 : nœud injoignable pendant l'exécution.
- Cas n°2 : timeout de réplication.
- Étape de diagnostic.
- Étape de résolution.
- Vérification post-incident.
- Bonne pratique n°1.
- Bonne pratique n°2.