Je suis Damien Dye.

Ingénieur avant-vente pour l’Europe et l’APAC chez croit GmbH, membre fondateur de la Ceph Foundation et Proxmox Gold Partner officiel.

Une bonne vingtaine d’années en ont été la part rémunérée : plateformes Microsoft, Linux, applications d’entreprise, virtualisation, réseau, stockage et sécurité. La part rémunérée n’est pas le tout. Je construis des choses et je les casse depuis le milieu des années quatre-vingt-dix, et je fais tourner Linux sérieusement depuis 1999, des années avant que quiconque juge cela digne d’être payé, et je compte ces années-là parce qu’on apprend autant sur du matériel qui est à soi que sur du matériel assuré par quelqu’un d’autre.

South Yorkshire, alors vous l’aurez sans détour. Si quelque chose fonctionne, je vous dirai pourquoi. Si ça ne fonctionne pas, je vous le dirai aussi, et plutôt avant que vous ayez dépensé l’argent qu’après.

Les premières années

Je démonte des ordinateurs depuis mes huit ans. Ma première machine a été un Atari STfm avec 512 K de mémoire.

Mon premier PC est arrivé à douze ans, sous Windows 3.11, et de là j’ai fait toute la série : 95, 95b, 95c, 98, 98SE puis Windows 2000.

Ce n’était pas utiliser un logiciel. C’était comprendre ce qui changeait d’une version à la suivante, ce qui cassait en chemin, et comment faire tourner un truc qui avait décidé qu’il préférait s’abstenir.

LE PARCOURS WINDOWS — 3.11 → 103.1195982000XPXP64 bitsVista64 bits764 bits8.110

Ma première connexion internet a été un modem 56k chez Freeserve — un des premiers fournisseurs gratuits du Royaume-Uni. Je suis passé à l’ADSL dès sa disponibilité en 2001, chez Demon Internet. Puis au VDSL en 2008, et enfin à la fibre chez Zen Internet en 2017 — c’est là qu’est arrivé l’IPv6 natif. C’est là que tout a commencé côté réseau, et il y a loin de là aux fabrics 100GbE que je conçois aujourd’hui. Mais la curiosité était la même.

Le réseau local a commencé encore plus tôt, et plus rudement. Mon premier LAN était en 10BASE2 — câble coaxial fin, connecteurs BNC et un bouchon 50 ohms à chaque bout, toutes les machines partageant un même bus à 10 Mbit. J’ai fait dialoguer deux PC dessus, puis j’ai ajouté un concentrateur à 5 ports quand d’autres machines sont arrivées. Ce concentrateur est devenu un commutateur — un vrai progrès, chaque port ayant son propre domaine de collision au lieu que tout se dispute un coaxial partagé. Le sans-fil est venu ensuite, dès que c’est devenu abordable : 802.11b à 11 Mbit, sur des cartes PCMCIA Orinoco Gold dans les portables. Bus coaxial, concentrateur partagé, Ethernet commuté, Wi-Fi — j’ai fait chaque étape à la main.

J’ai aussi construit des installations Windows XP entièrement sans surveillance. Elles utilisaient les vieux DriverPacks pour l’injection de pilotes et des scripts maison pour l’installation automatique des applications. On passait de la machine nue au système entièrement configuré sans toucher au clavier. C’était de la pensée automatisation des années avant que j’entende parler d’Ansible — et c’était sous Windows, pas sous Linux.

Trouver Linux

J’ai commencé Linux à quinze ans, sur SuSE 6. Je suis allé droit vers les distributions qui obligent à comprendre ce qui se passe en dessous.

Pendant les vacances de Noël 2001, j’ai construit un système complet avec le livre Linux From Scratch. Chaque paquet compilé à la main. Chaque dépendance comprise. Chaque décision de configuration prise délibérément.

En 2002 j’étais passé à Gentoo. Gentoo repose sur le même principe : vous construisez tout le système depuis les sources, vous comprenez ce que fait chaque drapeau USE, et quand quelque chose casse vous savez exactement où regarder.

LINUX — LE PARCOURS DES DISTRIBUTIONSSuSE6–7.2MandrakeGentooUbuntuRHELFedora

Explorer d’autres plateformes

Je ne me suis jamais tenu à une seule architecture.

J’ai eu un système DEC Alpha de 2001 à 2007. L’Alpha était le processeur RISC 64 bits de Digital Equipment Corporation, lancé en 1992 — une vraie machine 64 bits plus de dix ans avant que le x86 rattrape avec AMD64 en 2003. Elle faisait tourner Tru64 UNIX, OpenVMS, Windows NT et Linux, et pendant un temps c’était à peu près la chose la plus rapide qu’on pouvait poser sur un bureau. Grâce aux discussions de la communauté, j’y ai fait fonctionner l’USB et le FireWire. J’ai même monté un adaptateur PCMCIA vers ISA à l’arrière, pour que les mêmes cartes PC que j’utilisais dans les portables — l’Orinoco Gold parmi elles — tournent dans l’Alpha de bureau. Pas rien, sur une plateforme où rien n’était garanti fonctionner.

J’ai tâté de BeOS. Il abordait le multithreading et le multimédia d’une façon complètement différente de tout le reste à l’époque.

À l’université, un copain et moi avons récupéré des stations Sun SPARC mises au rebut et y avons construit Gentoo. SPARC était l’architecture RISC de Sun Microsystems, introduite en 1987 — le moteur des stations et serveurs Sun qui ont porté une grande part du monde Unix dans les années quatre-vingt-dix, en général sous Solaris. Faire tourner un Linux compilé depuis les sources sur ce matériel, c’était tout l’intérêt. Parce que pourquoi pas, si le matériel est là et qu’on veut voir si ça marche.

J’ai aussi construit et travaillé avec Linux sur ARM et ARM64, sur des Raspberry Pi et des Odroid. Et j’ai fait tourner Windows sur ARM64.

Faites tourner le même système d’exploitation sur x86, Alpha, SPARC, ARM et ARM64 et les hypothèses faites sur l’un ne vous suivent pas sur le suivant — ordre des octets, alignement, taille des pages, prise en charge des pilotes et bizarreries de la chaîne de compilation bougent tous sous vos pieds. Cela compte plus que jamais maintenant qu’ARM64 siège au centre de données à côté du x86, et c’est le raisonnement qui garde honnête un parc Ceph ou Proxmox à architectures mêlées.

J’expérimentais aussi l’IPv6 très tôt. J’avais accès au 6bone — le réseau de test expérimental IPv6. Le 6bone était un banc d’essai mondial lancé en 1996 pour développer et déployer IPv6 avant que l’internet de production soit prêt. Il portait IPv6 surtout par des tunnels IPv4, utilisait sa propre plage 3ffe::/16, et a été arrêté délibérément le 6 juin 2006 une fois l’IPv6 natif assez mûr pour tenir seul. Je faisais tourner la pile IPv6 de Linux et celle de Microsoft Research pour Windows XP. J’ai fait tout le parcours. Commencé par les tunnels IPv6 dans IPv4. Passé au 6to4 (RFC 3056) pour le tunnelage automatique. Puis à l’IPv6 natif complet quand je suis passé chez un fournisseur correct — Zen Internet. La plupart des gens n’ont pas touché à IPv6 avant que leur employeur les y oblige. J’avais déjà traversé tous les mécanismes de transition à ce moment-là, sous Linux comme sous Windows, parce que je voulais comprendre où allait le réseau. C’est pour cela qu’IPv6 me paraît naturel aujourd’hui plutôt que rajouté après coup. Désormais, quatre-vingt-dix pour cent de mon trafic passe en IPv6 natif. J’utilise une extension de navigateur appelée IPvFoo qui me montre ce qu’emploie chaque connexion et si les sites servent des protocoles mêlés ou uniquement de l’IPv4. Vieille habitude — j’aime voir ce qui se passe vraiment, pas le supposer.

IPv6 — VINGT ANS, DE L'ESSAI AU CRITIQUED'une pile d'essai à la maison à la production à l'échelle nationale6bone — le banc d'essai expérimental IPv6Piles IPv6 de Linux et de Microsoft Research côte à côteTunnels IPv6 dans IPv4IPv6 porté sur l'internet IPv4, configuré à la main6to4 (RFC 3056)Tunnelage automatique — aucun relais à entretenirIPv6 natifDe bout en bout à la maison sur fibre · Zen Internet · 2017Nominet — infrastructure nationale critiqueIPv6 en production pour le registre .uk · répartiteurs F5 en IPv4 et IPv6Aujourd'hui, environ 90 % de mon trafic passe en IPv6 natif.

Apprendre en faisant

Tout ce que je sais techniquement, je l’ai appris en m’y mettant. Construit des choses, cassé des choses, compris pourquoi elles cassaient, reconstruit.

Le diplôme était en Business Studies et Computer Network Engineering à Sheffield Hallam, et il m’a donné la seule chose que l’autodidaxie ne donne pas — comment une entreprise fonctionne vraiment, comment une décision technique devient un résultat commercial, et comment penser un système en fonction du problème qu’il résout pour celui qui paie. Cela a façonné chaque poste depuis.

Les compétences techniques, elles, sont venues de la pratique et non des études. Les incidents de production n’arrivent pas avec une bibliographie. Savoir reprendre une chose depuis les principes vaut mieux qu’un certificat au mur, et cela ne périme pas.

D’où vient l’open source

Quand la direction de Microsoft a décrit l’open source comme « un cancer » au début des années 2000, j’étais déjà profondément dans Linux. À construire des systèmes depuis rien. À faire tourner Gentoo. À contribuer dans des communautés.

Ce genre d’hostilité envers des gens qui partagent le savoir et construisent ensemble ne m’a pas découragé. Elle m’a poussé plus loin dedans. Si la réponse d’une entreprise au développement collaboratif est de le traiter de maladie, cela en dit plus sur l’entreprise que sur le logiciel. J’ai creusé l’open source et j’en ai fait mon premier réflexe, plutôt que de soutenir cet état d’esprit.

Au fil des années, l’argument pratique a rattrapé l’argument de principe. Les plateformes propriétaires marchent assez bien jusqu’à ce que l’éditeur change sa licence, se fasse racheter, ou décide que votre cas d’usage ne vaut pas la peine. Alors vous êtes coincé. Vos données, vos processus et le savoir-faire de votre équipe sont tous liés à une plateforme que vous ne contrôlez plus. Le rachat de VMware par Broadcom est l’exemple le plus récent et le plus visible, mais loin d’être le seul.

Le même raisonnement vaut pour le cloud. Demandez ce que vous louez réellement et la réponse est : de la capacité que vous auriez pu posséder, sur un compteur qui ne s’arrête jamais. Les bénéfices promis — agilité, élasticité, moins à gérer — arrivent rarement sous la forme décrite par l’argumentaire, et le coût s’accumule d’année en année comme du matériel possédé ne le fait pas. Aussi ai-je pu montrer, chaque fois qu’on me l’a demandé, que l’open source sur du matériel bien conçu donne un meilleur rapport, plus de contrôle et moins de surprises. Pas une position à la mode. Mais une position que je peux chiffrer.

Construire une carrière

Ma carrière a commencé en 2005 chez un fondeur de précision à Worksop. Technicien informatique, dans une petite équipe, au service d’une cinquantaine d’utilisateurs.

Ce premier poste couvrait une vraie largeur. Maintenance de l’ERP Manusoft et de l’archivage documentaire. Administration de serveurs Linux et Windows 2003. Développement Crystal Reports pour les décisions de production et de maintenance. Administration du standard téléphonique. Intégration des systèmes CAO/FAO et gestion de la fabrication robotisée assistée par ordinateur. Achats matériels et logiciels. Formation des utilisateurs et assistance directement à leur poste.

J’écrivais aussi de l’automatisation dès le premier jour. J’ai mis à niveau l’Active Directory de l’entreprise et écrit des scripts VB pour connecter automatiquement les lecteurs, attribuer les imprimantes et déployer les logiciels selon l’appartenance aux groupes. C’était en 2006 — de la vraie automatisation d’infrastructure dans mon premier poste.

C’est ça, l’informatique industrielle. Quand la ligne s’arrête à cause de quelque chose dont vous avez la charge, vous découvrez vite que la fiabilité n’est pas une préférence, et les gens debout à côté de la machine vous le diront eux-mêmes. C’était aussi la première fois que je faisais tourner Linux et Windows dans le même bâtiment pour gagner ma vie, et c’est le motif depuis.

De là je suis passé au support technique de première ligne. Premier et deuxième niveau, sur un guichet dédié à un grand client multinational. Postes Windows, Active Directory, Exchange 2007, VPN Cisco, Cisco Call Manager, gestion de tickets ITIL sur Remedy. Cette discipline ITIL — gestion du changement, gestion des problèmes, processus structurés — m’a suivi dans chaque poste depuis. J’ai aussi fait tôt le pont entre les mondes Linux et Windows — configuration de Services for Unix et résolution des accès Citrix aux partages NFS Unix.

Même à ce guichet je construisais au-delà de la fiche de poste. J’ai écrit une interface qui créait et désactivait les comptes utilisateurs directement depuis les données RH d’Agresso, en gérant le compte Active Directory, les appartenances aux groupes, la configuration d’Office Communicator, la boîte Exchange et les alias. C’est de l’intégration de systèmes depuis un siège de premier niveau, ce que l’intitulé ne disait pas.

Un des clients que j’assistais à ce guichet m’a recruté plus tard dans l’entreprise suivante.

Ensuite, un groupe mondial de communications, TIC et sécurité. C’est là que le développement applicatif a vraiment commencé. En deux ans et demi j’ai construit six systèmes internes distincts ou contribué à leur construction. Un outil de devis web sur mesure. Des interfaces de traitement des commandes entre Salesforce et Agresso. Un catalogue de données de référence SharePoint alimenté par Salesforce et Agresso. Un système web de gestion de projet sur mesure avec interfaces vers MSPE et Agresso pour le traitement financier. Et une migration d’une application Salesforce Service Cloud personnalisée vers ServiceNow avec mise en œuvre complète des processus ITIL. J’écrivais aussi l’architecture d’interfaçage SQL pour les applications d’entreprise et optimisais les performances MS SQL. J’administrais IIS et les Terminal Services de Windows Server 2008, et j’étais responsable du modèle de données de l’entreprise. Les services d’annuaire — Active Directory et LDAP — sont devenus ici une compétence centrale qui m’a suivi dans tous les postes suivants.

J’ai aussi mené un programme national de remplacement sous Windows 7, faisant passer toute la base d’utilisateurs britannique sur du matériel HP neuf en trois semaines, 95 % d’entre eux déclarant n’avoir subi aucune perturbation. Trois semaines est le genre de chiffre qui ne sort que si la préparation a été faite correctement, et la préparation est la moitié ingrate dont personne ne demande de nouvelles après coup.

Puis est venue l’encadrement. Un concepteur de semi-conducteurs avec une petite équipe d’ingénieurs répartie sur plusieurs pays. Cela a réuni plusieurs fils à la fois. Je développais sur la plateforme Force.com — déclencheurs, pages Visualforce, contrôleurs personnalisés — pour intégrer mondialement la comptabilité Financial Force et les systèmes PSA. En parallèle je construisais deux grappes HPC distinctes démarrant en PXE. Une pour l’ingénierie européenne au Royaume-Uni et une pour l’ingénierie chinoise. Les deux sous Red Hat avec des systèmes de fichiers racine NFS, pour des fermes de calcul sans disque, cohérentes et reproductibles à 100 %. J’ai déployé ZFS sur Linux avec du matériel Dell PowerVault pour un stockage unifié. J’ai remplacé de vieux environnements de sécurité isolés par un Active Directory Windows Server utilisant Kerberos et LDAP natifs pour une authentification unique sous Linux et Windows. J’ai stabilisé la connectivité internationale en construisant un réseau unifié avec des tunnels OpenVPN à travers des conditions d’exploitation difficiles vers la Chine.

Pendant une bonne partie de ce poste j’étais le seul à couvrir tout cela : les fermes de calcul Linux, le support Windows, le développement Salesforce et l’assistance aux utilisateurs sur plusieurs fuseaux, sous des charges de conception SoC en nœuds technologiques avancés. Un des ingénieurs qui me rapportaient est devenu développeur Salesforce, et je compte cela comme le meilleur résultat de ces années.

Ensuite, une vraie plongée dans Linux. Support de troisième niveau chez Pulsant, hébergeur et fournisseur de cloud, sur toute la pile. RHEL, CentOS, Ubuntu. Grappes MySQL avec Galera, partitionnement MongoDB, HAProxy avec SNI et terminaison SSL, Apache, PostgreSQL, réglage de PHP-FPM pour du commerce en ligne performant, messagerie Postfix, BIND et PowerDNS pour l’hébergement DNS, Varnish pour le cache web, Squid pour le cache mandataire. IPTables, IPset et Cisco ASA pour le pare-feu et la protection anti-DoS. Optimisation des serveurs Linux pour le réseau et le stockage. Dépannage CPanel, développement de modèles de supervision SolarWinds et administration New Relic. Le tout sur VMware 5.5 avec vCloud Director en dessous.

Ce n’était pas que du support non plus. J’y ai conçu un produit de réplication de bases Galera et l’ai mené du concept au prototype puis à un service facturé aux clients. Ce n’était pas un exercice de laboratoire. Il a été construit et éprouvé contre de vraies charges de vrais clients payants, ce qu’un hébergeur ne confie pas à la légère.

Le troisième niveau vous apprend ce que veut dire être la dernière ligne d’escalade. Quand ça arrive chez vous, personne derrière vous ne va le réparer.

Puis Nominet — le registre derrière chaque nom de domaine en .uk. Du DNS à l’échelle nationale. L’infrastructure doit être solide vingt-quatre heures sur vingt-quatre, tous les jours, sans indisponibilité et avec astreinte hors heures. VMware 5.5 et 6, stockage HP 3par avec zonage fibre channel sur Brocade, RHEL 6 et 7 gérés par Puppet, répartiteurs F5 en IPv4 et IPv6, messagerie Postfix, et un déploiement Zabbix que j’ai construit pour remplacer la supervision vieillissante sous VMware Hyperic. J’ai aussi adopté et personnalisé ServiceNow, en mettant en place des flux de travail, du déploiement applicatif et la découverte des nœuds Linux pour la gestion de configuration et l’inventaire. J’ai aidé à concevoir et bâtir les processus d’externalisation du service desk hors heures, pour alléger l’astreinte.

Chez Nominet j’ai fini par être la première personne qu’on allait voir, que ce soit du Linux, de l’Unix, du ServiceNow ou quelque chose que personne ne savait classer, et je tenais à revenir avec quelque chose qui marchait plutôt qu’avec quelque chose qui sonnait bien. C’est le genre d’endroit où l’on apprend que l’approche ennuyeuse et disciplinée de l’infrastructure est celle qui survit au contact d’un mardi matin.

Après Nominet je suis passé par l’infrastructure et l’hébergement. VMware 6.7, Zerto pour la reprise après sinistre, stockage Dell Compellent et Nexsan avec zonage fibre channel Brocade, Citrix Cloud avec gestion de profils FSLogix aux côtés d’Azure. J’y ai aussi introduit la supervision Zabbix, en concevant les modèles et les scripts depuis zéro.

Puis la distribution. Encadrement d’une petite équipe, réinternalisation de l’administration VMware 6.7 confiée à un tiers, déploiement de Zabbix (encore une fois, en remplacement d’une tentative ratée), refonte du déploiement des systèmes autour de PXE et Chocolatey, modernisation du réseau avec du matériel Fortinet, et remise en ordre des achats matériels.

Puis le poste qui a tout changé. Au UK Centre for Ecology & Hydrology, j’ai encadré l’équipe de calcul scientifique — quatre personnes — et reconstruit l’infrastructure de fond en comble. Un cloud privé de 7 nœuds Proxmox VE avec stockage Ceph hyperconvergé sur un double commutateur 100 Gb. Une grappe HPC de 8 nœuds sur InfiniBand HDR avec Slurm, SR-IOV pour l’accès des VM à la fabric et EasyBuild pour les compilations logicielles. Migration de GPFS vers un stockage Ceph tout NVMe. Ansible avec Netbox comme source de vérité pour tout — gestion des correctifs, maîtrise de la dérive de configuration, intégrations vers Cloudflare, PowerDNS et Active Directory. Routage dynamique OSPF pour les réseaux du cloud. Miroirs de dépôts locaux pour une vitesse et une cohérence maximales de déploiement. Redéploiement de l’environnement HPC de CentOS 7 vers Rocky 9. Cloudflare pour le DNS (DNSSEC compris), la protection anti-DDoS et l’accès distant Zero Trust. Cela a compris la migration de 25 zones DNS faisant autorité depuis un BIND 9 auto-hébergé vers Cloudflare en deux jours ouvrés. Plusieurs registres ont été mis à jour, et l’ensemble a été intégré avec Ansible et Let’s Encrypt.

Le tout sur des outils open source, budget serré, construit délibérément pour rester hors du piège de licence Broadcom et VMware avant qu’il ne se referme. Cela a réglé le débat. L’infrastructure open source à cette échelle n’est pas seulement viable — elle est meilleure, et j’ai la grappe et les factures pour le dire.

L’autre moitié de ce poste, c’étaient les quatre personnes de l’équipe. Les scientifiques se moquent du nom du stockage. Ce qui leur importe, c’est que le calcul passe cette nuit, et que la personne à qui ils demandent sache expliquer la réponse sans leur donner l’impression d’être bêtes d’avoir demandé.

Comment tout cela se rejoint

Le passage à l’avant-vente chez croit n’était pas un changement de cap. C’était tout qui atterrissait au même endroit.

Informatique industrielleLa fiabilité n'est pas optionnelle quand la production en dépendSupport de première ligneApprendre à écouter, à expliquer et à rester patientDéveloppement applicatifBâtir des systèmes qui résolvent de vrais problèmes métierDirection informatique mondialePorter la charge technique et faire grandir les gensIngénierie Linux avancéeLa dernière ligne d'escalade — personne d'autre à appelerDNS critique chez NominetInfrastructure et discipline à l'échelle nationaleInfrastructure & hébergementVMware, stockage et reprise après sinistre à grande échelleCalcul scientifique (UKCEH)Reconstruit sur Proxmox VE + Ceph + HPC, open source partoutAvant-vente chez croitConcevoir le système, défendre le choix, rester honnête

L’informatique industrielle m’a appris que la fiabilité cesse d’être une préférence dès l’instant où la production en dépend. Le support de première ligne m’a appris à écouter avant toute chose. Le développement applicatif m’a appris à bâtir des systèmes qui résolvent un problème métier plutôt qu’un problème intéressant. Encadrer une équipe mondiale m’a appris à porter la charge technique tout en faisant grandir les gens autour de moi, ce qui est plus dur que chacune des deux moitiés prise seule. Le troisième niveau Linux m’a appris ce que fait la dernière ligne d’escalade. Vingt ans de Windows et de Linux côte à côte m’ont appris comment les plateformes se comportent réellement en charge, par opposition à ce que dit la fiche technique. VMware, que j’ai fait tourner dans presque tous mes postes depuis 2008, m’a appris à quoi ressemble la virtualisation d’entreprise à l’échelle — puis ce qui arrive quand le terrain commercial se dérobe sous une plateforme sur laquelle tout le parc est assis. Le stockage et le réseau m’ont appris où vivent les problèmes difficiles. La sécurité a traversé le tout, des pare-feux et VPN du début au DNSSEC, au Zero Trust et au durcissement d’aujourd’hui. Nominet m’a appris la discipline.

Mettez tout cela ensemble et vous obtenez l’avant-vente. Vous concevez le système, puis vous défendez la conception, et vous restez honnête sur ce qu’elle ne fera pas, parce que quelqu’un s’apprête à dépenser de l’argent réel sur votre parole.

Chez croit, cela veut dire travailler avec des structures d’Europe et d’Asie-Pacifique qui repensent leur virtualisation et leur stockage. Les conversations portent en général sur le départ de VMware vers Proxmox VE avec Ceph. Les charges qui migrent sont surtout Windows, l’expérience multiplateforme n’est donc pas de l’histoire ancienne. C’est ce que je fais aujourd’hui.

Ce qui m’importe, c’est l’honnêteté. Ce que je pose devant quelqu’un doit être la chose qui fonctionne dans son bâtiment, à son échelle, avec les contraintes qu’il a réellement, et si son matériel actuel fait déjà l’essentiel du travail, c’est cela que je lui dirai.

LA PILE QUE JE CONÇOIS & CONSTRUIS AUJOURD'HUIAutomatisation & source de véritéAnsible · NetBox · Let's EncryptCalculProxmox VE — machines KVM + conteneurs LXCStockageCeph — bloc RBD · CephFS · tout NVMeRéseauFabric 25/100GbE · BGP / OSPF · IPv6 natifFondationDe l'open source, sur du matériel qui vous appartient

Stockage

Le stockage n’a cessé d’être l’endroit où se trouvaient les problèmes les plus durs. Ce n’était pas un plan de carrière délibéré — cela s’est simplement passé ainsi.

La fascination a commencé tôt. Dans les années quatre-vingt-dix je rêvais des disques Iomega Zip et Jaz — 100 Mo, puis un gigaoutil entier sur une seule cartouche amovible, quand les disquettes que tout le monde s’échangeait tenaient 1,44 Mo. C’était du matériel cher, alors ils sont restés des années une envie plutôt qu’un bien. Quand j’ai enfin eu un lecteur Zip USB, les clés USB venaient d’apparaître — et le format que j’avais tant voulu était déjà sur le départ. Une leçon précoce sur la vitesse à laquelle bouge le stockage, et sur la vitesse à laquelle l’indispensable d’aujourd’hui devient le fond de tiroir de demain.

L’optique faisait partie de la même histoire. En 1998 j’avais un graveur HP CD-RW quadruple vitesse, et c’était une merveille. Il lisait et réécrivait des disques que des lecteurs ultérieurs, plus rapides, refusaient purement et simplement — il a donc gagné sa place de lecteur de secours longtemps après l’âge de la retraite.

Cela a commencé à l’interconnexion. J’ai travaillé avec du matériel de stockage sur toute la gamme. IDE, plusieurs générations de SCSI, SATA, SAS et NVMe côté attachement direct. ATA over Ethernet et iSCSI côté stockage en réseau. HP 3par, Dell Compellent, Dell PowerVault, Nexsan — chacun avec ses bizarreries et ses modes de défaillance.

De là on remonte la pile. Le LVM en grappe m’a appris comment se comporte un stockage partagé quand plusieurs nœuds ont besoin d’un accès concurrent — et ce qui arrive quand le verrouillage et le cloisonnement ne sont pas justes. ZFS m’a appris ce qui arrive quand on réfléchit vraiment à l’intégrité des données au niveau du système de fichiers. GPFS m’a montré les systèmes de fichiers parallèles à l’échelle. Ceph m’a appris comment les systèmes distribués se comportent différemment en cas de panne.

Au fil des années, « la personne qui fait aussi le stockage » est devenue « la personne qu’on appelle quand le stockage doit être conçu correctement ».

Réseau

Le réseau est là depuis le début. Ce n’est pas une compétence d’appoint — c’est une compétence centrale. TCP/IP, DHCP et DNS traversent chacun des postes que j’ai occupés depuis McKenna.

Travailler chez Nominet, c’était travailler sur l’infrastructure derrière le registre des noms de domaine britanniques. C’est du DNS à l’échelle nationale. Nommage, résolution, délégation, et l’attente que cela fonctionne à chaque fois.

J’ai fait tourner des zones faisant autorité sur BIND 9, configuré DNSSEC, monté des répartiteurs F5 pour IPv4 et IPv6, et plus tard migré des parcs DNS vers Cloudflare avec automatisation par API et intégration Let’s Encrypt. J’ai bâti de l’infrastructure DNS de démarrage PXE pour des déploiements de grappes au Royaume-Uni et en Chine. Je comprends le DNS des deux côtés. Auto-hébergé, où chaque panne vous appartient. Et infogéré, où vous faites confiance à un prestataire et devez vérifier cette confiance par la supervision.

Au-delà du DNS, le réseau traverse chaque poste que j’ai occupé. VLAN, agrégation, LACP, zonage fibre channel avec Brocade, pare-feux Fortinet et Cisco ASA, IPTables et IPset. Conception de fabrics 25GbE et 100GbE, BGP, routage dynamique OSPF, gestion du MTU, architecture IPv6. Tunnels VPN — d’OpenVPN sur des liaisons internationales difficiles jusqu’à WireGuard et cloudflared pour un accès sécurisé moderne. Samba a aussi été une compétence professionnelle sur plusieurs postes, faisant le pont entre le partage de fichiers Linux et l’intégration au domaine Windows, bien avant que je teste l’implémentation AD en alpha.

Une grappe Ceph est une application réseau. Le plafond de performance du stockage est fixé par le réseau qui est dessous. Les modes de défaillance sont des modes de défaillance réseau. Cela ne s’apprend pas dans un manuel. Cela s’apprend en dépannant à deux heures du matin.

Linux

Je travaille sur les familles RHEL, Debian, SUSE et Fedora depuis plus de vingt ans. Professionnellement, cela veut dire RHEL et CentOS pour les services en production, Ubuntu pour l’hébergement applicatif, Rocky pour le HPC, et Gentoo et Fedora pour l’usage personnel. J’ai réussi l’évaluation de compétences Linux de LinkedIn.

La profondeur est venue de problèmes sans réponse sur Stack Overflow, et c’est là qu’on finit par apprendre le sous-système PCI pour de bon plutôt que par ouï-dire : groupes IOMMU, ACS, VFIO, SR-IOV, Resizable BAR et ce que la traduction DMA vous coûte discrètement, et les paramètres de démarrage du noyau comme des commandes qui changent le comportement de la machine, plutôt qu’une liste à recopier d’un wiki parce qu’un blog disait que cela avait réglé son problème.

Les problèmes de performance de stockage et de virtualisation remontent presque toujours à une couche que personne n’a regardée. C’est là que vit ma connaissance de Linux.

Windows

Linux est là où je passe mon temps aujourd’hui, mais le côté Windows est tout aussi réel et il a été présent dans chaque poste que j’ai eu. Windows Server, Active Directory, LDAP, Exchange, IIS, Microsoft SQL Server. Rien de tout cela n’est une compétence héritée que j’aurais posée.

Cela compte au niveau de l’invité, et c’est là que la plupart des gens cessent de regarder. Quand une charge Windows tourne sur KVM, la personne capable de vous dire comment cet invité se comporte sous une topologie processeur donnée, et de remonter une plainte de performance jusqu’à un correctif Microsoft plutôt que d’accuser l’hyperviseur, est celle qui a passé des années des deux côtés de la barrière. La plupart des débats de performance de VM auxquels j’ai assisté ont été gagnés par quelqu’un qui connaissait l’invité, pas l’hôte.

Les gens que j’ai assistés vont des professeurs et membres de conseils d’administration jusqu’à l’équipe qui s’occupe des bâtiments. Le travail est le même dans tous les cas. Découvrir ce dont ils ont réellement besoin, le faire marcher, et l’expliquer sans leur donner l’impression d’être bêtes d’avoir demandé.

VMware

VMware est la plateforme sur laquelle j’ai grandi professionnellement, sur sept postes depuis 2008, et j’en ai fait tourner toute la pile : ESXi, vCenter, vSAN, grappes vSphere, vMotion. Je sais ce qu’elle fait bien. Je sais où elle pèche. Et j’ai vu le rachat par Broadcom réécrire la réalité commerciale sous des structures qui avaient bâti tout leur parc dessus, ce qui n’est pas la même chose que d’en lire le récit.

On ne peut pas aider quelqu’un à quitter une plateforme sur laquelle on n’a jamais vraiment travaillé. Aussi puis-je leur dire ce qu’ils abandonnent, ce qu’ils gagnent, et quelle partie de la migration sera pire qu’on ne le leur a laissé croire.

Automatisation

La pensée automatisation a commencé dans mon premier poste en 2006. Des scripts VB chez McKenna pour automatiser la connexion des lecteurs AD, l’attribution des imprimantes et le déploiement logiciel. Puis des outils de provisionnement RH vers AD chez BT Engage IT. Puis des systèmes de démarrage PXE pour des grappes de calcul sans disque chez Sondrel. Puis Puppet chez Nominet. Puis l’empaquetage Chocolatey et la reconstruction PXE chez un distributeur. Puis la personnalisation des flux ServiceNow sur plusieurs postes.

Aujourd’hui c’est Ansible avec Netbox comme source de vérité. Non pas parce que c’est à la mode, mais parce qu’une infrastructure qu’on ne peut pas reconstruire depuis du code n’est pas une infrastructure à laquelle on peut se fier.

La documentation relève du même argument. Un savoir qui ne vit que dans la tête de quelqu’un est un point de défaillance unique, et il quitte le bâtiment à dix-sept heures avec tout le monde. Comme un disque sans redondance derrière, et à traiter avec le même sérieux.

Supervision

Mon parcours en supervision a commencé avec SolarWinds chez Pulsant, à surveiller à grande échelle le parc d’hébergement. Zabbix est venu ensuite, et il mérite sa mention propre parce que je l’ai installé à peu près partout depuis. Cela a commencé chez Nominet, où j’ai mené l’appel d’offres et les tests puis nous ai fait basculer sur Zabbix pour remplacer le vieillissant VMware Hyperic, et il l’a emporté parce qu’il était vraiment intuitif et pas une énième façade sur du Nagios. Ensuite je l’ai installé de zéro chez une plateforme d’hébergement et d’infrastructure, remplacé la tentative ratée de quelqu’un dans la distribution, et utilisé pour surveiller une grappe HPC de 8 nœuds à l’UKCEH.

À chaque fois j’ai conçu les modèles de supervision et écrit les scripts moi-même. Quand j’ai passé les examens Zabbix Specialist et Professional en 2018, je le déployais déjà depuis des années.

Communication

Travailler dans l’infrastructure critique vous apprend la précision. Travailler en avant-vente vous apprend la clarté. Les deux sont liées mais ne sont pas la même chose.

Être précis ne sert à rien si la personne en face ne peut pas suivre le raisonnement, alors j’ai dû apprendre à faire deux fois la même explication : une fois pour l’ingénieure qui veut voir la carte CRUSH, et une fois pour la personne qui doit signer pourquoi le budget est le chiffre qu’il est. Je ne simplifie rien à l’excès. Je rends juste chaque étape du raisonnement visible, et je les laisse m’arrêter où ils veulent.

Des années d’utilisateurs finaux m’ont appris une autre sorte de patience. Les gens qui se croient les plus intelligents de la pièce sont en général les plus démunis dans les faits. Ceux qui commencent par « je ne suis pas très technique » écoutent, suivent les étapes et s’en sortent en dix minutes. Et ceux qui vous disent savoir exactement ce qu’ils font ont généralement aggravé les choses avant de décrocher le téléphone.

Le parcours en systèmes de gestion aide ici plus qu’on ne le croit, parce que j’ai toujours dû traduire dans les deux sens. Une architecture SQL pour une responsable d’exploitation, une conception de stockage pour un directeur technique, ou s’asseoir à côté de quelqu’un à son propre bureau pour lui montrer ce qu’on ne lui a jamais montré. La même compétence à chaque fois.

Communauté

Le partage du savoir traverse toute la carrière.

J’étais actif sur les forums Gentoo quand je construisais des systèmes depuis les sources et devais comprendre pourquoi une combinaison de drapeaux USE cassait une compilation. J’ai contribué sur les forums Samba quand je travaillais sur des problèmes de partage de fichiers et d’intégration de domaine entre Linux et Windows. Cela allait au-delà de poser des questions. J’ai bâti un contrôleur de domaine Active Directory sous Samba alors que la prise en charge AD était encore en alpha. Je l’ai testé contre des clients Windows 2000, XP et Vista et j’ai fait remonter les résultats à la communauté.

Aujourd’hui je contribue activement sur les forums de la communauté Proxmox sous DamienDye. J’y aide sur la performance du passthrough NVMe, le réglage des VM Windows, le dépannage Ceph et le réseau de grappes.

Les technologies changent. Le principe non. Si j’ai résolu un problème, il n’y a rien à gagner à rester assis dessus, et quelqu’un, à deux heures du matin dans six mois, sera content que ce soit écrit.

J’ai aussi l’habitude de creuser les problèmes au-delà de ce que la tâche exige strictement. J’ai conçu une carte maison de protection contre les coupures d’alimentation pour NVMe, parce que je voulais comprendre exactement pourquoi la corruption de FTL survient au niveau matériel. J’ai étudié les protocoles de messagerie auto-hébergée parce que je voulais comprendre JMAP depuis la RFC plutôt que de faire confiance à un prestataire. J’ai construit ce blog parce qu’écrire les choses correctement est la façon de trouver les trous dans sa propre compréhension.

La communauté loin du clavier

Tout cela n’a pas été que des forums.

En 2018 j’ai été un des fondateurs de la Longford Park Community Association à Banbury, dans le lotissement où j’habite. Quatre phases de construction neuve, un centre communautaire inscrit dans les plans, et rien qui existe pour le faire vivre. Alors une poignée d’habitants a monté quelque chose.

J’ai fait la partie informatique d’abord, parce que c’est ce que j’avais à donner. Le domaine lpca.org.uk est passé en ligne en janvier 2018, et derrière j’ai bâti le site, les systèmes de messagerie et les listes du comité, et rédigé la politique de confidentialité.

J’ai été au comité dès le départ, et j’en ai été le président de décembre 2018 à février 2020. Quatorze mois, et les choses qui comptaient vraiment ont toutes abouti dans cet intervalle. Nous l’avons fait enregistrer comme organisme de bienfaisance le 11 février 2019, numéro 1181953. J’ai réglé le bail commercial du bâtiment. Puis nous avons ouvert le centre.

C’est à cela que servait la présidence. Pas à des ordres du jour et des comptes rendus. À ouvrir un bâtiment dans lequel quelques centaines de foyers peuvent entrer. Des bénévoles du quartier le font encore vivre sur les phases 1 à 4 du lotissement — trois salles, une cuisine et un parking, loués à l’heure à qui en veut dans le lotissement.

Les comités de bénévoles tournent à la bonne volonté, et la bonne volonté n’est pas un modèle de gouvernance. Alors j’ai tenu les gens aux statuts, moi compris. J’ai demandé pourquoi nous recrutions à l’extérieur quand les statuts disaient d’impliquer les habitants, et j’ai arrêté un envoi groupé qui serait tombé dans tous les dossiers indésirables du lotissement. Pas pour être difficile. Une association d’habitants qui ne peut pas joindre les habitants a déjà échoué à la seule mission qu’elle a, et j’ai envoyé les liens pour le corriger en même temps que la remarque.

Le centre est toujours ouvert et je ne suis plus au comité, et c’est le bon sens de la chose. Ce qui ne fonctionne que tant que vous êtes là à le tenir n’a jamais été bâti correctement.

Ce site

Ce blog est un site statique Hugo avec le thème PaperMod. Il est hébergé sur Cloudflare Workers, qui sert le site construit comme des ressources statiques.

J’écris ici sur l’infrastructure avec laquelle je travaille au quotidien : Proxmox VE, Ceph, Ansible, Netbox, les certificats et tout ce que j’ai creusé cette semaine-là. C’est écrit pour être utilisé, avec les commandes et les chiffres dedans, parce qu’un billet qu’on ne peut pas suivre au clavier est de la décoration. Pas de baratin marketing. Si quelque chose a des angles rugueux, le billet le dit.

Me contacter

Vous me trouverez sur LinkedIn ou sur les forums Proxmox.

Si vous regardez Ceph ou Proxmox pour chez vous et que vous voulez une vraie conversation plutôt qu’un argumentaire, écrivez-moi. Apportez la charge de travail, les contraintes et le budget que vous avez réellement. Je vous dirai ce que cela fera, ce que cela ne fera pas, et si la réponse honnête est que vous devriez garder ce que vous avez et le configurer correctement, vous aurez aussi cette réponse-là.