Ich bin Damien Dye.

Presales Engineer für Europa und APAC bei croit GmbH, einem Gründungsmitglied der Ceph Foundation und offiziellem Proxmox Gold Partner.

Gut zwanzig Jahre davon waren der bezahlte Teil: Microsoft-Plattformen, Linux, Unternehmensanwendungen, Virtualisierung, Netzwerk, Storage und Sicherheit. Der bezahlte Teil ist nicht das Ganze. Ich baue und zerlege Dinge seit Mitte der Neunziger und fahre Linux seit 1999 richtig, Jahre bevor irgendwer das für bezahlenswert hielt, und ich zähle diese Jahre mit, weil man an Technik, die einem selbst gehört, genauso viel lernt wie an Technik, die ein anderer versichert hat.

South Yorkshire, du bekommst es also direkt. Wenn etwas funktioniert, sage ich dir warum. Wenn nicht, sage ich dir das auch, und zwar lieber, bevor du das Geld ausgegeben hast, als danach.

Die frühen Jahre

Ich nehme Computer auseinander, seit ich acht bin. Meine erste Maschine war ein Atari STfm mit 512K RAM.

Mein erster PC kam mit zwölf, mit Windows 3.11, und von dort ging es durch die ganze Reihe: 95, 95b, 95c, 98, 98SE und dann Windows 2000.

Das war kein Benutzen von Software. Das war Herausfinden, was sich von einer Version zur nächsten änderte, was dabei kaputtging und wie man ein Ding zum Laufen bringt, das lieber nicht möchte.

DER WEG DURCH WINDOWS — 3.11 → 103.1195982000XPXP64-BitVista64-Bit764-Bit8.110

Meine erste Internetverbindung war ein 56k-Einwahlmodem bei Freeserve — einem der ersten kostenlosen Provider in Großbritannien. Ich wechselte zu ADSL, sobald es 2001 verfügbar war, über Demon Internet. Dann 2008 zu VDSL und schließlich 2017 zu FTTP bei Zen Internet — dort kam natives IPv6 an. Da fing das mit dem Netzwerk an, und es ist ein weiter Weg zu den 100GbE-Fabrics, die ich heute entwerfe. Aber die Neugier war dieselbe.

Das lokale Netz fing noch früher an, und rauer. Mein erstes LAN war 10BASE2 — dünnes Koaxkabel, BNC-Stecker und ein 50-Ohm-Abschlusswiderstand an jedem Ende, alle Maschinen an einem gemeinsamen 10-Mbit-Bus. Ich brachte zwei PCs darüber zum Reden und hängte einen 5-Port-Hub dazu, als mehr Maschinen auftauchten. Aus dem Hub wurde später ein Switch — ein echter Fortschritt, weil jeder Port seine eigene Kollisionsdomäne bekam, statt dass sich alles um gemeinsames Koax stritt. Danach kam WLAN, sobald es bezahlbar war: 802.11b mit 11 Mbit, auf Orinoco-Gold-PCMCIA-Karten in den Laptops. Koaxbus, gemeinsamer Hub, geswitchtes Ethernet, WLAN — jeden Schritt davon habe ich von Hand durchgearbeitet.

Ich habe außerdem vollständig unbeaufsichtigte Windows-XP-Installationen gebaut. Die nutzten die alten DriverPacks für die Treibereinbindung und eigene Skripte für automatische Anwendungsinstallationen. Von blankem Blech bis zum fertig konfigurierten System, ohne die Tastatur anzufassen. Das war Automatisierungsdenken Jahre bevor ich je von Ansible gehört hatte — und es lief auf Windows, nicht auf Linux.

Linux finden

Mit Linux habe ich mit fünfzehn angefangen, auf SuSE 6. Ich bin direkt auf die Distributionen zugegangen, bei denen man verstehen musste, was darunter passiert.

Über die Weihnachtsferien 2001 baute ich nach dem Buch Linux From Scratch ein komplettes System. Jedes Paket von Hand übersetzt. Jede Abhängigkeit verstanden. Jede Konfigurationsentscheidung bewusst getroffen.

2002 war ich bei Gentoo. Gentoo läuft nach demselben Prinzip: Du baust das ganze System aus dem Quelltext, du verstehst, was jedes USE-Flag tut, und wenn etwas kaputtgeht, weißt du genau, wo du nachsehen musst.

LINUX — DER WEG DURCH DIE DISTRIBUTIONENSuSE6–7.2MandrakeGentooUbuntuRHELFedora

Andere Plattformen erkunden

Ich bin nie bei einer Architektur geblieben.

Von 2001 bis 2007 hatte ich ein DEC-Alpha-System. Die Alpha war der 64-Bit-RISC-Prozessor der Digital Equipment Corporation, 1992 vorgestellt — eine echte 64-Bit-Maschine, mehr als ein Jahrzehnt bevor x86 2003 mit AMD64 nachzog. Sie lief unter Tru64 UNIX, OpenVMS, Windows NT und Linux, und eine Zeit lang war sie ungefähr das Schnellste, was man auf einen Schreibtisch stellen konnte. Über Diskussionen in der Community brachte ich USB und FireWire darauf zum Laufen. Ich habe sogar hinten einen PCMCIA-auf-ISA-Adapter eingebaut, damit dieselben PC Cards, die ich in den Laptops nutzte — die Orinoco Gold darunter —, auch im Alpha-Desktop liefen. Auf einer Plattform, auf der nichts garantiert funktionierte, keine Kleinigkeit.

Ich habe BeOS ausprobiert. Es ging Multithreading und Multimedia völlig anders an als alles andere zu der Zeit.

An der Universität haben ein Kumpel und ich ausrangierte Sun-SPARC-Workstations gerettet und Gentoo darauf gebaut. SPARC war die RISC-Architektur von Sun Microsystems, 1987 eingeführt — der Motor hinter den Sun-Workstations und -Servern, die in den Neunzigern einen großen Teil der Unix-Welt trugen, meist unter Solaris. Ein aus dem Quelltext gebautes Linux auf dieser Hardware zum Laufen zu bringen, war der ganze Sinn der Sache. Warum auch nicht, wenn die Technik dasteht und man wissen will, ob es geht.

Ich habe außerdem Linux auf ARM und ARM64 gebaut und damit gearbeitet, auf Raspberry Pis und Odroids. Und ich habe Windows auf ARM64 gefahren.

Fährst du dasselbe Betriebssystem auf x86, Alpha, SPARC, ARM und ARM64, dann folgen dir die Annahmen von der einen Plattform nicht auf die nächste — Bytereihenfolge, Ausrichtung, Seitengrößen, Treiberunterstützung und Eigenheiten der Toolchain verschieben sich alle unter dir. Das zählt heute mehr denn je, wo ARM64 im Rechenzentrum neben x86 sitzt, und es ist das Denken, das einen gemischt-architektonischen Ceph- oder Proxmox-Bestand ehrlich hält.

Mit IPv6 habe ich ebenfalls früh experimentiert. Ich hatte Zugang zum 6bone — dem experimentellen IPv6-Testnetz. Das 6bone war ein weltweites Testbett, das ab 1996 lief, um IPv6 zu entwickeln und auszurollen, bevor das produktive Internet dafür bereit war. Es trug IPv6 überwiegend über IPv4-Tunnel, nutzte den eigenen Adressbereich 3ffe::/16 und wurde am 6. Juni 2006 bewusst abgeschaltet, als natives IPv6 reif genug war, um allein zu stehen. Ich fuhr sowohl den Linux-IPv6-Stack als auch den IPv6-Stack von Microsoft Research für Windows XP. Ich habe das Ganze durch. Angefangen mit IPv6-in-IPv4-Tunneln. Weiter zu 6to4 (RFC 3056) für automatisches Tunneln. Dann zu vollem nativem IPv6, als ich zu einem anständigen Provider wechselte — Zen Internet. Die meisten Leute haben IPv6 nicht angefasst, bis ihr Arbeitgeber sie dazu zwang. Ich hatte zu dem Zeitpunkt schon jeden Übergangsmechanismus durch, auf Linux und auf Windows, weil ich verstehen wollte, wohin sich Netzwerk entwickelt. Deshalb fühlt sich IPv6 heute natürlich an und nicht wie etwas nachträglich Angeschraubtes. Inzwischen laufen neunzig Prozent meines Verkehrs über natives IPv6. Ich nutze eine Browser-Erweiterung namens IPvFoo, die mir zeigt, was jede Verbindung verwendet und ob Seiten gemischte Protokolle oder nur IPv4 ausliefern. Alte Gewohnheit — ich sehe lieber, was wirklich passiert, statt es anzunehmen.

IPv6 — ZWEI JAHRZEHNTE, EXPERIMENT BIS KRITISCHVom Teststack zu Hause zur Produktion in nationalem Maßstab6bone — das experimentelle IPv6-TestbettLinux- und Microsoft-Research-IPv6-Stack nebeneinander gefahrenIPv6-in-IPv4-TunnelIPv6 über das IPv4-Internet, von Hand konfiguriert6to4 (RFC 3056)Automatisches Tunneln — kein Broker zu pflegenNatives IPv6Ende zu Ende zu Hause über FTTP · Zen Internet · 2017Nominet — kritische nationale InfrastrukturIPv6 produktiv für die .uk-Registry · F5-Loadbalancer über IPv4 und IPv6Heute laufen rund 90 % meines Verkehrs über natives IPv6.

Lernen durch Machen

Alles, was ich technisch kann, habe ich gelernt, indem ich es versucht habe. Dinge gebaut, kaputtgemacht, herausgefunden warum, wieder gebaut.

Das Studium war Business Studies und Computer Network Engineering an der Sheffield Hallam, und es gab mir das eine, was Selbststudium nicht gibt — wie ein Unternehmen tatsächlich funktioniert, wie aus einer technischen Entscheidung ein kaufmännisches Ergebnis wird und wie man ein System nach dem Problem denkt, das es für den löst, der dafür bezahlt. Das hat jede Rolle seitdem geprägt.

Die technischen Fähigkeiten kamen aber vom Tun, nicht vom Studieren. Produktionsprobleme kommen nicht mit einer Leseliste. Etwas von Grund auf durchdenken zu können ist mehr wert als ein Zertifikat an der Wand, und es läuft nicht ab.

Woher Open Source kommt

Als Microsofts Führung Open Source Anfang der 2000er als „einen Krebs“ bezeichnete, steckte ich schon tief in Linux. Systeme von Grund auf gebaut. Gentoo gefahren. In Communities beigetragen.

Diese Art von Feindseligkeit gegenüber Leuten, die Wissen teilen und gemeinsam etwas bauen, hat mich nicht abgeschreckt. Sie hat mich tiefer hineingetrieben. Wenn die Antwort einer Firma auf gemeinschaftliche Entwicklung ist, sie eine Krankheit zu nennen, sagt das mehr über die Firma als über die Software. Ich bin tiefer in Open Source eingestiegen und habe es zu meiner ersten Wahl gemacht, statt diese Haltung zu stützen.

Über die Jahre hat das Praktische das Prinzipielle eingeholt. Proprietäre Plattformen funktionieren gut genug, bis der Hersteller die Lizenzierung ändert, gekauft wird oder entscheidet, dass dein Anwendungsfall es nicht wert ist. Dann sitzt du fest. Deine Daten, deine Abläufe und das Know-how deines Teams hängen alle an einer Plattform, die du nicht mehr kontrollierst. Die Übernahme von VMware durch Broadcom ist das jüngste und sichtbarste Beispiel, aber bei weitem nicht das einzige.

Dasselbe Denken gilt für die Cloud. Frag, was du eigentlich mietest, und die Antwort lautet: Kapazität, die du hättest besitzen können, auf einem Zähler, der nie stehenbleibt. Die versprochenen Vorteile — Beweglichkeit, Elastizität, weniger Verwaltung — kommen selten in der Form an, die der Pitch beschrieb, und die Kosten wachsen Jahr für Jahr auf eine Weise, wie es eigene Technik nicht tut. Als solches konnte ich jedes Mal, wenn mich jemand darum gebeten hat, zeigen, dass Open Source auf gut entworfener Hardware mehr Gegenwert, mehr Kontrolle und weniger Überraschungen bringt. Keine modische Position. Aber eine, die ich mit Zahlen unterlegen kann.

Eine Laufbahn aufbauen

Meine Laufbahn begann 2005 bei einem Präzisionsgießerei-Hersteller in Worksop. IT-Techniker, Teil eines kleinen Teams, Betreuung von rund fünfzig Nutzern.

Diese erste Rolle deckte eine ordentliche Breite ab. Pflege des Manusoft-ERP-Systems und der Dokumentenarchivierung. Linux- und Windows-2003-Serveradministration. Crystal-Reports-Entwicklung für Entscheidungen in Produktion und Instandhaltung. TK-Anlagenadministration. CAD/CAM-Systemintegration und Verwaltung computergestützter Roboterfertigung. Beschaffung von Hard- und Software. Schulung von Endanwendern und Support direkt am Arbeitsplatz.

Ich habe außerdem vom ersten Tag an automatisiert. Ich habe das Active Directory der Firma aktualisiert und VB-Skripte geschrieben, die je nach Gruppenmitgliedschaft automatisch Laufwerke verbanden, Drucker zuwiesen und Software verteilten. Das war 2006 — richtige Infrastrukturautomatisierung in meiner ersten beruflichen Rolle.

Das ist Fertigungs-IT. Wenn die Linie wegen etwas stillsteht, das du betreust, lernst du schnell, dass Zuverlässigkeit keine Vorliebe ist, und die Leute neben der Maschine sagen dir das auch selbst. Es war auch das erste Mal, dass ich Linux und Windows im selben Gebäude beruflich gefahren habe, und das ist seitdem das Muster geblieben.

Von dort ging ich in den technischen Support an vorderster Linie. First und Second Level, an einem eigenen Desk für einen großen multinationalen Kunden. Windows-Desktops, Active Directory, Exchange 2007, Cisco VPN, Cisco Call Manager, ITIL-basierte Ticketverwaltung auf Remedy. Diese ITIL-Disziplin — Change Management, Problem Management, strukturierte Prozesse — ist mir seitdem in jede Rolle gefolgt. Ich habe früh auch die Linux- und Windows-Welt überbrückt — Services for Unix konfiguriert und Citrix-Zugriffe auf Unix-NFS-Freigaben gelöst.

Selbst an diesem Desk habe ich über die Stellenbeschreibung hinaus gebaut. Ich schrieb eine Schnittstelle, die Benutzerkonten direkt aus den HR-Daten in Agresso anlegte und deaktivierte — das Active-Directory-Konto, die Gruppenmitgliedschaften, die Office-Communicator-Konfiguration, das Exchange-Postfach und die Aliase. Das ist Systemintegration von einem First-Level-Platz aus, was so nicht in der Stellenbezeichnung stand.

Einer der Kunden, die ich an diesem Desk betreute, hat mich später beim nächsten Unternehmen eingestellt.

Als Nächstes ein global tätiges Kommunikationsunternehmen, ICT und Sicherheit. Dort fing die Anwendungsentwicklung richtig an. In zweieinhalb Jahren habe ich sechs eigenständige interne Systeme gebaut oder daran mitgearbeitet. Ein eigenes webbasiertes Angebotswerkzeug. Auftragsschnittstellen zwischen Salesforce und Agresso. Ein SharePoint-Stammdatenkatalog, gespeist aus Salesforce und Agresso. Ein eigenes Web-Projektmanagementsystem mit Schnittstellen zu MSPE und Agresso für die Finanzverarbeitung. Und eine Migration von einer angepassten Salesforce-Service-Cloud-Anwendung zu ServiceNow mit vollständiger ITIL-Prozessumsetzung. Ich schrieb außerdem SQL-Schnittstellenarchitektur für Unternehmensanwendungen und optimierte die MS-SQL-Leistung. Ich administrierte IIS und Windows Server 2008 Terminal Services und verantwortete das Unternehmensdatenmodell. Verzeichnisdienste — Active Directory und LDAP — wurden hier zu einer Kernkompetenz, die mich durch jede spätere Rolle begleitet hat.

Ich habe außerdem ein landesweites Windows-7-Ablöseprogramm geleitet und die gesamte britische Nutzerschaft in drei Wochen auf neue HP-Technik gebracht, wobei 95 % angaben, überhaupt keine Störung ihrer Arbeit erlebt zu haben. Drei Wochen ist die Art Zahl, die nur herauskommt, wenn die Vorbereitung ordentlich gemacht wurde, und die Vorbereitung ist die unglamouröse Hälfte, nach der hinterher niemand fragt.

Dann kam die Führung. Ein Halbleiter-Designhaus mit einem kleinen Team von Ingenieuren über mehrere Länder verteilt. Das zog mehrere Fäden auf einmal zusammen. Ich entwickelte auf der Force.com-Plattform — Trigger, Visualforce-Seiten, eigene Controller —, um Financial-Force-Buchhaltung und PSA-Systeme weltweit zu integrieren. Gleichzeitig baute ich zwei getrennte PXE-Boot-HPC-Cluster. Einen für die britisch-europäische Entwicklung und einen für die chinesische. Beide mit Red Hat und NFS-Root-Dateisystemen, um konsistente, zu 100 % wiederholbare plattenlose Rechenfarmen zu schaffen. Ich setzte ZFS auf Linux mit Dell-PowerVault-Technik für vereinheitlichten Storage ein. Ich ersetzte alte isolierte Sicherheitsumgebungen durch ein Windows Server Active Directory mit nativem Kerberos und LDAP für Single Sign-on über Linux und Windows. Ich stabilisierte die internationale Anbindung, indem ich ein einheitliches Netz mit OpenVPN-Tunneln durch schwierige Betriebsbedingungen nach China baute.

Einen guten Teil dieser Rolle war ich der Einzige, der das alles abdeckte: die Linux-Rechenfarmen, den Windows-Support, die Salesforce-Entwicklung und den Nutzersupport über mehrere Zeitzonen, unter SoC-Design-Lasten auf fortgeschrittenen Technologieknoten. Einer der Ingenieure, die mir berichteten, ist später Salesforce-Entwickler geworden, und das zähle ich als das bessere Ergebnis dieser Jahre.

Danach ein richtiger Tiefgang in Linux. Third-Level-Support bei Pulsant, einem Cloud- und Hosting-Anbieter, quer über den ganzen Stack. RHEL, CentOS, Ubuntu. MySQL-Clustering mit Galera, MongoDB-Sharding, HAProxy mit SNI und SSL-Terminierung, Apache, PostgreSQL, PHP-FPM-Tuning für leistungsstarken E-Commerce, Postfix-Mail, BIND und PowerDNS für DNS-Hosting, Varnish fürs Web-Caching, Squid fürs Proxy-Caching. IPTables, IPset und Cisco ASA für Firewalling und DoS-Schutz. Linux-Serveroptimierung für Netzwerk und Storage. CPanel-Fehlersuche, Entwicklung von SolarWinds-Monitoring-Templates und New-Relic-Administration. Alles auf VMware 5.5 mit vCloud Director darunter.

Es war auch nicht nur Support. Ich habe dort ein Galera-Datenbankreplikationsprodukt entworfen und es vom Konzept über den Prototyp bis zu einem Dienst gebracht, für den Kunden bezahlt haben. Das war keine Laborübung. Es wurde an echten Lasten echter zahlender Kunden gebaut und bewiesen, und das gibt ein Hosting-Anbieter nicht leichtfertig aus der Hand.

Third Level lehrt dich, was es heißt, die letzte Eskalationsstufe zu sein. Wenn es bei dir ankommt, wird es hinter dir niemand mehr richten.

Dann Nominet — die Registry hinter jedem .uk-Domainnamen. DNS in nationalem Maßstab. Die Infrastruktur muss vierundzwanzig Stunden am Tag bombenfest sein, jeden Tag, ohne Ausfallzeit und mit Rufbereitschaft außerhalb der Geschäftszeiten. VMware 5.5 und 6, HP-3par-Storage mit Fibre-Channel-Zoning auf Brocade, RHEL 6 und 7 mit Puppet verwaltet, F5-Loadbalancer über IPv4 und IPv6, Postfix-Mail und ein Zabbix-Aufbau, den ich als Ersatz für das alternde VMware-Hyperic-Monitoring gebaut habe. Ich habe außerdem ServiceNow eingeführt und angepasst, mit Workflows, Anwendungsverteilung und Linux-Knotenerkennung für Konfigurationsverwaltung und Inventar. Ich habe geholfen, Prozesse für die Auslagerung des Service Desks außerhalb der Geschäftszeiten zu entwerfen und aufzubauen, um die Rufbereitschaft zu entlasten.

Bei Nominet war ich am Ende der Erste, den man fragte, ob es um Linux, Unix, ServiceNow oder etwas ging, das niemand einordnen konnte, und ich habe Wert darauf gelegt, mit etwas zurückzukommen, das funktionierte, statt mit etwas, das gut klang. Das ist die Art Ort, an dem du lernst, dass der langweilige, disziplinierte Umgang mit Infrastruktur der ist, der den Kontakt mit einem Dienstagmorgen überlebt.

Nach Nominet ging ich quer durch Infrastruktur und Hosting. VMware 6.7, Zerto für Disaster Recovery, Dell-Compellent- und Nexsan-Storage mit Brocade-Fibre-Channel-Zoning, Citrix Cloud mit FSLogix-Profilverwaltung neben Azure. Ich habe auch dort Zabbix-Monitoring eingeführt und die Templates und Skripte von Grund auf entworfen.

Dann Einzelhandel. Ein kleines Team geführt, die VMware-6.7-Administration von einem Dritten wieder ins Haus geholt, Zabbix-Monitoring ausgerollt (wieder einmal als Ersatz für einen gescheiterten Versuch), die Betriebssystemverteilung um PXE und Chocolatey neu gebaut, das Netz mit Fortinet-Technik erneuert und die Hardwarebeschaffung geordnet.

Dann die Rolle, die alles verändert hat. Beim UK Centre for Ecology & Hydrology habe ich das Science-Computing-Team geleitet — vier direkt Berichtende — und die Infrastruktur von Grund auf neu gebaut. Eine private Cloud aus 7 Proxmox-VE-Knoten mit hyperkonvergentem Ceph-Storage auf doppeltem 100Gb-Switching. Ein HPC-Cluster aus 8 Knoten auf HDR InfiniBand mit Slurm, mit SR-IOV für den VM-Zugriff auf die Fabric und EasyBuild für Softwarebauten. Migration von GPFS zu reinem NVMe-Ceph-Storage. Ansible mit Netbox als Wahrheitsquelle für alles — Patchverwaltung, Kontrolle der Konfigurationsdrift, Anbindungen an Cloudflare, PowerDNS und Active Directory. OSPF-Dynamikrouting für die Cloud-Netze. Lokale Repository-Spiegel für maximale Verteilgeschwindigkeit und Konsistenz. Neuausrollung der HPC-Umgebung von CentOS 7 auf Rocky 9. Cloudflare für DNS (samt DNSSEC), DDoS-Schutz und Zero-Trust-Fernzugriff. Dazu gehörte die Migration von 25 autoritativen DNS-Zonen von selbst gehostetem BIND 9 zu Cloudflare in zwei Arbeitstagen. Mehrere Registries wurden aktualisiert, und das Ganze wurde mit Ansible und Let’s Encrypt integriert.

Alles auf Open-Source-Werkzeugen, knappes Budget, bewusst so gebaut, dass wir der Broadcom-und-VMware-Lizenzfalle entgehen, bevor sie zuschnappte. Das hat die Diskussion erledigt. Open-Source-Infrastruktur in dieser Größenordnung ist nicht bloß machbar — sie ist besser, und ich habe den Cluster und die Rechnungen, um das zu sagen.

Die andere Hälfte dieser Aufgabe waren die vier Leute im Team. Wissenschaftlern ist egal, wie der Storage heißt. Ihnen zählt, ob der Job heute Nacht durchläuft, und ob die Person, die sie fragen, die Antwort erklären kann, ohne dass sie sich dumm vorkommen.

Wie alles zusammenkommt

Der Wechsel in den Presales bei croit war kein Richtungswechsel. Es war alles, was an einem Ort zusammenlief.

Fertigungs-ITZuverlässigkeit ist Pflicht, wenn die Produktion daran hängtSupport an vorderster LinieZuhören, erklären und geduldig bleiben lernenAnwendungsentwicklungSysteme bauen, die echte Geschäftsprobleme lösenGlobale IT-LeitungDie Technik tragen und die Leute trotzdem entwickelnTiefes Linux-EngineeringDie letzte Eskalationsstufe — dahinter ruft niemand mehr anKritisches DNS bei NominetInfrastruktur und Disziplin in nationalem MaßstabInfrastruktur & HostingVMware, Storage und Disaster Recovery im großen MaßstabScience Computing (UKCEH)Neu gebaut auf Proxmox VE + Ceph + HPC, durchweg Open SourcePresales bei croitDas System entwerfen, es verteidigen, ehrlich dazu stehen

Fertigungs-IT hat mir beigebracht, dass Zuverlässigkeit in dem Moment aufhört, eine Vorliebe zu sein, in dem die Produktion daran hängt. Support an vorderster Linie hat mir beigebracht, zuerst zuzuhören. Anwendungsentwicklung hat mir beigebracht, Systeme zu bauen, die ein Geschäftsproblem lösen und nicht ein interessantes. Ein globales Team zu führen hat mir beigebracht, die technische Last zu tragen und trotzdem die Leute um mich herum zu entwickeln, was schwerer ist als jede Hälfte für sich. Third-Level-Linux hat mir gezeigt, wie sich die letzte Eskalationsstufe anfühlt. Zwanzig Jahre Windows und Linux nebeneinander haben mir gezeigt, wie sich Plattformen unter Last wirklich verhalten, im Unterschied dazu, wie es im Datenblatt steht. VMware, das ich ab 2008 in fast jeder Rolle gefahren habe, hat mir gezeigt, wie Unternehmensvirtualisierung im Großen aussieht — und was passiert, wenn sich der kaufmännische Boden unter einer Plattform verschiebt, auf der der ganze Bestand sitzt. Storage und Netzwerk haben mir gezeigt, wo die harten Probleme wohnen. Sicherheit zieht sich durch alles, von Firewalls und VPNs damals bis zu DNSSEC, Zero Trust und Härtung heute. Nominet hat mir Disziplin beigebracht.

Setz das alles zusammen, und du bekommst Presales. Du entwirfst das System, dann verteidigst du den Entwurf, und du bleibst ehrlich dabei, was es nicht können wird, weil gleich jemand auf dein Wort hin echtes Geld ausgibt.

Bei croit heißt das, mit Häusern in Europa und Asien-Pazifik zu arbeiten, die ihre Virtualisierung und ihren Storage neu denken. Die Gespräche drehen sich meist darum, VMware zugunsten von Proxmox VE mit Ceph zu verlassen. Die Lasten, die dabei herüberkommen, sind überwiegend Windows, die plattformübergreifende Erfahrung ist also nicht von gestern. Sie ist das, was ich heute mache.

Woran mir liegt, ist die Ehrlichkeit. Was ich jemandem vorlege, muss das sein, was in seinem Gebäude funktioniert, in seiner Größenordnung, mit den Beschränkungen, die er tatsächlich hat, und wenn seine vorhandene Technik den Job schon größtenteils erledigt, dann sage ich ihm genau das.

DER STACK, DEN ICH HEUTE ENTWERFE & BAUEAutomatisierung & WahrheitsquelleAnsible · NetBox · Let's EncryptComputeProxmox VE — KVM-Maschinen + LXC-ContainerStorageCeph — RBD-Block · CephFS · reines NVMeNetzwerk25/100GbE-Fabric · BGP / OSPF · natives IPv6FundamentOpen Source, auf Hardware, die dir gehört

Storage

Storage war immer wieder die Stelle, an der die schwersten Probleme saßen. Das war kein bewusster Karriereplan — es hat sich einfach so ergeben.

Die Faszination fing früh an. In den Neunzigern träumte ich von Iomega-Zip- und -Jaz-Disks — 100 MB und dann ein ganzes Gigabyte auf einer einzigen Wechselkassette, als die Disketten, die alle anderen herumreichten, gerade 1,44 MB fassten. Das war teure Technik, also blieben sie jahrelang ein Wunsch statt ein Besitz. Als ich endlich ein USB-Zip-Laufwerk hatte, waren gerade die USB-Sticks aufgetaucht — und das Format, das ich so lange gewollt hatte, war schon auf dem Weg hinaus. Eine frühe Lektion darüber, wie schnell sich Storage bewegt und wie schnell aus dem Muss von heute der Schubladenkram von morgen wird.

Optisch gehörte zur selben Geschichte. 1998 hatte ich ein HP-CD-RW-Laufwerk mit vierfacher Geschwindigkeit, und es war ein Prachtstück. Es konnte Scheiben lesen und wiederbeschreiben, die spätere, schnellere Laufwerke schlicht verweigerten — so verdiente es sich seinen Platz als Rettungslaufwerk noch lange, nachdem es hätte in Rente gehen sollen.

Angefangen hat es beim Anschluss. Ich habe mit Storage-Hardware quer durch alles gearbeitet. IDE, mehrere SCSI-Generationen, SATA, SAS und NVMe auf der direkt angeschlossenen Seite. ATA over Ethernet und iSCSI auf der Netzwerkseite. HP 3par, Dell Compellent, Dell PowerVault, Nexsan — jedes mit eigenen Eigenheiten und Fehlerbildern.

Von dort ging es den Stack hinauf. Clustered LVM hat mir gezeigt, wie sich gemeinsamer Storage verhält, wenn mehrere Knoten gleichzeitig zugreifen müssen — und was passiert, wenn Locking und Fencing nicht stimmen. ZFS hat mir gezeigt, was passiert, wenn man Datenintegrität auf Dateisystemebene wirklich durchdenkt. GPFS hat mir parallele Dateisysteme im großen Maßstab gezeigt. Ceph hat mir gezeigt, wie sich verteilte Systeme im Fehlerfall anders verhalten.

Über die Jahre wurde aus „der Mensch, der auch den Storage macht“ „der Mensch, den man ruft, wenn der Storage ordentlich entworfen werden muss“.

Netzwerk

Netzwerk war von Anfang an dabei. Es ist keine Nebenfähigkeit — es ist eine Kernfähigkeit. TCP/IP, DHCP und DNS spannen sich über jede einzelne Rolle, die ich ab McKenna hatte.

Bei Nominet zu arbeiten hieß, an der Infrastruktur hinter der britischen Domain-Registry zu arbeiten. Das ist DNS in nationalem Maßstab. Benennung, Auflösung, Delegierung und die Erwartung, dass es jedes Mal funktioniert.

Ich habe autoritative Zonen auf BIND 9 gefahren, DNSSEC konfiguriert, F5-Loadbalancer für IPv4 und IPv6 aufgesetzt und später DNS-Bestände mit API-Automatisierung und Let’s-Encrypt-Anbindung zu Cloudflare migriert. Ich habe PXE-Boot-DNS-Infrastruktur für Clusterausrollungen in Großbritannien und in China gebaut. Ich verstehe DNS von beiden Seiten. Selbst gehostet, wo dir jeder Fehler gehört. Und verwaltet, wo du einem Anbieter vertraust und dieses Vertrauen durch Monitoring prüfen musst.

Über DNS hinaus zieht sich Netzwerk durch jede Rolle, die ich hatte. VLANs, Bonding, LACP, Fibre-Channel-Zoning mit Brocade, Firewalling mit Fortinet und Cisco ASA, IPTables und IPset. 25GbE- und 100GbE-Fabric-Entwurf, BGP, OSPF-Dynamikrouting, MTU-Verwaltung, IPv6-Architektur. VPN-Tunnel — von OpenVPN über schwierige internationale Strecken bis zu WireGuard und cloudflared für modernen sicheren Zugang. Samba war ebenfalls über mehrere Rollen hinweg eine berufliche Fähigkeit und hat Linux-Dateifreigaben und Windows-Domänenintegration überbrückt, lange bevor ich die AD-Implementierung im Alpha-Stadium getestet habe.

Ein Ceph-Cluster ist eine Netzwerkanwendung. Die Leistungsgrenze des Storage wird vom Netz darunter gesetzt. Die Fehlerbilder sind Netzwerkfehlerbilder. Das lernst du nicht aus einem Lehrbuch. Das lernst du beim Fehlersuchen um zwei Uhr nachts.

Linux

Ich arbeite seit über zwei Jahrzehnten quer durch die RHEL-, Debian-, SUSE- und Fedora-Familien. Beruflich heißt das RHEL und CentOS für laufende Dienste, Ubuntu für Anwendungshosting, Rocky für HPC sowie Gentoo und Fedora für den privaten Gebrauch. Ich habe LinkedIns Linux-Skill-Assessment bestanden.

Die Tiefe kam von Problemen, für die es keine Stack-Overflow-Antwort gibt, und dort lernt man das PCI-Subsystem richtig statt vom Hörensagen: IOMMU-Gruppen, ACS, VFIO, SR-IOV, Resizable BAR und was die DMA-Übersetzung dich still und leise kostet, und Kernel-Bootparameter als Stellschrauben, die das Verhalten der Maschine ändern, statt als Liste zum Abschreiben aus einem Wiki, weil irgendein Blog schrieb, es habe dort geholfen.

Storage- und Virtualisierungsprobleme lassen sich fast immer auf eine Schicht zurückführen, in die niemand geschaut hat. Dort wohnt mein Linux-Wissen.

Windows

Linux ist heute das, womit ich meine Zeit verbringe, aber die Windows-Seite ist genauso real und war in jedem Job dabei, den ich hatte. Windows Server, Active Directory, LDAP, Exchange, IIS, Microsoft SQL Server. Nichts davon ist eine Altlast, die ich abgelegt hätte.

Es zählt auf Gastebene, und dort hören die meisten auf zu schauen. Wenn eine Windows-Last auf KVM läuft, ist der Mensch, der dir sagen kann, wie sich dieser Gast unter einer bestimmten CPU-Topologie verhält, und eine Leistungsbeschwerde auf einen Microsoft-Patch statt auf den Hypervisor zurückführen kann, der Mensch, der Jahre auf beiden Seiten des Zauns verbracht hat. Die meisten VM-Leistungsdebatten, die ich erlebt habe, wurden dadurch gewonnen, dass jemand den Gast kannte, nicht den Wirt.

Die Leute, die ich betreut habe, reichen von Professoren und Vorständen bis zum Team, das sich um die Gebäude kümmert. Die Aufgabe ist jedes Mal dieselbe. Herausfinden, was sie wirklich brauchen, es zum Laufen bringen und es so erklären, dass sie sich für die Frage nicht dumm vorkommen.

VMware

VMware ist die Plattform, mit der ich beruflich groß geworden bin, über sieben Rollen ab 2008, und ich habe den ganzen Stack davon gefahren: ESXi, vCenter, vSAN, vSphere-Clustering, vMotion. Ich weiß, was sie gut kann. Ich weiß, wo nicht. Und ich habe zugesehen, wie die Broadcom-Übernahme die kaufmännische Wirklichkeit unter Häusern neu geschrieben hat, die ihren gesamten Bestand darauf gebaut hatten, was etwas anderes ist, als darüber zu lesen.

Du kannst niemandem von einer Plattform herunterhelfen, auf der du nie richtig gearbeitet hast. Als solches kann ich ihnen sagen, was sie aufgeben, was sie bekommen und welcher Teil der Migration schlimmer wird, als man ihnen erzählt hat.

Automatisierung

Automatisierungsdenken begann 2006 in meiner ersten beruflichen Rolle. VB-Skripte bei McKenna, um AD-Laufwerksverbindungen, Druckerzuweisung und Softwareverteilung zu automatisieren. Dann HR-zu-AD-Provisionierungswerkzeuge bei BT Engage IT. Dann PXE-Boot-Systeme für plattenlose Rechencluster bei Sondrel. Dann Puppet bei Nominet. Dann Chocolatey-Paketierung und PXE-Neuaufbau bei einem Einzelhändler. Dann ServiceNow-Workflow-Anpassung über mehrere Rollen hinweg.

Heute ist es Ansible mit Netbox als Wahrheitsquelle. Nicht weil sie gerade angesagt sind, sondern weil Infrastruktur, die sich nicht aus Code neu bauen lässt, keine Infrastruktur ist, der du trauen kannst.

Dokumentation ist dasselbe Argument. Wissen, das nur in jemandes Kopf lebt, ist ein einzelner Ausfallpunkt, und es geht um fünf Uhr mit allen anderen aus dem Gebäude. Genau wie eine Platte ohne Redundanz dahinter, und mit demselben Ernst zu behandeln.

Monitoring

Mein Monitoring-Hintergrund begann mit SolarWinds bei Pulsant, wo ich Monitoring über den Hosting-Bestand in der Breite gefahren habe. Zabbix kam später und hat sich eine eigene Erwähnung verdient, weil ich es seitdem fast überall eingeführt habe. Angefangen hat es bei Nominet, wo ich die Ausschreibung und die Tests geleitet und uns dann auf Zabbix umgestellt habe, um das alternde VMware-Hyperic-Setup abzulösen, und es gewann, weil es wirklich verständlich war und nicht bloß ein weiteres Ding mit Nagios darunter. Danach habe ich es bei einer Hosting- und Infrastrukturplattform von Grund auf eingeführt, im Einzelhandel einen gescheiterten Versuch ersetzt und damit bei UKCEH einen HPC-Cluster aus 8 Knoten überwacht.

Jedes Mal habe ich die Monitoring-Templates selbst entworfen und die Skripte selbst geschrieben. Als ich 2018 die Zabbix-Prüfungen zum Specialist und Professional ablegte, hatte ich es schon seit Jahren ausgerollt.

Kommunikation

Arbeit in kritischer Infrastruktur bringt dir bei, präzise zu sein. Arbeit im Presales bringt dir bei, klar zu sein. Das eine hängt mit dem anderen zusammen, ist aber nicht dasselbe.

Präzise zu sein bringt nichts, wenn die zuhörende Person dem Gedankengang nicht folgen kann, also musste ich lernen, dieselbe Erklärung zweimal zu liefern: einmal für die Ingenieurin, die die CRUSH-Map sehen will, und einmal für die Person, die unterschreiben muss, warum das Budget die Zahl ist, die es ist. Ich vereinfache nichts ins Kindliche. Ich mache nur jeden Schritt im Gedankengang sichtbar und lasse sie mich unterbrechen, wo sie wollen.

Jahre mit Endanwendern haben mir eine andere Art Geduld beigebracht. Die Leute, die sich für die Klügsten im Raum halten, verhalten sich meist am hilflosesten. Die, die mit „ich bin nicht sehr technisch“ anfangen, hören in der Regel zu, folgen den Schritten und haben es in zehn Minuten erledigt. Und die, die dir sagen, sie wüssten genau, was sie tun, haben es in der Regel schlimmer gemacht, bevor sie zum Hörer gegriffen haben.

Der Hintergrund in Geschäftssystemen hilft hier mehr, als man denkt, weil ich immer in beide Richtungen übersetzen musste. SQL-Architektur für eine Betriebsleiterin, ein Storage-Entwurf für einen CTO, oder neben jemandem am eigenen Schreibtisch sitzen und ihm das zeigen, was ihm nie gezeigt wurde. Jedes Mal dieselbe Fähigkeit.

Community

Wissen zu teilen zieht sich durch die ganze Laufbahn.

Ich war in den Gentoo-Foren aktiv, als ich Systeme aus dem Quelltext baute und verstehen musste, warum eine USE-Flag-Kombination einen Compile zerlegte. Ich habe in den Samba-Foren beigetragen, als ich Dateifreigabe- und Domänenintegrationsprobleme zwischen Linux und Windows durchgearbeitet habe. Das ging über bloßes Fragen hinaus. Ich habe einen Samba-basierten Active-Directory-Domänencontroller gebaut, während die AD-Unterstützung noch im Alpha-Stadium war. Ich habe ihn gegen Windows 2000, XP und Vista getestet und in die Community zurückgemeldet.

Heute bin ich aktiver Beiträger in den Proxmox-Community-Foren als DamienDye. Ich helfe bei NVMe-Passthrough-Leistung, Windows-VM-Tuning, Ceph-Fehlersuche und Cluster-Netzwerk.

Die Technologien ändern sich. Das Prinzip nicht. Wenn ich ein Problem gelöst habe, ist nichts damit gewonnen, darauf sitzen zu bleiben, und irgendwer wird in sechs Monaten um zwei Uhr nachts froh sein, dass es aufgeschrieben ist.

Ich habe außerdem die Angewohnheit, mich tiefer in Probleme einzugraben, als die Aufgabe streng genommen verlangt. Ich habe eine selbstgebaute Platine für NVMe-Power-Loss-Protection entworfen, weil ich genau verstehen wollte, warum FTL-Korruption auf Hardwareebene entsteht. Ich habe Protokolle für selbst gehostete E-Mail untersucht, weil ich JMAP vom RFC an verstehen wollte, statt einem Anbieter einfach zu vertrauen. Ich habe diesen Blog gebaut, weil ordentliches Aufschreiben die Art ist, wie man die Lücken im eigenen Verständnis findet.

Community abseits der Tastatur

Nicht alles davon waren Foren.

2018 war ich einer der Gründer der Longford Park Community Association in Banbury, in der Siedlung, in der ich wohne. Vier Bauabschnitte, ein Gemeindezentrum, das in den Plänen stand, und nichts, was es hätte betreiben können. Also hat eine Handvoll Anwohner etwas aufgebaut.

Ich habe zuerst den IT-Teil gemacht, weil das war, was ich zu geben hatte. Die Domain lpca.org.uk ging im Januar 2018 online, und dahinter habe ich die Website, die Mailsysteme und die Ausschusslisten gebaut und die Datenschutzerklärung geschrieben.

Ich war von Anfang an im Ausschuss und von Dezember 2018 bis Februar 2020 dessen Vorsitzender. Vierzehn Monate, und die Dinge, auf die es wirklich ankam, sind alle in dieser Zeit gelandet. Wir haben es am 11. Februar 2019 als gemeinnützig registrieren lassen, Nummer 1181953. Ich habe den gewerblichen Mietvertrag für das Gebäude geregelt. Dann haben wir das Zentrum eröffnet.

Dafür war der Vorsitz da. Nicht für Tagesordnungen und Protokolle. Dafür, ein Gebäude zu öffnen, in das ein paar hundert Haushalte hineingehen können. Freiwillige aus der Nachbarschaft betreiben es bis heute über die Bauabschnitte 1 bis 4 — drei Räume, eine Küche und ein Parkplatz, stundenweise vermietet an jeden aus der Siedlung, der sie haben will.

Ehrenamtliche Ausschüsse laufen auf gutem Willen, und guter Wille ist kein Governance-Modell. Also habe ich Leute an der Satzung gemessen, mich selbst eingeschlossen. Ich habe gefragt, warum wir von außen rekrutieren, wenn die Satzung sagt, bindet die Anwohner ein, und ich habe einen Rundbrief gestoppt, der in jedem Spam-Ordner der Siedlung gelandet wäre. Nicht um schwierig zu sein. Eine Anwohnervereinigung, die die Anwohner nicht erreichen kann, ist an der einzigen Aufgabe, die sie hat, bereits gescheitert, und ich habe die Links zur Behebung gleich mit der Beschwerde geschickt.

Das Zentrum ist weiterhin offen, und ich bin nicht mehr im Ausschuss, und so gehört es sich. Was nur funktioniert, solange du danebenstehst und es hältst, war nie ordentlich gebaut.

Diese Seite

Dieser Blog ist eine statische Hugo-Seite mit dem Theme PaperMod. Er läuft auf Cloudflare Workers und liefert die gebaute Seite als statische Assets aus.

Ich schreibe hier über die Infrastruktur, mit der ich täglich arbeite: Proxmox VE, Ceph, Ansible, Netbox, Zertifikate und was ich mir in der Woche sonst angesehen habe. Es ist zum Benutzen geschrieben, mit den Befehlen und den Zahlen darin, denn ein Beitrag, dem du an der Tastatur nicht folgen kannst, ist Dekoration. Kein Marketinggerede. Wenn etwas raue Kanten hat, sagt der Beitrag das.

Kontakt

Du findest mich auf LinkedIn oder in den Proxmox-Foren.

Wenn du Ceph oder Proxmox für dein Haus anschaust und ein ordentliches Gespräch darüber willst statt eines Pitches, schreib mir. Bring die Last, die Beschränkungen und das Budget mit, das du tatsächlich hast. Ich sage dir, was es leisten wird, was nicht, und wenn die ehrliche Antwort lautet, dass du behalten solltest, was du hast, und es ordentlich konfigurieren, dann bekommst du auch diese Antwort.