Senior Staff Software Engineer, Site Reliability Engineering, Privacy, Security and Safety - Google Careers
- Anstellung
- Vollzeit
- Pensum
- 100%
- Ort
- Zürich
- Sprachen
- Englisch, Englisch
- Erstmals ausgeschrieben
info_outline
X In den meisten Fällen erfordert diese Position persönliche Vorstellungsgespräche als Teil des Einstellungsprozesses.
Mindestanforderungen: ###
- Bachelor-Abschluss in Informatik, einem verwandten Bereich oder gleichwertiger praktischer Erfahrung.
- 8 Jahre Erfahrung in der Softwareentwicklung in einer oder mehreren Programmiersprachen.
- 4 Jahre Erfahrung in der Leitung von Projekten und in der Bereitstellung technischer Führung.
- 3 Jahre Erfahrung im Entwurf, der Analyse und der Fehlersuche in verteilten Systemen.
Bevorzugte Qualifikationen: ###
- Master-Abschluss in Informatik oder Ingenieurwesen.
- Erfahrung mit groß angelegten verteilten Systemen.
- Erfahrung mit Generative AI Agent und Machine Learning.
- Erfahrung im Bereich Trust and Safety Operations.
Über den Job ###
Site Reliability Engineering (SRE) kombiniert Software- und Systemtechnik, um groß angelegte, massiv verteilte und fehlertolerante Systeme aufzubauen und zu betreiben. SRE stellt sicher, dass die Dienste von Google Cloud – sowohl unsere intern kritischen als auch unsere extern sichtbaren Systeme – über Zuverlässigkeit, eine den Kundenbedürfnissen angemessene Verfügbarkeit und eine schnelle Verbesserungsrate verfügen. Zusätzlich werden SREs die Kapazität und Leistung unserer Systeme stets wachsam im Auge behalten.
Ein Großteil unserer Softwareentwicklung konzentriert sich auf die Optimierung bestehender Systeme, den Aufbau von Infrastruktur und die Eliminierung von Arbeit durch Automatisierung. Im SRE-Team haben Sie die Möglichkeit, die komplexen Herausforderungen der Skalierung zu bewältigen, die für Google Cloud einzigartig sind, während Sie Ihr Fachwissen in den Bereichen Codierung, Algorithmen, Komplexitätsanalyse und groß angelegtes Systemdesign einsetzen. Die SRE-Kultur der intellektuellen Neugier, Problemlösung und Offenheit ist der Schlüssel zu ihrem Erfolg. Unsere Organisation bringt Menschen mit einer Vielzahl von Hintergründen, Erfahrungen und Perspektiven zusammen. Wir ermutigen sie zur Zusammenarbeit, zum großen Denken und zum Eingehen von Risiken in einem schuldunabhängigen Umfeld. Wir fördern die Selbstverwaltung bei der Arbeit an bedeutungsvollen Projekten, während wir gleichzeitig danach streben, ein Umfeld zu schaffen, das die Unterstützung und das Mentoring bietet, die zum Lernen und Wachsen erforderlich sind.
PSS SRE bietet das unverzichtbare Sicherheits- und Compliance-Fundament für Googles Infrastruktur. Im KI-Zeitalter ist die Führung des PSS UTL entscheidend für die Navigation an Googles sich entwickelnder technologischer Grenze – Pionierarbeit bei Produktionssicherheits-Baselines für schnelles agentisches Skalieren, Eindämmung von Schadensradien (blast-radii) für nicht-deterministische KI-Pipelines und Skalierung lokalisierter Autorisierung, um Googles nächste Welle der KI-Innovation und des Geschäftswachstums freizusetzen. Der PSS UTL wird auch sicherstellen, dass PSS SRE ein agentic native SRE-Team ist.
Hinter allem, was unsere Nutzer online sehen, steht die Architektur, die vom Technical Infrastructure Team aufgebaut wurde, um den Betrieb aufrechtzuerhalten. Von der Entwicklung und Wartung unserer Rechenzentren bis hin zum Aufbau der nächsten Generation von Google-Plattformen ermöglichen wir das Produktportfolio von Google. Wir sind stolz darauf, die Ingenieure unserer Ingenieure zu sein, und lieben es, Garantien zu verletzen, indem wir Dinge auseinandernehmen, damit wir sie wieder aufbauen können. Wir halten unsere Netzwerke am Laufen und stellen sicher, dass unsere Nutzer die bestmögliche und schnellste Erfahrung machen.
Verantwortlichkeiten ###
- Beteiligung an und Verbesserung des gesamten Lebenszyklus von Diensten von der Konzeption und dem Entwurf bis hin zur Bereitstellung, dem Betrieb und der Verfeinerung.
- Unterstützung von Diensten vor deren Livegang durch Aktivitäten wie Beratung zum Systemdesign, Entwicklung von Softwareplattformen und Frameworks, Kapazitätsplanung und Launch-Reviews.
- Wartung von Diensten nach deren Livegang durch Messung und Überwachung von Verfügbarkeit, Latenz und allgemeiner Systemgesundheit.
- Nachhaltige Skalierung von Systemen durch Mechanismen wie Automatisierung und Weiterentwicklung von Systemen durch das Vorantreiben von Änderungen, die Zuverlässigkeit und Geschwindigkeit verbessern.
- Durchführung von nachhaltiger Incident Response und schuldunabhängigen Postmortems.
Automatisch aus dem Original übersetzt.
Ausgeschrieben heute