Staff Software Engineer, Site Reliability Engineering Connections - Google Careers
- Anstellung
- Vollzeit
- Pensum
- 100%
- Ort
- Zürich
- Sprachen
- Englisch, Englisch
- Erstmals ausgeschrieben
info_outline
X In den meisten Fällen erfordert diese Position persönliche Vorstellungsgespräche als Teil des Einstellungsprozesses.
Mindestqualifikationen: ###
- Bachelor-Abschluss in Informatik, einem verwandten Bereich oder gleichwertige praktische Erfahrung.
- 8 Jahre Erfahrung in der Softwareentwicklung in einer oder mehreren Programmiersprachen.
- 3 Jahre Erfahrung in der Leitung von Projekten.
- 3 Jahre Erfahrung im Entwurf, der Analyse und der Fehlersuche in verteilten Systemen.
Bevorzugte Qualifikationen: ###
- Master-Abschluss in Informatik oder Ingenieurwesen.
- Erfahrung mit verteilten und parallelen Systemen.
- Starke Präferenz für konsistente und gemeinsame Lösungen gegenüber maßgeschneiderten Lösungen.
- Systematischer Problemlösungsansatz, gepaart mit Kommunikationsfähigkeit sowie einem Sinn für Eigenverantwortung und Tatendrang.
Über den Job ###
Site Reliability Engineering (SRE) kombiniert Software- und System Engineering, um groß angelegte, massiv verteilte, fehlertolerante Systeme aufzubauen und zu betreiben. SRE stellt sicher, dass die Dienste von Google Cloud – sowohl unsere intern kritischen als auch unsere extern sichtbaren Systeme – Zuverlässigkeit, eine den Kundenbedürfnissen angemessene Verfügbarkeit und eine schnelle Verbesserungsrate aufweisen. Zusätzlich werden SREs unsere Systemkapazität und -leistung stets aufmerksam im Auge behalten.
Ein Großteil unserer Softwareentwicklung konzentriert sich auf die Optimierung bestehender Systeme, den Aufbau von Infrastruktur und die Eliminierung von Arbeit durch Automatisierung. Im SRE-Team haben Sie die Möglichkeit, die komplexen Herausforderungen der Skalierung zu bewältigen, die für Google Cloud einzigartig sind, während Sie Ihr Fachwissen in den Bereichen Codierung, Algorithmen, Komplexitätsanalyse und groß angelegtes Systemdesign einsetzen. Die SRE-Kultur der intellektuellen Neugier, der Problemlösung und der Offenheit ist der Schlüssel zu ihrem Erfolg. Unsere Organisation bringt Menschen mit einer Vielzahl von Hintergründen, Erfahrungen und Perspektiven zusammen. Wir ermutigen sie zur Zusammenarbeit, zum großen Denken und zum Eingehen von Risiken in einem schuldunabhängigen Umfeld. Wir fördern die Selbstverwaltung bei der Arbeit an bedeutungsvollen Projekten, während wir gleichzeitig danach streben, ein Umfeld zu schaffen, das die notwendige Unterstützung und Mentorenschaft zum Lernen und Wachsen bietet.
In dieser Rolle werden Sie Teil des Teams sein, das dafür verantwortlich ist, Wege zu finden, um die Zuverlässigkeit, Skalierbarkeit und Effizienz dieser und anderer Systeme zu verbessern, die täglich Milliarden von Menschen auf der ganzen Welt nutzen und ihr Leben verbessern.
Hinter allem, was unsere Nutzer online sehen, steht die Architektur, die vom Technical Infrastructure Team aufgebaut wurde, um den Betrieb aufrechtzuerhalten. Von der Entwicklung und Wartung unserer Rechenzentren bis hin zum Aufbau der nächsten Generation von Google-Plattformen – wir machen das Produktportfolio von Google erst möglich. Wir sind stolz darauf, die Ingenieure unserer Ingenieure zu sein, und lieben es, Garantien zu verletzen, indem wir Dinge auseinandernehmen, um sie neu aufbauen zu können. Wir halten unsere Netzwerke am Laufen und stellen sicher, dass unsere Nutzer die bestmögliche und schnellste Erfahrung machen.
Verantwortlichkeiten ###
- Mitwirkung an und Verbesserung des gesamten Lebenszyklus von Diensten – von der Konzeption und dem Entwurf über die Bereitstellung, den Betrieb bis hin zur Verfeinerung.
- Unterstützung von Diensten vor deren Livegang durch Aktivitäten wie Beratung zum Systemdesign, Entwicklung von Softwareplattformen und -frameworks, Kapazitätsplanung und Launch-Reviews.
- Wartung von Diensten nach deren Livegang durch Messung und Überwachung von Verfügbarkeit, Latenz und allgemeiner Systemgesundheit.
- Nachhaltige Skalierung von Systemen durch Mechanismen wie Automatisierung und Weiterentwicklung von Systemen durch das Vorantreiben von Änderungen, die die Zuverlässigkeit und Geschwindigkeit verbessern.
- Durchführung einer nachhaltigen Incident Response und schuldunabhängiger Postmortems.
Automatisch aus dem Original übersetzt.
Ausgeschrieben vor 2 Tagen