Maximum of 25 job preferences reached.
Top SRE Engineer Jobs in San Francisco Bay Area, CA
Software
Lead SRE to define SRE strategy, architecture, and roadmap; design and operate containerized, compliant cloud environments; build observability, incident management, automation, and developer platform capabilities; mentor SRE team and collaborate with security, compliance, and product teams to ensure reliability at scale.
Top Skills:
AWSAws MarketplaceAzureAzure MarketplaceGCPGoogle Cloud MarketplaceGrafanaKubernetesPrometheusTerraform
Artificial Intelligence • Other • Sales • Software
The role involves designing and advancing infrastructure for the engineering team, ensuring the reliability of Kubernetes clusters, automating operations, and building machine learning infrastructure.
Top Skills:
ArgoAWSAzureCloudFormationFluxGithub ActionsGoGCPKubernetesPostgresPythonTerraform
Agency • Information Technology
Lead SRE role designing and maintaining CI/CD pipelines (GitHub Actions), containerized deployments (Docker, Kubernetes, AKS, Helm), web/mobile app releases, observability, automated testing, and DevOps best practices across cloud environments with cross-functional collaboration and regulatory compliance.
Top Skills:
AksAndroidAzure Application InsightsAzure Log AnalyticsAzure MonitorBashBranchingDockerDocker ComposeGitGit HooksGithub ActionsGoogle PlayHelmHerokuiOSIos App StoreJavaKubernetesNpmPowershellPull RequestsPythonSonarqubeVeracodeVercel
Artificial Intelligence • Insurance • Software • Automation
The Staff Site Reliability Engineer will build and scale infrastructure for Assured's platform, automate delivery, enhance observability, and lead mentoring initiatives.
Top Skills:
AWSKubernetesPostgresTerraform
Healthtech • Social Impact • Software
Own the operational lifecycle of cloud-native data infrastructure: design and automate reliable deployments, observability, incident response, SLIs/SLOs, autoscaling and IaC, and improve platform efficiency and data freshness across GKE and Cloud Run.
Top Skills:
BashBigQueryCloud BuildCloud MonitoringCloud RunDatadogDockerGCPGithub ActionsGkeGoGrafanaJIRAKubernetesPrometheusPulumiPythonSentrySlackSnykSonarqubeTerraform
Software
Own and improve platform performance, reliability, and deployment automation. Manage cloud infrastructure, implement IaC, monitor systems with observability tools, provide operational support for distributed applications, and integrate production learnings into development workflows.
Top Skills:
Aiops ToolingAws Elastic ContainersAws RdsAws S3Claude CodeClaude CoworkDatadogHarness EngineeringInfrastructure As CodeKubernetesLlmsPrompt EngineeringRigorSplunk
Cloud • Security • Software • Cybersecurity
Lead reliability for a serverless AI inference platform: own observability and SLO/SLI frameworks, build automation and tooling, manage incidents and on-call, define deployment safety (canaries, rollbacks), influence architecture with product teams, and mentor other SREs.
Top Skills:
AutoscalingCi/CdContainer OrchestrationContainerizationGoGpu WorkloadsInfrastructure-As-CodeKubernetesModel ServingPythonResource Scheduling
Software
Senior SRE responsible for production reliability of Grafana Cloud databases (Mimir, Loki, Tempo, Pyroscope). Partner with product squads, define per-tenant SLOs, automate reliability practices, lead incident response/on-call, reduce toil, improve alerting, and influence design for scalability and operability.
Top Skills:
AWSAzureGCPGoGrafana CloudHelmJavaJsonnetKubernetesLinuxLokiMimirPyroscopePythonTempoTerraform
Artificial Intelligence • Healthtech • Information Technology • Software
As a Site Reliability Engineer, you will manage the production environment, focusing on infrastructure design, automation, and optimizing deployment pipelines to ensure high availability.
Top Skills:
HelmKafkaKubernetesPostgresPythonRedisTerraformTypescript
Artificial Intelligence • Machine Learning • Natural Language Processing • Software • Generative AI
The Site Reliability Engineer will develop, deploy, and operate AI infrastructure, focusing on high-performance and scalable machine learning systems using Kubernetes and cloud platforms.
Top Skills:
AWSAzureC++GCPGoKubernetesOci
Artificial Intelligence • Healthtech • Software • Telehealth
Design, deploy, and maintain AWS-hosted Kubernetes (EKS) infrastructure; build automation and AI-assisted runbooks; provide observability and incident response; ensure HIPAA-compliant, high-availability platform operations and mentor engineering teams.
Top Skills:
AWSBashDatadogEc2EksGitGithub ActionsGoHelmKubernetesPythonRdsS3Terraform
Other
The Senior Site Reliability Engineer at Juul Labs ensures operational stability and performance of hybrid cloud infrastructure, leads automation, and handles critical incidents.
Top Skills:
AWSBashCloudFormationGCPNutanixPowershellPythonTerraform
New
Track Smarter, Apply Better.
Ditch the spreadsheets. Organize your job search with our freeApplication Tracker.
Use For Free
Artificial Intelligence • Machine Learning • Biotech • Generative AI
The Site Reliability Engineer will manage digital infrastructure, ensuring access to compute resources, automating processes, and maintaining resource visibility for researchers.
Top Skills:
AnsibleDockerGrafanaKubernetesPrometheusPythonTailscaleTalos Linux
Big Data
Lead and operate cloud infrastructure and SRE practices, focusing on IaC, CI/CD, observability, incident response, and production-grade agentic AI/LLM systems. Architect, build, and run scalable platforms, drive reliability and SLOs, author runbooks/ADRs, mentor engineers, participate in on-call rotations, and reduce toil via automation and platform tooling.
Top Skills:
Agent OrchestrationAgentic AiAWSAzureDockerFluxcdGCPGithub ActionsGitopsGoGrafanaJavaJenkinsKubernetesLinuxLlmLlm GatewayLokiOpentofuPrometheusPythonSentrySignozTcp/IpTerraform
Digital Media • Social Media • Software • Sports
Lead the technical architecture and execution of migration to AWS, drive developer enablement, and automate infrastructure using code-first principles.
Top Skills:
Aws EksDatadogGithub ActionsGoIstioK6KubernetesNode.jsTerraform
Computer Vision • Machine Learning • Software
As a Site Reliability Engineer, ensure the reliability, performance, and scalability of Ditto's cloud infrastructure by developing observability solutions, leading incident management, and collaborating with product engineering teams.
Top Skills:
AWSAzureCDatadogGCPGoGrafanaHelmJavaKubernetesPrometheusRustTerraform
Artificial Intelligence • Fintech • Machine Learning • Natural Language Processing • Business Intelligence
Lead architecture and implementation of reliability platforms and SRE practices for a production SaaS. Build self-service reliability tooling, drive AIOps automation, advance observability (monitoring, tracing, profiling), lead incident response and postmortems, mentor engineers, and embed production readiness across teams to achieve 99.99% uptime.
Top Skills:
AWSAzureContinuous ProfilingDatadogDnsElkGCPGoGrafanaHttp/SKubernetesLoad BalancingOpentelemetryPrometheusPythonTcp/Ip
Database • Analytics
This role involves ensuring the reliability and performance of ClickHouse's cloud infrastructure, collaborating with engineering teams, incident management, and driving continuous improvement in service availability.
Top Skills:
AnsibleAWSAzureClickhouseDocker SwarmGoGoogle Cloud PlatformKubernetesPuppetPythonTerraform
Artificial Intelligence • Healthtech
The role involves improving operational reliability, managing production environments, enhancing observability, automating tasks, and collaborating with engineering teams, requiring 3-6 years of relevant experience.
Top Skills:
AWSBashDatadogKubernetesPrometheusPythonTerraform
Big Data • Cloud • Marketing Tech • Social Impact • Software
As a Senior Site Reliability Engineer, you will support product deployments, provide engineering support, maintain systems, and collaborate with teams globally to enhance infrastructure reliability.
Top Skills:
AWSCassandraCircleCIDynamoDBGCPGoJenkinsKubernetesNosql DatabasesPythonScylladbSinglestore DbTerraform
Software • Financial Services
Ensure platform reliability, performance, and availability by implementing observability, automating infrastructure, participating in on-call rotations and post-mortems, partnering with Product and Engineering, designing scalable architectures, mentoring teammates, and integrating Dynatrace with Azure DevOps and Jira while supporting compliance (SOC/FedRAMP).
Top Skills:
.NetAksAlpineAnsibleAppinsightsArm TemplatesAWSAzure DevopsBashBicepC#ChefCloudFormationDatadogDebianDynatraceEksGCPGitGitGksGrafanaHelmJIRAKubernetesLog AnalyticsAzureNew RelicOnestream SoftwareOpenshiftPowershellPowershell DscPrometheusPuppetPythonRest ApisSQLTerraformUbuntu
Fintech • Information Technology
As a Site Reliability Engineer at Alpaca, you will ensure system reliability and performance, troubleshoot issues, and collaborate with teams to design scalable features.
Top Skills:
GoGormLinuxPgxPostgresPrometheusSqlc
Healthtech
Design, scale, and operate secure AWS cloud infrastructure (EKS, IAM, RBAC); build and maintain IaC (Terraform/Terragrunt), GitHub Actions CI/CD, Datadog observability, and Python automation; document runbooks, participate in on-call rotations, postmortems, and Agile workflows to improve reliability and security.
Top Skills:
AWSDatadogEc2EksFargateGithub ActionsGithub Advanced SecurityHelmIamJIRAKubernetesLambdaPythonRbacSecrets ManagerServerlessTerraformTerragruntVpc
Gaming • Software
The Site Reliability Engineer will manage infrastructure stability and scalability, lead cloud migrations, and optimize performance across systems while mentoring team members.
Top Skills:
AnsibleAWSAzureBashChefCloudFormationDatadogDockerElk StackGCPGoGrafanaKubernetesPrometheusPuppetPythonTerraformUnix/Linux
Big Data • Analytics
Own production reliability for customer-facing radar and weather data services across Azure, colocation, and edge Kubernetes. Refactor C#/.NET services for multi-replica safety, design multi-cluster HA, operate self-managed Kubernetes, improve observability and automation, lead incident response and postmortems, and drive operational excellence and capacity planning.
Top Skills:
.NetAnsibleC#DatadogGpu-Enabled WorkloadsGrafanaHelmIstioKubernetesLokiLonghornAzureNatsOctopus DeployOpentelemetryPostgisPostgresPrometheusRabbitMQRancherRke2Terraform
Let Your Resume Do The Work
Upload your resume to be matched with jobs you're a great fit for.
Success! We'll use this to further personalize your experience.
Popular San Francisco Bay Area, CA Engineering Job Searches
Engineer Jobs in San Francisco Bay Area, CA
Software Engineer Jobs in San Francisco Bay Area, CA
Android Developer Jobs in San Francisco Bay Area, CA
C# Jobs in San Francisco Bay Area, CA
C++ Jobs in San Francisco Bay Area, CA
DevOps Jobs in San Francisco Bay Area, CA
Front End Developer Jobs in San Francisco Bay Area, CA
Golang Jobs in San Francisco Bay Area, CA
Hardware Engineer Jobs in San Francisco Bay Area, CA
iOS Developer Jobs in San Francisco Bay Area, CA
Java Developer Jobs in San Francisco Bay Area, CA
Javascript Jobs in San Francisco Bay Area, CA
Linux Jobs in San Francisco Bay Area, CA
Engineering Manager Jobs in San Francisco Bay Area, CA
.NET Developer Jobs in San Francisco Bay Area, CA
PHP Developer Jobs in San Francisco Bay Area, CA
Python Jobs in San Francisco Bay Area, CA
QA Jobs in San Francisco Bay Area, CA
Ruby Jobs in San Francisco Bay Area, CA
Salesforce Developer Jobs in San Francisco Bay Area, CA
Scala Jobs in San Francisco Bay Area, CA
Application Engineer Jobs in San Francisco, CA
Associate Software Engineer Jobs in San Francisco Bay Area, CA
Automation Engineer Jobs in San Francisco Bay Area, CA
AWS Engineer Jobs in San Francisco, CA
Backend Engineer Jobs in San Francisco, CA
Cloud Engineer Jobs in San Francisco Bay Area, CA
Controls Engineer Jobs in San Francisco Bay Area, CA
CTO Jobs in San Francisco Bay Area, CA
Design Engineer Jobs in San Francisco Bay Area, CA
DevOps Engineer Jobs in San Francisco Bay Area, CA
Director of Engineering Jobs in San Francisco, CA
Electrical Engineer Jobs in San Francisco Bay Area, CA
Embedded Software Engineer Jobs in San Francisco Bay Area, CA
Field Engineer Jobs in San Francisco Bay Area, CA
Firmware Engineer Jobs in San Francisco, CA
Full-Stack Engineer Jobs in San Francisco, CA
Game Engineer Jobs in San Francisco, CA
Infrastructure Engineer Jobs in San Francisco, CA
Manufacturing Engineer Jobs in San Francisco Bay Area, CA
Mechanical Design Engineer Jobs in San Francisco Bay Area, CA
Mechanical Engineer Jobs in San Francisco Bay Area, CA
Mechatronics Engineering Jobs in San Francisco Bay Area, CA
Network Engineer Jobs in San Francisco Bay Area, CA
Platform Engineer Jobs in San Francisco, CA
Process Engineer Jobs in San Francisco Bay Area, CA
Project Engineer Jobs in San Francisco Bay Area, CA
QA Engineer Jobs in San Francisco Bay Area, CA
Robotics Engineer Jobs in San Francisco Bay Area, CA
Security Engineer Jobs in San Francisco Bay Area, CA
Software Engineering Manager Jobs in San Francisco, CA
Software Test Engineer Jobs in San Francisco, CA
SRE Engineer Jobs in San Francisco Bay Area, CA
Systems Engineer Jobs in San Francisco Bay Area, CA
VP of Engineering Jobs in San Francisco, CA
All Filters
Total selected ()
No Results
No Results




































