<div class="content-intro"><p>Elastic, the Search AI Company, enables everyone to find the answers they need in real time, using all their data, at scale — unleashing the potential of businesses and people. The Elastic Search AI Platform, used by more than 50% of the Fortune 500, brings together the precision of search and the intelligence of AI to enable everyone to accelerate the results that matter. By taking advantage of all structured and unstructured data — securing and protecting private information more effectively — Elastic’s complete, cloud-based solutions for search, security, and observability help organizations deliver on the promise of AI.</p></div><h3><strong>What is The Role</strong></h3> <p><span data-offset-key="aui03-0-0"><span data-text="true">We are looking for a skilled </span></span><span data-offset-key="aui03-0-1"><span data-text="true">QA & Evaluation Engineer</span></span><span data-offset-key="aui03-0-2"><span data-text="true"> to join our team. The role blends strategic QA </span></span><span id="popover-trigger-:r16:" class="chakra-text css-1j6t0d7"><span data-offset-key="aui03-1-0"><span data-text="true">leadership</span></span></span><span data-offset-key="aui03-2-0"><span data-text="true"> with hands-on technical validation and structured evaluation to safeguard the accuracy, reliability, compliance, and ethical use of AI models. You will partner across IT and Engineering teams to identify, design, implement and run robust testing frameworks and evaluation rubrics for a portfolio of GenAI solutions that will be used across our organization.</span></span></p> <h3><strong>What You Will Be Doing</strong></h3> <ul> <li class="public-DraftStyleDefault-unorderedListItem public-DraftStyleDefault-reset public-DraftStyleDefault-depth0 public-DraftStyleDefault-listLTR" data-block="true" data-editor="buloa" data-offset-key="f3lou-0-0"> <div class="public-DraftStyleDefault-block public-DraftStyleDefault-ltr" data-offset-key="f3lou-0-0"><span data-offset-key="f3lou-0-0"><span data-text="true">Be a primary contributor to our AI strategy, helping validate and test AI infrastructure, custom solutions and third-party SaaS offerings.</span></span></div> </li> <li class="public-DraftStyleDefault-unorderedListItem public-DraftStyleDefault-depth0 public-DraftStyleDefault-listLTR" data-block="true" data-editor="buloa" data-offset-key="8cnqf-0-0"> <div class="public-DraftStyleDefault-block public-DraftStyleDefault-ltr" data-offset-key="8cnqf-0-0"><span data-offset-key="8cnqf-0-0"><span data-text="true">Test Strategy & Execution:</span></span><span data-offset-key="8cnqf-0-1"><span data-text="true"> Design and implement comprehensive test strategies for AI/ML systems, including accuracy, bias, robustness, and regression testing.</span></span></div> </li> <li class="public-DraftStyleDefault-unorderedListItem public-DraftStyleDefault-depth0 public-DraftStyleDefault-listLTR" data-block="true" data-editor="buloa" data-offset-key="c2pit-0-0"> <div class="public-DraftStyleDefault-block public-DraftStyleDefault-ltr" data-offset-key="c2pit-0-0"><span id="popover-trigger-:r18:" class="chakra-text css-bcri66"><span data-offset-key="c2pit-0-0"><span data-text="true">Rubric-Based Evaluation:</span></span><span data-offset-key="c2pit-0-1"><span data-text="true"> Design and implement self-contained evaluation tasks, including prompts, supporting files, and detailed grading rubrics to assess AI performance on functional workflows.</span></span></span></div> </li> <li class="public-DraftStyleDefault-unorderedListItem public-DraftStyleDefault-depth0 public-DraftStyleDefault-listLTR" data-block="true" data-editor="buloa" data-offset-key="efgoo-0-0"> <div class="public-DraftStyleDefault-block public-DraftStyleDefault-ltr" data-offset-key="efgoo-0-0"><span data-offset-key="efgoo-0-0"><span data-text="true">Automation & CI/CD:</span></span><span data-offset-key="efgoo-0-1"><span data-text="true"> Automate validation suites for agentic/multi-agent systems, integration testing, and CI/CD pipelines for ML models.</span></span></div> </li> <li class="public-DraftStyleDefault-unorderedListItem public-DraftStyleDefault-depth0 public-DraftStyleDefault-listLTR" data-block="true" data-editor="buloa" data-offset-key="85rrd-0-0"> <div class="public-DraftStyleDefault-block public-DraftStyleDefault-ltr" data-offset-key="85rrd-0-0"><span data-offset-key="85rrd-0-0"><span data-text="true">Data Validation:</span></span><span data-offset-key="85rrd-0-1"><span data-text="true"> Validate that AI/ML models are consuming </span></span><span id="popover-trigger-:r1a:" class="chakra-text css-8zk7oi"><span data-offset-key="85rrd-1-0"><span data-text="true">accurate</span></span></span><span data-offset-key="85rrd-2-0"><span data-text="true">, authorized, and properly structured data sources; ensuring data quality across training and inference.</span></span></div> </li> <li class="public-DraftStyleDefault-unorderedListItem public-DraftStyleDefault-depth0 public-DraftStyleDefault-listLTR" data-block="true" data-editor="buloa" data-offset-key="3s3na-0-0"> <div class="public-DraftStyleDefault-block public-DraftStyleDefault-ltr" data-offset-key="3s3na-0-0"><span data-offset-key="3s3na-0-0"><span data-text="true">Observation & Reporting:</span></span><span data-offset-key="3s3na-0-1"><span data-text="true"> Meticulously observe and document AI agent behaviors, producing crisp, precise summaries and reports on model performance and hallucinations.</span></span></div> </li> <li class="public-DraftStyleDefault-unorderedListItem public-DraftStyleDefault-depth0 public-DraftStyleDefault-listLTR" data-block="true" data-editor="buloa" data-offset-key="6f6ip-0-0"> <div class="public-DraftStyleDefault-block public-DraftStyleDefault-ltr" data-offset-key="6f6ip-0-0"><span data-offset-key="6f6ip-0-0"><span data-text="true">Output Grounding:</span></span><span data-offset-key="6f6ip-0-1"><span data-text="true"> Validate prompt engineering outputs from a data accuracy standpoint, ensuring responses are grounded in verified data sources.</span></span></div> </li> <li class="public-DraftStyleDefault-unorderedListItem public-DraftStyleDefault-depth0 public-DraftStyleDefault-listLTR" data-block="true" data-editor="buloa" data-offset-key="an458-0-0"> <div class="public-DraftStyleDefault-block public-DraftStyleDefault-ltr" data-offset-key="an458-0-0"><span data-offset-key="an458-0-0"><span data-text="true">Refinement & Iteration:</span></span><span data-offset-key="an458-0-1"><span data-text="true"> Iterate and refine evaluation tasks and rubrics based on feedback and team collaboration to ensure robust benchmarking methodologies.</span></span></div> </li> <li class="public-DraftStyleDefault-unorderedListItem public-DraftStyleDefault-depth0 public-DraftStyleDefault-listLTR" data-block="true" data-editor="buloa" data-offset-key="faiua-0-0"> <div class="public-DraftStyleDefault-block public-DraftStyleDefault-ltr" data-offset-key="faiua-0-0"><span data-offset-key="faiua-0-0"><span data-text="true">Security & Governance:</span></span><span data-offset-key="faiua-0-1"><span data-text="true"> Ensure all AI data sources and structures meet governance, regulatory, and compliance standards, while implementing best practices for security and data privacy.</span></span></div> </li> <li class="public-DraftStyleDefault-unorderedListItem public-DraftStyleDefault-depth0 public-DraftStyleDefault-listLTR" data-block="true" data-editor="buloa" data-offset-key="13iu-0-0"> <div class="public-DraftStyleDefault-block public-DraftStyleDefault-ltr" data-offset-key="13iu-0-0"><span data-offset-key="13iu-0-0"><span data-text="true">Collaborate with teams from different areas. These areas include IT Engineering, IT Operations, Data & Integrations, PMO, CRM, Risk & Compliance, and business technology.</span></span></div> </li> <li class="public-DraftStyleDefault-unorderedListItem public-DraftStyleDefault-depth0 public-DraftStyleDefault-listLTR" data-block="true" data-editor="buloa" data-offset-key="btibm-0-0"> <div class="public-DraftStyleDefault-block public-DraftStyleDefault-ltr" data-offset-key="btibm-0-0"><span data-offset-key="btibm-0-0"><span data-text="true">Stay current on the latest work in AI and make technical recommendations to the organization.</span></span></div> </li> </ul> <h3>What You Bring</h3> <ul> <li class="public-DraftStyleDefault-unorderedListItem public-DraftStyleDefault-reset public-DraftStyleDefault-depth0 public-DraftStyleDefault-listLTR" data-block="true" data-editor="buloa" data-offset-key="b6g1s-0-0"> <div class="public-DraftStyleDefault-block public-DraftStyleDefault-ltr" data-offset-key="b6g1s-0-0"><span data-offset-key="b6g1s-0-0"><span data-text="true">Proficiency in Python, TypeScript, or other programming languages used in AI and test automation.</span></span></div> </li> <li class="public-DraftStyleDefault-unorderedListItem public-DraftStyleDefault-depth0 public-DraftStyleDefault-listLTR" data-block="true" data-editor="buloa" data-offset-key="5sqe6-0-0"> <div class="public-DraftStyleDefault-block public-DraftStyleDefault-ltr" data-offset-key="5sqe6-0-0"><span data-offset-key="5sqe6-0-0"><span data-text="true">Proven skill in designing or applying rubric-based evaluation, grading against set criteria, or building structured scoring frameworks.</span></span></div> </li> <li class="public-DraftStyleDefault-unorderedListItem public-DraftStyleDefault-depth0 public-DraftStyleDefault-listLTR" data-block="true" data-editor="qov7" data-offset-key="57viv-0-0"> <div class="public-DraftStyleDefault-block public-DraftStyleDefault-ltr" data-offset-key="57viv-0-0"><span data-offset-key="57viv-0-0"><span data-text="true">Direct experience with LLM evaluation frameworks and benchmarking tools such as LangSmith, Confident AI, etc.</span></span></div> </li> <li class="public-DraftStyleDefault-unorderedListItem public-DraftStyleDefault-depth0 public-DraftStyleDefault-listLTR" data-block="true" data-editor="buloa" data-offset-key="57viv-0-0"> <div class="public-DraftStyleDefault-block public-DraftStyleDefault-ltr" data-offset-key="57viv-0-0"><span data-offset-key="57viv-0-0"><span data-text="true">Knowledge of the GenAI stack and solutions including Retrieval Augmented Generation (RAG).</span></span></div> </li> <li class="public-DraftStyleDefault-unorderedListItem pu