
Evaluating AI Search: A Practical Framework for Augmented AI Systems
Julia Neagu and Deanna Emery of Quotient AI join Maitar Asher of Tavily to explain how production AI-search agents can be evaluated despite changing web content and unpredictable user queries. They contrast static SimpleQA and HotpotQA benchmarks with dynamically generated, multi-source evaluation datasets, describe a LangGraph-based generation workflow…
Julia Neagu · Deanna Emery · Maitar Asher
Safety and governance · Evals · RAG, context, and search