[{"data":1,"prerenderedAt":571},["ShallowReactive",2],{"navigation_docs_en":3,"\u002Fen\u002Fai-engineering\u002Fevaluation-methodology\u002Fch03":141,"\u002Fen\u002Fai-engineering\u002Fevaluation-methodology\u002Fch03-surround":566},[4],{"title":5,"icon":6,"path":7,"stem":8,"children":9,"page":45},"AI Engineering",null,"\u002Fen\u002Fai-engineering","en\u002F1.ai-engineering",[10,46,77,114],{"title":11,"icon":12,"path":13,"stem":14,"children":15,"page":45},"Introduction to Building AI Applications with Foundation Models","i-lucide-brain-circuit","\u002Fen\u002Fai-engineering\u002Fintro","en\u002F1.ai-engineering\u002F1.intro",[16,20,25,30,35,40],{"title":11,"path":17,"stem":18,"icon":19},"\u002Fen\u002Fai-engineering\u002Fintro\u002Fch01","en\u002F1.ai-engineering\u002F1.intro\u002Fch01","i-lucide-sparkles",{"title":21,"path":22,"stem":23,"icon":24},"The Rise of AI Engineering","\u002Fen\u002Fai-engineering\u002Fintro\u002Fch011-the-rise-of-ai-engineering","en\u002F1.ai-engineering\u002F1.intro\u002Fch011-the-rise-of-ai-engineering","i-lucide-history",{"title":26,"path":27,"stem":28,"icon":29},"Foundation Model Use Cases","\u002Fen\u002Fai-engineering\u002Fintro\u002Fch012-foundation-model-use-cases","en\u002F1.ai-engineering\u002F1.intro\u002Fch012-foundation-model-use-cases","i-lucide-layout-grid",{"title":31,"path":32,"stem":33,"icon":34},"Planning AI Applications","\u002Fen\u002Fai-engineering\u002Fintro\u002Fch013-planning-ai-applications","en\u002F1.ai-engineering\u002F1.intro\u002Fch013-planning-ai-applications","i-lucide-clipboard-list",{"title":36,"path":37,"stem":38,"icon":39},"The AI Engineering Stack","\u002Fen\u002Fai-engineering\u002Fintro\u002Fch014-the-ai-engineering-stack","en\u002F1.ai-engineering\u002F1.intro\u002Fch014-the-ai-engineering-stack","i-lucide-layers",{"title":41,"path":42,"stem":43,"icon":44},"Summary","\u002Fen\u002Fai-engineering\u002Fintro\u002Fch015-summary","en\u002F1.ai-engineering\u002F1.intro\u002Fch015-summary","i-lucide-flag",false,{"title":47,"icon":6,"path":48,"stem":49,"children":50,"page":45},"Understanding Foundation Models","\u002Fen\u002Fai-engineering\u002Funderstanding-foundation-models","en\u002F1.ai-engineering\u002F2.understanding-foundation-models",[51,54,59,64,69,74],{"title":47,"path":52,"stem":53,"icon":12},"\u002Fen\u002Fai-engineering\u002Funderstanding-foundation-models\u002Fch02","en\u002F1.ai-engineering\u002F2.understanding-foundation-models\u002Fch02",{"title":55,"path":56,"stem":57,"icon":58},"Training Data","\u002Fen\u002Fai-engineering\u002Funderstanding-foundation-models\u002Fch02-1-training-data","en\u002F1.ai-engineering\u002F2.understanding-foundation-models\u002Fch02-1-training-data","i-lucide-database",{"title":60,"path":61,"stem":62,"icon":63},"Modeling","\u002Fen\u002Fai-engineering\u002Funderstanding-foundation-models\u002Fch02-2-modeling","en\u002F1.ai-engineering\u002F2.understanding-foundation-models\u002Fch02-2-modeling","i-lucide-network",{"title":65,"path":66,"stem":67,"icon":68},"Post-Training","\u002Fen\u002Fai-engineering\u002Funderstanding-foundation-models\u002Fch02-3-post-training","en\u002F1.ai-engineering\u002F2.understanding-foundation-models\u002Fch02-3-post-training","i-lucide-sliders-horizontal",{"title":70,"path":71,"stem":72,"icon":73},"Sampling","\u002Fen\u002Fai-engineering\u002Funderstanding-foundation-models\u002Fch02-4-sampling","en\u002F1.ai-engineering\u002F2.understanding-foundation-models\u002Fch02-4-sampling","i-lucide-dices",{"title":41,"path":75,"stem":76,"icon":44},"\u002Fen\u002Fai-engineering\u002Funderstanding-foundation-models\u002Fch02-5-summary","en\u002F1.ai-engineering\u002F2.understanding-foundation-models\u002Fch02-5-summary",{"title":78,"path":79,"stem":80,"children":81,"page":45},"Evaluation Methodology","\u002Fen\u002Fai-engineering\u002Fevaluation-methodology","en\u002F1.ai-engineering\u002F3.evaluation-methodology",[82,86,91,96,101,106,111],{"title":78,"path":83,"stem":84,"icon":85},"\u002Fen\u002Fai-engineering\u002Fevaluation-methodology\u002Fch03","en\u002F1.ai-engineering\u002F3.evaluation-methodology\u002Fch03","i-lucide-clipboard-check",{"title":87,"path":88,"stem":89,"icon":90},"Challenges of Evaluating Foundation Models","\u002Fen\u002Fai-engineering\u002Fevaluation-methodology\u002Fch03-1-challenges-of-evaluating-foundation-models","en\u002F1.ai-engineering\u002F3.evaluation-methodology\u002Fch03-1-challenges-of-evaluating-foundation-models","i-lucide-shield-alert",{"title":92,"path":93,"stem":94,"icon":95},"Understanding Language Modeling Metrics","\u002Fen\u002Fai-engineering\u002Fevaluation-methodology\u002Fch03-2-understanding-language-modeling-metrics","en\u002F1.ai-engineering\u002F3.evaluation-methodology\u002Fch03-2-understanding-language-modeling-metrics","i-lucide-sigma",{"title":97,"path":98,"stem":99,"icon":100},"Exact Evaluation","\u002Fen\u002Fai-engineering\u002Fevaluation-methodology\u002Fch03-3-exact-evaluation","en\u002F1.ai-engineering\u002F3.evaluation-methodology\u002Fch03-3-exact-evaluation","i-lucide-check-check",{"title":102,"path":103,"stem":104,"icon":105},"AI as a Judge","\u002Fen\u002Fai-engineering\u002Fevaluation-methodology\u002Fch03-4-ai-as-a-judge","en\u002F1.ai-engineering\u002F3.evaluation-methodology\u002Fch03-4-ai-as-a-judge","i-lucide-scale",{"title":107,"path":108,"stem":109,"icon":110},"Ranking Models with Comparative Evaluation","\u002Fen\u002Fai-engineering\u002Fevaluation-methodology\u002Fch03-5-ranking-models-with-comparative-evaluation","en\u002F1.ai-engineering\u002F3.evaluation-methodology\u002Fch03-5-ranking-models-with-comparative-evaluation","i-lucide-trophy",{"title":41,"path":112,"stem":113,"icon":44},"\u002Fen\u002Fai-engineering\u002Fevaluation-methodology\u002Fch03-6-summary","en\u002F1.ai-engineering\u002F3.evaluation-methodology\u002Fch03-6-summary",{"title":115,"icon":116,"path":117,"stem":118,"children":119,"page":45},"Evaluate AI Systems","i-lucide-binary","\u002Fen\u002Fai-engineering\u002Fevaluate-ai-systems","en\u002F1.ai-engineering\u002F4.evaluate-ai-systems",[120,123,128,133,138],{"title":115,"path":121,"stem":122,"icon":116},"\u002Fen\u002Fai-engineering\u002Fevaluate-ai-systems\u002Fch04","en\u002F1.ai-engineering\u002F4.evaluate-ai-systems\u002Fch04",{"title":124,"path":125,"stem":126,"icon":127},"Evaluation Criteria","\u002Fen\u002Fai-engineering\u002Fevaluate-ai-systems\u002Fch04-1-evaluation-criteria","en\u002F1.ai-engineering\u002F4.evaluate-ai-systems\u002Fch04-1-evaluation-criteria","i-lucide-check-circle-2",{"title":129,"path":130,"stem":131,"icon":132},"Model Selection","\u002Fen\u002Fai-engineering\u002Fevaluate-ai-systems\u002Fch04-2-model-selection","en\u002F1.ai-engineering\u002F4.evaluate-ai-systems\u002Fch04-2-model-selection","i-lucide-cpu",{"title":134,"path":135,"stem":136,"icon":137},"Design Your Evaluation Pipeline","\u002Fen\u002Fai-engineering\u002Fevaluate-ai-systems\u002Fch04-3-design-your-evaluation-pipeline","en\u002F1.ai-engineering\u002F4.evaluate-ai-systems\u002Fch04-3-design-your-evaluation-pipeline","i-lucide-workflow",{"title":41,"path":139,"stem":140,"icon":44},"\u002Fen\u002Fai-engineering\u002Fevaluate-ai-systems\u002Fch04-4-summary","en\u002F1.ai-engineering\u002F4.evaluate-ai-systems\u002Fch04-4-summary",{"id":142,"title":78,"body":143,"description":560,"extension":561,"links":6,"meta":562,"navigation":563,"path":83,"seo":564,"stem":84,"__hash__":565},"docs_en\u002Fen\u002F1.ai-engineering\u002F3.evaluation-methodology\u002Fch03.md",{"type":144,"value":145,"toc":541},"minimark",[146,161,166,204,212,216,227,237,241,248,274,278,285,295,312,324,328,336,365,374,382,386,395,411,415,422,448,451,458,465,485,488,492],[147,148,149,153],"u-page-hero",{},[150,151,78],"template",{"v-slot:title":152},"",[150,154,155,156,160],{"v-slot:description":152},"The more AI is used, the more opportunity there is for ",[157,158,159],"strong",{},"catastrophic failure",". We've already seen many failures in the short time that foundation models have been around.",[162,163,165],"h2",{"id":164},"failures-we-have-already-seen","Failures We Have Already Seen",[167,168,169,184,194],"card-group",{},[170,171,176,177,183],"card",{"icon":172,"title":173,"target":174,"to":175},"i-lucide-bot","Chatbot Encouraged Suicide","_blank","https:\u002F\u002Fwww.vice.com\u002Fen\u002Farticle\u002Fman-dies-by-suicide-after-talking-with-ai-chatbot-widow-says\u002F","A man committed suicide after being ",[178,179,182],"a",{"href":175,"rel":180},[181],"nofollow","encouraged by a chatbot",".",[170,185,189,190,183],{"icon":186,"title":187,"target":174,"to":188},"i-lucide-gavel","Hallucinated Court Evidence","https:\u002F\u002Ffortune.com\u002F2023\u002F06\u002F23\u002Flawyers-fined-filing-chatgpt-hallucinations-in-court\u002F","Lawyers submitted ",[178,191,193],{"href":188,"rel":192},[181],"false evidence hallucinated by AI",[170,195,199,200,183],{"icon":196,"title":197,"target":174,"to":198},"i-lucide-plane","Airline Chatbot Misled a Passenger","https:\u002F\u002Fwww.cio.com\u002Farticle\u002F190888\u002F5-famous-analytics-and-ai-disasters.html","Air Canada was ordered to pay damages when its AI chatbot ",[178,201,203],{"href":198,"rel":202},[181],"gave a passenger false information",[205,206,207,208,211],"caution",{},"Without a way to quality control AI outputs, the ",[157,209,210],{},"risk of AI might outweigh its benefits"," for many applications.",[162,213,215],{"id":214},"the-biggest-hurdle","The Biggest Hurdle",[217,218,219,220,223,224,183],"p",{},"As teams rush to adopt AI, many quickly realize that the biggest hurdle to bringing AI applications to reality is ",[157,221,222],{},"evaluation",". For some applications, figuring out evaluation can take up the ",[157,225,226],{},"majority of the development effort",[228,229,230,231,236],"note",{},"In December 2023, ",[178,232,235],{"href":233,"rel":234},"https:\u002F\u002Fx.com\u002Fgdb\u002Fstatus\u002F1733553161884127435",[181],"Greg Brockman, an OpenAI cofounder, tweeted"," that \"evals are surprisingly often all you need.\"",[162,238,240],{"id":239},"two-chapters-on-evaluation","Two Chapters on Evaluation",[217,242,243,244,247],{},"Due to the importance and complexity of evaluation, this book has ",[157,245,246],{},"two chapters"," on it.",[167,249,250,262],{},[170,251,254,255,258,259,183],{"icon":252,"title":253},"i-lucide-flask-conical","This Chapter — Methods","Different evaluation methods used to evaluate ",[157,256,257],{},"open-ended models",", how these methods work, and their ",[157,260,261],{},"limitations",[170,263,265,266,269,270,273],{"icon":137,"title":264},"Next Chapter — Application","How to use these methods to ",[157,267,268],{},"select models"," for your application and ",[157,271,272],{},"build an evaluation pipeline"," to evaluate your application.",[162,275,277],{"id":276},"evaluation-in-the-context-of-a-whole-system","Evaluation in the Context of a Whole System",[217,279,280,281,284],{},"While I discuss evaluation in its own chapters, evaluation has to be considered in the context of a ",[157,282,283],{},"whole system",", not in isolation.",[217,286,287,288,291,292,183],{},"Evaluation aims to ",[157,289,290],{},"mitigate risks"," and ",[157,293,294],{},"uncover opportunities",[167,296,297,305],{},[170,298,300,301,304],{"icon":90,"title":299},"Mitigate Risks","To mitigate risks, you first need to identify the places where your system is ",[157,302,303],{},"likely to fail"," and design your evaluation around them.",[170,306,309,310,183],{"icon":307,"title":308},"i-lucide-lightbulb","Uncover Opportunities","Evaluation also aims to ",[157,311,294],{},[313,314,315,316,319,320,323],"warning",{},"Often, this may require ",[157,317,318],{},"redesigning your system"," to enhance visibility into its failures. Without a clear understanding of where your system fails, ",[157,321,322],{},"no amount of evaluation metrics or tools"," can make the system robust.",[162,325,327],{"id":326},"why-people-skip-systematic-evaluation","Why People Skip Systematic Evaluation",[217,329,330,331,335],{},"Before diving into evaluation methods, it's important to acknowledge the challenges of evaluating foundation models. Because evaluation is difficult, many people settle for ",[332,333,334],"em",{},"word of mouth"," (e.g., someone says that the model X is good) or eyeballing the results.",[167,337,338,357],{},[170,339,342,343,346,347,352,353,356],{"icon":340,"title":341},"i-lucide-messages-square","Word of Mouth","Someone says that ",[157,344,345],{},"model X is good",". A 2023 study by ",[178,348,351],{"href":349,"rel":350},"https:\u002F\u002Fa16z.com\u002Fgenerative-ai-enterprise-2024\u002F",[181],"a16z"," showed that ",[157,354,355],{},"6 out of 70"," decision makers evaluated models by word of mouth.",[170,358,361,362,183],{"icon":359,"title":360},"i-lucide-eye","Eyeballing the Results","Also known as a ",[332,363,364],{},"vibe check",[313,366,367,368,291,371,183],{},"This creates even more ",[157,369,370],{},"risk",[157,372,373],{},"slows application iteration",[375,376,377,378,381],"tip",{},"Instead, we need to invest in ",[157,379,380],{},"systematic evaluation"," to make the results more reliable.",[162,383,385],{"id":384},"language-modeling-metrics","Language Modeling Metrics",[217,387,388,389,291,392,183],{},"Since many foundation models have a language model component, this chapter will provide a quick overview of the metrics used to evaluate language models, including ",[157,390,391],{},"cross entropy",[157,393,394],{},"perplexity",[167,396,397,405],{},[170,398,400,401,404],{"icon":95,"title":399},"Cross Entropy","Essential for guiding the ",[157,402,403],{},"training and finetuning"," of language models, and frequently used in many evaluation methods.",[170,406,400,409,404],{"icon":407,"title":408},"i-lucide-gauge","Perplexity",[157,410,403],{},[162,412,414],{"id":413},"open-ended-models-need-different-practices","Open-Ended Models Need Different Practices",[217,416,417,418,421],{},"Evaluating foundation models is especially challenging because they are ",[157,419,420],{},"open-ended",", and I'll cover best practices for how to tackle these.",[167,423,424,437],{},[170,425,428,429,432,433,436],{"icon":426,"title":427},"i-lucide-users","Human Evaluators","Using human evaluators remains a ",[157,430,431],{},"necessary option"," for many applications. Given how ",[157,434,435],{},"slow and expensive"," human annotations can be, the goal is to automate the process.",[170,438,440,441,291,444,447],{"icon":132,"title":439},"Automatic Evaluation","This book focuses on automatic evaluation, which includes both ",[157,442,443],{},"exact",[157,445,446],{},"subjective"," evaluation.",[162,449,102],{"id":450},"ai-as-a-judge",[217,452,453,454,457],{},"The rising star of subjective evaluation is ",[157,455,456],{},"AI as a judge"," — the approach of using AI to evaluate AI responses.",[228,459,460,461,464],{},"It's subjective because the score depends on ",[157,462,463],{},"what model and prompt"," the AI judge uses.",[167,466,467,476],{},[170,468,471,472,475],{"icon":469,"title":470},"i-lucide-trending-up","Rapid Traction","This approach is gaining ",[157,473,474],{},"rapid traction"," in the industry.",[170,477,480,481,484],{"icon":478,"title":479},"i-lucide-shield-off","Intense Opposition","It also invites intense opposition from those who believe that ",[157,482,483],{},"AI isn't trustworthy enough"," for this important task.",[375,486,487],{},"I'm especially excited to go deeper into this discussion, and I hope you will be, too.",[162,489,491],{"id":490},"what-this-chapter-covers","What This Chapter Covers",[493,494,496,500,509,512,520,523,529,532,535,538],"steps",{"level":495},"3",[497,498,87],"h3",{"id":499},"challenges-of-evaluating-foundation-models",[217,501,502,503,505,506,508],{},"Why evaluating foundation models is hard, including the limits of ",[332,504,334],{}," and vibe checks, and best practices for ",[157,507,420],{}," models.",[497,510,92],{"id":511},"understanding-language-modeling-metrics",[217,513,514,515,291,517,519],{},"A quick overview of ",[157,516,391],{},[157,518,394],{}," — metrics essential for training, finetuning, and many evaluation methods.",[497,521,97],{"id":522},"exact-evaluation",[217,524,525,526,528],{},"One half of automatic evaluation: ",[157,527,443],{}," methods, alongside subjective evaluation.",[497,530,102],{"id":531},"ai-as-a-judge-1",[217,533,534],{},"The rising star of subjective evaluation — using AI to evaluate AI responses, including why it is taking off and why it is contested.",[497,536,107],{"id":537},"ranking-models-with-comparative-evaluation",[217,539,540],{},"Ranking models with comparative evaluation.",{"title":152,"searchDepth":542,"depth":542,"links":543},2,[544,545,546,547,548,549,550,551,552],{"id":164,"depth":542,"text":165},{"id":214,"depth":542,"text":215},{"id":239,"depth":542,"text":240},{"id":276,"depth":542,"text":277},{"id":326,"depth":542,"text":327},{"id":384,"depth":542,"text":385},{"id":413,"depth":542,"text":414},{"id":450,"depth":542,"text":102},{"id":490,"depth":542,"text":491,"children":553},[554,556,557,558,559],{"id":499,"depth":555,"text":87},3,{"id":511,"depth":555,"text":92},{"id":522,"depth":555,"text":97},{"id":531,"depth":555,"text":102},{"id":537,"depth":555,"text":107},"How to evaluate open-ended foundation models: language-modeling metrics, exact and subjective methods, AI as a judge, and their limitations.","md",{},{"icon":85},{"title":78,"description":560},"_7v-ohB0C9k-x8Sel0x10CS-Ms2C6vvXgtBMeWcd-ak",[567,569],{"title":41,"path":75,"stem":76,"description":568,"icon":44,"children":-1},"A recap of how training data, modeling choices, post-training, and sampling shape foundation model behavior.",{"title":87,"path":88,"stem":89,"description":570,"icon":90,"children":-1},"Why evaluating foundation models is harder than traditional ML — intelligence, open-ended outputs, black boxes, saturating benchmarks, and expanding scope.",1789413987009]