---
title: "What is an Inference Engine, Anyway?"
category: "talks"
date: "2026-06-29"
time: "11:05am-12:05pm"
track: "Workshops Day 1"
room: "Track 8"
speakers: ["Charles Frye"]
sourceLabels: ["Official conference schedule", "Public YouTube metadata"]
scheduleTrack: "Workshops Day 1"
scheduleRoom: "Track 8"
scheduleLabels: ["Workshops Day 1", "Track 8", "workshop", "confirmed"]
---
# What is an Inference Engine, Anyway?

## Conference Context
- Date/time: 2026-06-29 · 11:05am-12:05pm
- Track/room: Workshops Day 1 · Track 8
- Speaker(s): Charles Frye
- Session type/status: workshop · confirmed

- Track: Workshops Day 1
- Room: Track 8
- Session type: workshop
- Status: confirmed

## Session Description
To run state-of-the-art inference yourself, you must master the inference engine: vLLM, SGLang, TRT-LLM, or your own jawn. The inference engine manages the lifecycle of an inference request, from input to output. In this workshop, we'll examine the architecture of modern high performance inference engines, the key techniques that inference engines need to deliver that performance, and the traces and metrics that inference engines emit.

## Media Evidence
[How fast are LLM inference engines anyway? — Charles Frye, Modal](https://www.youtube.com/watch?v=DeFF3J8T5Pk) (speaker-match related prior/adjacent AI Engineer video; captions: English auto-captions).

- Source video: `youtube-DeFF3J8T5Pk`
- Slide deck: [[youtube-DeFF3J8T5Pk-dense-slides|Dense Slides: How fast are LLM inference engines anyway? — Charles Frye, Modal]] — 2 visible slide image(s); 2 HTML recreation(s).
![[assets/dense-slides/DeFF3J8T5Pk/slide-001.jpg]]
![[assets/dense-slides/DeFF3J8T5Pk/slide-002.jpg]]
- Additional slide evidence: [[youtube-DeFF3J8T5Pk-slides|Slides: How fast are LLM inference engines anyway? — Charles Frye, Modal]], [[youtube-DeFF3J8T5Pk-reconstructed-slides|Reconstructed Slides: How fast are LLM inference engines anyway? — Charles Frye, Modal]]

## Evidence Graph
This evidence graph is generated from currently linked source material: official schedule text, related video pages, cached transcripts, visible slide text, dense/reconstructed slide pages, and AI slide-classification audits.

### Media Signals
- `youtube-DeFF3J8T5Pk` — source page linked
- Evidence links for `youtube-DeFF3J8T5Pk`: [[youtube-DeFF3J8T5Pk]], [[youtube-DeFF3J8T5Pk-slides]], [[youtube-DeFF3J8T5Pk-dense-slides]], [[youtube-DeFF3J8T5Pk-reconstructed-slides]]

### Agent Reading Notes
Use these signals to refine the synopsis, topic links, people/company context, and method notes. If a source is a related external video rather than an exact official recording, keep it framed as supporting evidence.

## Transcript Status
Related video transcript availability: English auto-captions. Treat this as supporting context, not a recording of this exact scheduled session unless later confirmed. Not fetched yet.

## People
- [[charles-frye]]

## Supporting Slides
- [[youtube-DeFF3J8T5Pk-slides]] — extracted from the related public AI Engineer video.

## Slide Evidence
- Slide-only cropped deck: [[youtube-DeFF3J8T5Pk-dense-slides]] (2 viable slide images).
- Related slide/OCR pages:
- [[youtube-DeFF3J8T5Pk-dense-slides]]
- [[youtube-DeFF3J8T5Pk-reconstructed-slides]]
- [[youtube-DeFF3J8T5Pk-slides]]
- Slide-derived terms: `microsoft`, `open`, `models`, `every`, `benchmarked`, `world`, `fair`, `graphite`, `windsurf`, `moneobb`, `mdaily`, `augmentcode`, `workos`, `weights`, `source`, `engines`, `getting`, `better`

## Synthesis
### Synthesized Breakdown
# What is an Inference Engine, Anyway? ## Conference Context - Date/time: 2026-06-29 · 11:05am-12:05pm - Track/room: Workshops Day 1 · Track 8 - Speaker(s): Charles Frye - Session type/status: workshop · confirmed - Track: Workshops Day 1 - Room: Track 8 - Session type: workshop - Status: confirmed ## Session Description To run state-of-the-art inference yourself, you must master the inference engine: vLLM, SGLang, TRT-LLM, or your own jawn. The inference engine manages the lifecycle of an inference request, from input to output. In this workshop, we'll examine the architecture of modern high performance inference engines, the key techniques that inference engines need to deliver that performance, and the traces and metrics that inference engines emit.

### Speaker And Company Context
- [[charles-frye|Charles Frye]] — Member of Technical Staff at [[modal|Modal]].

### Topics Covered
- [[coding-agents]]

### Derived Links And Source Material
- [[youtube-DeFF3J8T5Pk]] — related YouTube source page.
- [[youtube-DeFF3J8T5Pk-slides]] — slide evidence.
- [[youtube-DeFF3J8T5Pk-reconstructed-slides]] — slide evidence.
- [[youtube-DeFF3J8T5Pk-dense-slides]] — slide evidence.

### Novel Concepts / Clever Methods
- No highlighted novel concept has been detected yet.

### Evidence Boundary
This synthesis is based on the official schedule and linked source pages. It should be revisited when exact session recordings or transcript-backed secondary sources are available.
