GradeChumEngineeringPresentQ3 · 2026
04
Goal #04 · AI Accuracy
92.77%

custom-config accuracy · 3,885 rubric evals · all time since Jun 30, 2026

Excludes Visuals & Code on Paper — beta item types, tracked per-type below

Q2 guide · manual evals: 85.00% overall (incl. beta types)

Gap to 95% target
2.23%
from daily strictness tracking
0%95% target100%
Problem Solving
4.71% gap

90.29%

2,770 rubric evals · custom · all time

Q2 guide · 86.77%

Essay
Target met

98.92%

1,115 rubric evals · custom · all time

Q2 guide · 86.39%

Visuals
Beta
Target met

100.00%

32 rubric evals · custom · all time

Q2 guide · 85.15% · beta — not counted in Overall

Code on Paper
Beta

No custom-config volume recorded yet

Q2 guide · 66.04% · beta — not counted in Overall

Multiple Choice
Target met

98.61%

3,058,939 answers · all time

Objective · answer-level · all items

Identification
2.77% gap

92.23%

404,911 answers · all time

Objective · answer-level · all items

Enumeration
14.57% gap

80.43%

23,817 answers · all time

Objective · answer-level · all items

Multiple Answer
15.07% gap

79.93%

17,826 answers · all time

Objective · answer-level · all items

Strictness Config Accuracy (daily)

Share of teacher-reviewed AI rubric grading that was not corrected, on items using strictness configs (reviewed = result viewed by the teacher, or answer explicitly corrected). Custom (teacher-made) configs are the primary series; system configs are shown for comparison. Dashed lines show the Q2 guide. Days with fewer than 30 rubric evaluations are hidden.

Last computed Sep 6, 3:05 AM

Daily History

Cron-computed strictness accuracy per day. Cells under 30 rubric evaluations are muted (low volume). Most recent day is highlighted.

DayProblem Solvingavg 90.29%Essayavg 98.92%Visualsavg 100.00%Code on Paper
2026-09-05
100.00%
52 evals
2026-09-04
100.00%
13 evals
2026-09-03
100.00%
13 evals
100.00%
4 evals
2026-09-02
100.00%
9 evals
83.33%
36 evals
2026-09-01
100.00%
42 evals
100.00%
6 evals
2026-08-29
100.00%
24 evals
2026-08-28
97.85%
838 evals
100.00%
173 evals
2026-08-27
100.00%
45 evals
2026-08-26
100.00%
28 evals
2026-08-25
95.45%
22 evals
100.00%
10 evals
2026-08-24
100.00%
75 evals
2026-08-19
100.00%
24 evals
2026-08-18
96.00%
50 evals
100.00%
54 evals
2026-08-17
100.00%
12 evals
2026-08-14
100.00%
45 evals
2026-08-13
100.00%
114 evals
2026-08-11
97.33%
225 evals
2026-08-05
100.00%
78 evals
100.00%
222 evals
100.00%
32 evals
2026-08-04
100.00%
6 evals
2026-08-03
100.00%
24 evals
2026-07-29
100.00%
1 evals
2026-07-25
100.00%
10 evals
2026-07-24
72.67%
172 evals
2026-07-23
44.17%
206 evals
2026-07-20
100.00%
210 evals
2026-07-17
100.00%
32 evals
100.00%
10 evals
2026-07-03
90.46%
765 evals
2026-07-02
96.88%
32 evals
2026-07-01
100.00%
2 evals
2026-06-30
94.03%
201 evals

Manual Evaluation Runs

Curated eval-run results. Currently showing the Q2 guide — values below are reference only until a Q3 eval run is added.

Overall
10.00% gap

Combined accuracy across all item types

85.00%
85.0% currenttarget 95%
Problem Solving
8.23% gap

Math, science & logical reasoning

86.77%

34,610 evaluations

86.8% currenttarget 95%
Essay
8.61% gap

Written response evaluation quality

86.39%

16,757 evaluations

86.4% currenttarget 95%
Visuals
9.85% gap

Diagram & image-based questions

85.15%

653 evaluations

85.2% currenttarget 95%
Code on Paper
28.96% gap

Handwritten code interpretation

66.04%

4,455 evaluations

66.0% currenttarget 95%
Add Accuracy Snapshot

Record a new evaluation run. Enter the eval count and accuracy % for each item type.

Date the evaluation run was completed

Grand total across all item types

Combined accuracy across all types

Per Item Type

Problem Solving
Essay
Visuals
Code on Paper
Snapshot History

Changes compared to the previous snapshot (+ = improved, − = declined). Most recent row is highlighted.

DateEvalsOverallProb. SolvingEssayVisualsCode on Paper
2026-06-29original
56,475
85.00%
86.77%
86.39%
85.15%
66.04%