HUGIML in the TabArena reference landscape
A dedicated leaderboard view for aligned outer-test comparisons. Search budgets and ensemble construction remain method-specific, so each pool is presented separately.
Tuned-model AUC gaps
Models follow their within-quadrant Elo rank. Bars show mean ROC-AUC delta; dots show median delta.
Ordering is by TabArena rank, which uses ROC-AUC error for binary datasets and log loss for multiclass datasets. The displayed order is therefore not a ranking by the ROC-AUC values shown at right.
Default · overall
HUGIML plus 16 official variants · 32 completed datasets · Elo anchor RF (default) = 1000
Leaderboard
Every displayed statistic is recalculated using only this tab's methods.
| # | Method | Elo | 95% interval | Normalized score | Average rank | Improvability · mean (median) |
|---|---|---|---|---|---|---|
| 1 | TABICL_GPU (default) | 1570.2 | 1480.0–1692.8 | 0.689 | 3.22 | 4.59% (1.43%) |
| 2 | CAT (default) | 1487.3 | 1392.2–1612.5 | 0.520 | 4.28 | 9.12% (3.81%) |
| 3 | TABM_GPU (default) | 1421.3 | 1306.9–1562.1 | 0.457 | 5.28 | 10.67% (3.38%) |
| 4 | TABPFNV2_GPU (default) | 1388.2 | 1251.3–1541.5 | 0.528 | 5.83 | 8.56% (3.92%) |
| 5 | MNCA_GPU (default) | 1349.4 | 1267.4–1452.3 | 0.304 | 6.50 | 11.69% (5.45%) |
| 6 | REALMLP (default) | 1304.3 | 1214.6–1409.8 | 0.220 | 7.31 | 12.00% (7.24%) |
| 7 | EBM (default) | 1295.8 | 1207.8–1406.8 | 0.261 | 7.47 | 13.50% (6.39%) |
| 8 | XGB (default) | 1270.4 | 1175.4–1380.5 | 0.227 | 7.94 | 13.06% (9.65%) |
| 9 | TABDPT_GPU (default) | 1246.8 | 1165.1–1345.0 | 0.245 | 8.38 | 12.54% (5.86%) |
| 10 | GBM (default) | 1233.4 | 1144.6–1348.2 | 0.162 | 8.62 | 13.88% (9.52%) |
| 11 | HUGIML | 1158.6 | 1067.5–1280.5 | 0.138 | 10.00 | 18.41% (8.11%) |
| 12 | NN_TORCH (default) | 1107.3 | 1004.9–1213.8 | 0.059 | 10.91 | 17.64% (9.32%) |
| 13 | FASTAI (default) | 1077.7 | 987.2–1178.0 | 0.056 | 11.41 | 19.34% (14.15%) |
| 14 | RF (default) | 1000.0 | 1000.0–1000.0 | 0.016 | 12.62 | 22.30% (14.50%) |
| 15 | LR (default) | 969.3 | 848.3–1099.7 | 0.038 | 13.06 | 26.08% (16.35%) |
| 16 | XT (default) | 924.0 | 848.3–974.1 | 0.029 | 13.66 | 24.27% (16.75%) |
| 17 | KNN (default) | 551.5 | 217.1–697.9 | 0.000 | 16.52 | 55.91% (51.92%) |
HUGIML versus each official method
Positive error reduction favors HUGIML.
| Official method | Wins | Ties | Losses | Error reduction · mean (median) |
|---|---|---|---|---|
| KNN (default) | 31 | 0 | 1 | 46.39% (48.28%) |
| LR (default) | 27 | 0 | 5 | 8.45% (7.90%) |
| XT (default) | 25 | 0 | 7 | 4.97% (6.64%) |
| RF (default) | 22 | 0 | 10 | 0.02% (5.09%) |
| FASTAI (default) | 21 | 0 | 11 | -3.58% (2.96%) |
| NN_TORCH (default) | 17 | 0 | 15 | -8.76% (0.51%) |
| GBM (default) | 11 | 0 | 21 | -12.40% (-3.11%) |
| EBM (default) | 7 | 0 | 25 | -14.07% (-3.05%) |
| XGB (default) | 9 | 0 | 23 | -15.17% (-3.59%) |
| TABM_GPU (default) | 3 | 0 | 29 | -16.72% (-5.54%) |
| REALMLP (default) | 14 | 0 | 18 | -19.92% (-1.42%) |
| MNCA_GPU (default) | 6 | 0 | 26 | -20.68% (-3.13%) |
| CAT (default) | 5 | 0 | 27 | -21.11% (-5.33%) |
| TABDPT_GPU (default) | 13 | 0 | 19 | -24.68% (-1.55%) |
| TABPFNV2_GPU (default) | 8 | 0 | 24 | -33.07% (-3.66%) |
| TABICL_GPU (default) | 5 | 0 | 27 | -40.91% (-4.99%) |
Default · binary
HUGIML plus 16 official variants · 26 completed datasets · Elo anchor RF (default) = 1000
Leaderboard
Every displayed statistic is recalculated using only this tab's methods.
| # | Method | Elo | 95% interval | Normalized score | Average rank | Improvability · mean (median) |
|---|---|---|---|---|---|---|
| 1 | TABICL_GPU (default) | 1584.3 | 1464.8–1758.2 | 0.733 | 3.04 | 2.44% (1.00%) |
| 2 | CAT (default) | 1483.3 | 1351.1–1649.7 | 0.564 | 4.31 | 7.49% (2.57%) |
| 3 | TABM_GPU (default) | 1399.0 | 1274.8–1573.2 | 0.443 | 5.62 | 9.69% (2.90%) |
| 4 | MNCA_GPU (default) | 1352.2 | 1264.9–1459.8 | 0.346 | 6.42 | 9.63% (4.73%) |
| 5 | TABPFNV2_GPU (default) | 1340.3 | 1201.8–1523.7 | 0.475 | 6.63 | 9.83% (4.61%) |
| 6 | EBM (default) | 1335.0 | 1225.0–1474.8 | 0.305 | 6.73 | 10.72% (5.00%) |
| 7 | REALMLP (default) | 1320.1 | 1210.0–1431.1 | 0.260 | 7.00 | 9.77% (6.83%) |
| 8 | XGB (default) | 1245.7 | 1135.6–1377.0 | 0.241 | 8.38 | 11.94% (8.04%) |
| 9 | TABDPT_GPU (default) | 1241.6 | 1130.7–1354.3 | 0.224 | 8.46 | 9.75% (5.86%) |
| 10 | GBM (default) | 1229.3 | 1126.7–1355.3 | 0.160 | 8.69 | 12.44% (9.41%) |
| 11 | HUGIML | 1152.7 | 1014.2–1308.7 | 0.158 | 10.12 | 16.73% (5.44%) |
| 12 | NN_TORCH (default) | 1109.5 | 991.7–1213.4 | 0.066 | 10.88 | 15.41% (8.84%) |
| 13 | FASTAI (default) | 1091.7 | 981.9–1191.3 | 0.052 | 11.19 | 16.85% (12.91%) |
| 14 | LR (default) | 1005.2 | 844.3–1136.9 | 0.047 | 12.58 | 22.96% (13.29%) |
| 15 | RF (default) | 1000.0 | 1000.0–1000.0 | 0.016 | 12.65 | 19.79% (14.26%) |
| 16 | XT (default) | 926.3 | 855.5–991.6 | 0.031 | 13.65 | 21.51% (16.29%) |
| 17 | KNN (default) | 506.1 | -3464.0–674.9 | 0.000 | 16.63 | 52.89% (48.49%) |
HUGIML versus each official method
Positive error reduction favors HUGIML.
| Official method | Wins | Ties | Losses | Error reduction · mean (median) |
|---|---|---|---|---|
| KNN (default) | 25 | 0 | 1 | 42.79% (44.54%) |
| LR (default) | 21 | 0 | 5 | 6.23% (4.86%) |
| XT (default) | 21 | 0 | 5 | 4.32% (6.64%) |
| RF (default) | 18 | 0 | 8 | 0.50% (4.62%) |
| FASTAI (default) | 16 | 0 | 10 | -5.78% (2.20%) |
| NN_TORCH (default) | 12 | 0 | 14 | -8.08% (-0.51%) |
| GBM (default) | 9 | 0 | 17 | -12.17% (-1.81%) |
| XGB (default) | 8 | 0 | 18 | -13.10% (-3.39%) |
| TABM_GPU (default) | 3 | 0 | 23 | -13.73% (-3.17%) |
| EBM (default) | 4 | 0 | 22 | -14.61% (-3.05%) |
| CAT (default) | 5 | 0 | 21 | -20.09% (-4.73%) |
| REALMLP (default) | 11 | 0 | 15 | -20.17% (-1.42%) |
| MNCA_GPU (default) | 4 | 0 | 22 | -21.16% (-3.56%) |
| TABPFNV2_GPU (default) | 8 | 0 | 18 | -21.80% (-3.36%) |
| TABDPT_GPU (default) | 10 | 0 | 16 | -28.47% (-1.55%) |
| TABICL_GPU (default) | 4 | 0 | 22 | -41.15% (-4.99%) |
Default · multiclass
HUGIML plus 16 official variants · 6 completed datasets · Elo anchor RF (default) = 1000
Leaderboard
Every displayed statistic is recalculated using only this tab's methods.
| # | Method | Elo | 95% interval | Normalized score | Average rank | Improvability · mean (median) |
|---|---|---|---|---|---|---|
| 1 | TABPFNV2_GPU (default) | 1765.1 | 1592.8–5838.4 | 0.762 | 2.33 | 3.06% (0.19%) |
| 2 | TABM_GPU (default) | 1606.1 | 1329.7–2460.6 | 0.518 | 3.83 | 14.93% (5.42%) |
| 3 | TABICL_GPU (default) | 1591.3 | 1408.4–2100.6 | 0.500 | 4.00 | 13.92% (4.90%) |
| 4 | CAT (default) | 1577.0 | 1354.4–2377.1 | 0.327 | 4.17 | 16.18% (7.35%) |
| 5 | XGB (default) | 1436.4 | 1340.0–1913.5 | 0.163 | 6.00 | 17.93% (11.18%) |
| 6 | MNCA_GPU (default) | 1379.1 | 1239.9–1918.9 | 0.121 | 6.83 | 20.59% (11.58%) |
| 7 | TABDPT_GPU (default) | 1302.2 | 1112.3–1771.2 | 0.333 | 8.00 | 24.64% (7.45%) |
| 8 | GBM (default) | 1280.6 | 1018.4–1797.2 | 0.168 | 8.33 | 20.12% (12.26%) |
| 9 | REALMLP (default) | 1259.2 | 1103.2–1661.6 | 0.049 | 8.67 | 21.68% (13.77%) |
| 10 | HUGIML | 1205.6 | 887.2–1874.7 | 0.051 | 9.50 | 25.67% (14.91%) |
| 11 | EBM (default) | 1129.2 | 886.0–1688.4 | 0.067 | 10.67 | 25.53% (19.33%) |
| 12 | NN_TORCH (default) | 1106.8 | 918.3–1518.7 | 0.031 | 11.00 | 27.29% (26.63%) |
| 13 | FASTAI (default) | 1012.5 | 554.6–1619.9 | 0.071 | 12.33 | 30.11% (23.15%) |
| 14 | RF (default) | 1000.0 | 1000.0–1000.0 | 0.019 | 12.50 | 33.20% (21.24%) |
| 15 | XT (default) | 905.4 | 735.3–975.3 | 0.021 | 13.67 | 36.22% (21.94%) |
| 16 | LR (default) | 753.8 | 73.9–1131.8 | 0.000 | 15.17 | 39.61% (36.47%) |
| 17 | KNN (default) | 638.8 | -3731.2–910.4 | 0.000 | 16.00 | 68.96% (71.60%) |
HUGIML versus each official method
Positive error reduction favors HUGIML.
| Official method | Wins | Ties | Losses | Error reduction · mean (median) |
|---|---|---|---|---|
| KNN (default) | 6 | 0 | 0 | 62.00% (66.27%) |
| LR (default) | 6 | 0 | 0 | 18.05% (22.53%) |
| XT (default) | 4 | 0 | 2 | 7.80% (8.01%) |
| FASTAI (default) | 5 | 0 | 1 | 5.98% (5.79%) |
| RF (default) | 4 | 0 | 2 | -2.03% (6.74%) |
| TABDPT_GPU (default) | 3 | 0 | 3 | -8.22% (-8.37%) |
| NN_TORCH (default) | 5 | 0 | 1 | -11.69% (3.48%) |
| EBM (default) | 3 | 0 | 3 | -11.70% (-1.77%) |
| GBM (default) | 2 | 0 | 4 | -13.44% (-9.16%) |
| MNCA_GPU (default) | 2 | 0 | 4 | -18.60% (-2.36%) |
| REALMLP (default) | 3 | 0 | 3 | -18.84% (-2.35%) |
| XGB (default) | 1 | 0 | 5 | -24.16% (-4.38%) |
| CAT (default) | 0 | 0 | 6 | -25.54% (-9.85%) |
| TABM_GPU (default) | 0 | 0 | 6 | -29.69% (-11.14%) |
| TABICL_GPU (default) | 1 | 0 | 5 | -39.85% (-9.74%) |
| TABPFNV2_GPU (default) | 0 | 0 | 6 | -81.94% (-17.30%) |
Tuned · overall
HUGIML plus 14 official variants · 32 completed datasets · Elo anchor RF (tuned) = 1000
Leaderboard
Every displayed statistic is recalculated using only this tab's methods.
| # | Method | Elo | 95% interval | Normalized score | Average rank | Improvability · mean (median) |
|---|---|---|---|---|---|---|
| 1 | TABM_GPU (tuned) | 1427.6 | 1319.6–1564.7 | 0.527 | 4.19 | 5.98% (2.08%) |
| 2 | GBM (tuned) | 1395.1 | 1307.3–1513.1 | 0.443 | 4.66 | 7.64% (2.70%) |
| 3 | CAT (tuned) | 1378.4 | 1301.9–1488.1 | 0.464 | 4.91 | 6.49% (3.59%) |
| 4 | TABPFNV2_GPU (tuned) | 1355.3 | 1167.7–1504.9 | 0.572 | 5.27 | 5.23% (2.19%) |
| 5 | MNCA_GPU (tuned) | 1321.2 | 1239.7–1410.8 | 0.339 | 5.81 | 6.61% (4.19%) |
| 6 | XGB (tuned) | 1311.7 | 1235.1–1417.4 | 0.357 | 5.97 | 8.49% (4.54%) |
| 7 | REALMLP (tuned) | 1278.0 | 1178.5–1379.6 | 0.224 | 6.53 | 8.05% (5.41%) |
| 8 | EBM (tuned) | 1211.8 | 1104.7–1329.4 | 0.148 | 7.66 | 11.69% (5.91%) |
| 9 | FASTAI (tuned) | 1159.9 | 1052.7–1294.3 | 0.147 | 8.53 | 12.56% (7.07%) |
| 10 | NN_TORCH (tuned) | 1119.9 | 1016.8–1231.5 | 0.113 | 9.19 | 11.09% (6.44%) |
| 11 | XT (tuned) | 1090.3 | 1020.0–1166.5 | 0.112 | 9.66 | 14.52% (8.94%) |
| 12 | HUGIML | 1080.2 | 967.5–1201.2 | 0.107 | 9.81 | 17.60% (9.28%) |
| 13 | RF (tuned) | 1000.0 | 1000.0–1000.0 | 0.052 | 10.97 | 15.54% (9.05%) |
| 14 | LR (tuned) | 901.3 | 729.9–1035.3 | 0.046 | 12.16 | 23.74% (15.37%) |
| 15 | KNN (tuned) | 481.3 | 81.8–613.9 | 0.000 | 14.70 | 46.64% (40.89%) |
HUGIML versus each official method
Positive error reduction favors HUGIML.
| Official method | Wins | Ties | Losses | Error reduction · mean (median) |
|---|---|---|---|---|
| KNN (tuned) | 30 | 0 | 2 | 36.26% (33.98%) |
| LR (tuned) | 27 | 0 | 5 | 4.55% (5.15%) |
| RF (tuned) | 17 | 0 | 15 | -9.22% (0.36%) |
| XT (tuned) | 14 | 0 | 18 | -9.37% (-0.69%) |
| FASTAI (tuned) | 13 | 0 | 19 | -12.29% (-0.79%) |
| EBM (tuned) | 8 | 0 | 24 | -16.66% (-3.36%) |
| NN_TORCH (tuned) | 13 | 0 | 19 | -18.29% (-1.61%) |
| XGB (tuned) | 5 | 0 | 27 | -21.00% (-5.73%) |
| GBM (tuned) | 4 | 0 | 28 | -21.74% (-5.20%) |
| REALMLP (tuned) | 9 | 0 | 23 | -24.37% (-3.67%) |
| CAT (tuned) | 5 | 0 | 27 | -26.63% (-5.02%) |
| TABM_GPU (tuned) | 4 | 0 | 28 | -28.45% (-6.54%) |
| MNCA_GPU (tuned) | 8 | 0 | 24 | -28.48% (-5.41%) |
| TABPFNV2_GPU (tuned) | 9 | 0 | 23 | -36.83% (-7.52%) |
Tuned · binary
HUGIML plus 14 official variants · 26 completed datasets · Elo anchor RF (tuned) = 1000
Leaderboard
Every displayed statistic is recalculated using only this tab's methods.
| # | Method | Elo | 95% interval | Normalized score | Average rank | Improvability · mean (median) |
|---|---|---|---|---|---|---|
| 1 | TABM_GPU (tuned) | 1434.6 | 1322.1–1578.7 | 0.547 | 4.12 | 5.43% (1.52%) |
| 2 | GBM (tuned) | 1410.2 | 1333.0–1519.8 | 0.478 | 4.46 | 7.27% (2.21%) |
| 3 | CAT (tuned) | 1381.8 | 1289.0–1513.8 | 0.481 | 4.88 | 6.87% (2.67%) |
| 4 | MNCA_GPU (tuned) | 1340.2 | 1243.0–1461.5 | 0.375 | 5.54 | 5.65% (3.70%) |
| 5 | TABPFNV2_GPU (tuned) | 1315.5 | 1168.5–1545.3 | 0.514 | 5.94 | 5.88% (2.56%) |
| 6 | XGB (tuned) | 1305.1 | 1218.2–1407.2 | 0.357 | 6.12 | 8.36% (4.45%) |
| 7 | REALMLP (tuned) | 1253.0 | 1155.7–1380.6 | 0.190 | 7.00 | 8.08% (5.41%) |
| 8 | EBM (tuned) | 1241.8 | 1128.1–1378.2 | 0.168 | 7.19 | 9.79% (5.49%) |
| 9 | FASTAI (tuned) | 1160.7 | 1052.8–1296.8 | 0.134 | 8.58 | 11.20% (6.77%) |
| 10 | NN_TORCH (tuned) | 1128.2 | 1016.4–1260.2 | 0.122 | 9.12 | 9.15% (6.30%) |
| 11 | HUGIML | 1101.9 | 957.4–1266.1 | 0.131 | 9.54 | 16.04% (7.37%) |
| 12 | XT (tuned) | 1082.3 | 1002.8–1175.1 | 0.101 | 9.85 | 14.14% (7.63%) |
| 13 | RF (tuned) | 1000.0 | 1000.0–1000.0 | 0.050 | 11.04 | 15.04% (7.89%) |
| 14 | LR (tuned) | 928.6 | 765.1–1085.4 | 0.056 | 11.92 | 21.20% (12.67%) |
| 15 | KNN (tuned) | 485.3 | 160.1–639.6 | 0.000 | 14.71 | 44.69% (38.88%) |
HUGIML versus each official method
Positive error reduction favors HUGIML.
| Official method | Wins | Ties | Losses | Error reduction · mean (median) |
|---|---|---|---|---|
| KNN (tuned) | 24 | 0 | 2 | 33.94% (33.98%) |
| LR (tuned) | 22 | 0 | 4 | 4.64% (4.02%) |
| XT (tuned) | 11 | 0 | 15 | -4.11% (-0.69%) |
| RF (tuned) | 14 | 0 | 12 | -4.52% (0.36%) |
| FASTAI (tuned) | 12 | 0 | 14 | -12.36% (-0.48%) |
| EBM (tuned) | 6 | 0 | 20 | -15.96% (-3.04%) |
| XGB (tuned) | 5 | 0 | 21 | -17.23% (-3.56%) |
| GBM (tuned) | 4 | 0 | 22 | -18.59% (-4.36%) |
| NN_TORCH (tuned) | 11 | 0 | 15 | -19.64% (-1.61%) |
| CAT (tuned) | 5 | 0 | 21 | -20.24% (-4.37%) |
| REALMLP (tuned) | 8 | 0 | 18 | -20.63% (-3.28%) |
| TABM_GPU (tuned) | 4 | 0 | 22 | -25.86% (-4.33%) |
| MNCA_GPU (tuned) | 7 | 0 | 19 | -27.20% (-5.41%) |
| TABPFNV2_GPU (tuned) | 9 | 0 | 17 | -32.52% (-4.80%) |
Tuned · multiclass
HUGIML plus 14 official variants · 6 completed datasets · Elo anchor RF (tuned) = 1000
Leaderboard
Every displayed statistic is recalculated using only this tab's methods.
| # | Method | Elo | 95% interval | Normalized score | Average rank | Improvability · mean (median) |
|---|---|---|---|---|---|---|
| 1 | TABPFNV2_GPU (tuned) | 1645.3 | 1466.3–6492.2 | 0.821 | 2.33 | 2.41% (0.94%) |
| 2 | REALMLP (tuned) | 1437.4 | 1169.2–6186.6 | 0.374 | 4.50 | 7.91% (5.49%) |
| 3 | TABM_GPU (tuned) | 1437.4 | 1112.8–6542.1 | 0.443 | 4.50 | 8.33% (6.80%) |
| 4 | CAT (tuned) | 1399.4 | 1252.3–6213.3 | 0.391 | 5.00 | 4.87% (5.05%) |
| 5 | XGB (tuned) | 1375.0 | 1094.8–6286.1 | 0.355 | 5.33 | 9.01% (4.62%) |
| 6 | GBM (tuned) | 1363.1 | 970.8–6304.3 | 0.291 | 5.50 | 9.25% (4.89%) |
| 7 | MNCA_GPU (tuned) | 1259.8 | 1030.6–5822.8 | 0.185 | 7.00 | 10.76% (6.78%) |
| 8 | FASTAI (tuned) | 1169.9 | 559.5–6085.3 | 0.199 | 8.33 | 18.47% (7.88%) |
| 9 | XT (tuned) | 1135.5 | 1075.7–1330.0 | 0.162 | 8.83 | 16.15% (12.09%) |
| 10 | NN_TORCH (tuned) | 1088.4 | 651.9–5439.0 | 0.073 | 9.50 | 19.50% (12.79%) |
| 11 | EBM (tuned) | 1076.4 | 738.5–5846.8 | 0.062 | 9.67 | 19.94% (17.33%) |
| 12 | RF (tuned) | 1000.0 | 1000.0–1000.0 | 0.062 | 10.67 | 17.71% (12.99%) |
| 13 | HUGIML | 972.5 | 377.3–5444.0 | 0.001 | 11.00 | 24.34% (17.10%) |
| 14 | LR (tuned) | 742.1 | 347.8–1095.0 | 0.000 | 13.17 | 34.72% (38.21%) |
| 15 | KNN (tuned) | 434.6 | -3480.0–743.9 | 0.000 | 14.67 | 55.12% (55.22%) |
HUGIML versus each official method
Positive error reduction favors HUGIML.
| Official method | Wins | Ties | Losses | Error reduction · mean (median) |
|---|---|---|---|---|
| KNN (tuned) | 6 | 0 | 0 | 46.31% (44.49%) |
| LR (tuned) | 5 | 0 | 1 | 4.16% (22.67%) |
| FASTAI (tuned) | 1 | 0 | 5 | -11.97% (-5.93%) |
| NN_TORCH (tuned) | 2 | 0 | 4 | -12.42% (-3.15%) |
| EBM (tuned) | 2 | 0 | 4 | -19.72% (-5.33%) |
| RF (tuned) | 3 | 0 | 3 | -29.59% (-0.01%) |
| XT (tuned) | 3 | 0 | 3 | -32.14% (-1.07%) |
| MNCA_GPU (tuned) | 1 | 0 | 5 | -34.06% (-7.22%) |
| GBM (tuned) | 0 | 0 | 6 | -35.42% (-14.33%) |
| XGB (tuned) | 0 | 0 | 6 | -37.36% (-10.83%) |
| TABM_GPU (tuned) | 0 | 0 | 6 | -39.67% (-12.43%) |
| REALMLP (tuned) | 1 | 0 | 5 | -40.58% (-13.37%) |
| CAT (tuned) | 0 | 0 | 6 | -54.30% (-10.62%) |
| TABPFNV2_GPU (tuned) | 0 | 0 | 6 | -55.49% (-15.61%) |
Combined · overall
HUGIML plus 45 official variants · 32 completed datasets · Elo anchor RF (tuned) = 1000
Leaderboard
Every displayed statistic is recalculated using only this tab's methods.
| # | Method | Elo | 95% interval | Normalized score | Average rank | Improvability · mean (median) |
|---|---|---|---|---|---|---|
| 1 | TABM_GPU (tuned + ensemble) | 1481.6 | 1361.6–1610.5 | 0.526 | 9.47 | 8.36% (3.54%) |
| 2 | REALMLP (tuned + ensemble) | 1467.1 | 1368.9–1581.9 | 0.502 | 10.00 | 8.03% (4.44%) |
| 3 | TABICL_GPU (default) | 1461.3 | 1378.8–1557.2 | 0.560 | 10.22 | 6.68% (2.96%) |
| 4 | AutoGluon_v130_bq_4h8c | 1453.1 | 1350.2–1590.8 | 0.555 | 10.53 | 7.76% (3.28%) |
| 5 | GBM (tuned + ensemble) | 1423.4 | 1347.6–1516.1 | 0.422 | 11.72 | 10.19% (4.81%) |
| 6 | TABPFNV2_GPU (tuned + ensemble) | 1418.1 | 1230.5–1593.1 | 0.589 | 11.94 | 6.39% (3.02%) |
| 7 | TABM_GPU (tuned) | 1386.7 | 1281.9–1509.7 | 0.433 | 13.28 | 9.44% (4.30%) |
| 8 | CAT (tuned + ensemble) | 1365.7 | 1289.6–1450.9 | 0.386 | 14.22 | 9.62% (5.79%) |
| 9 | GBM (tuned) | 1356.1 | 1278.1–1449.4 | 0.345 | 14.66 | 10.75% (5.12%) |
| 10 | CAT (tuned) | 1354.7 | 1283.3–1436.4 | 0.369 | 14.72 | 9.83% (5.65%) |
| 11 | CAT (default) | 1339.9 | 1260.0–1436.7 | 0.345 | 15.41 | 10.95% (5.48%) |
| 12 | XGB (tuned + ensemble) | 1333.9 | 1256.8–1421.0 | 0.333 | 15.69 | 11.24% (6.11%) |
| 13 | TABPFNV2_GPU (tuned) | 1333.3 | 1152.6–1468.7 | 0.453 | 15.72 | 9.28% (7.77%) |
| 14 | MNCA_GPU (tuned) | 1315.6 | 1238.3–1400.5 | 0.310 | 16.56 | 10.21% (6.24%) |
| 15 | TABPFNV2_GPU (default) | 1305.5 | 1149.9–1465.1 | 0.418 | 17.05 | 10.36% (7.21%) |
| 16 | MNCA_GPU (tuned + ensemble) | 1294.9 | 1199.2–1408.6 | 0.387 | 17.56 | 10.81% (6.50%) |
| 17 | XGB (tuned) | 1294.3 | 1226.4–1384.9 | 0.282 | 17.59 | 11.55% (6.73%) |
| 18 | TABM_GPU (default) | 1283.4 | 1172.9–1402.9 | 0.294 | 18.12 | 12.37% (5.48%) |
| 19 | REALMLP (tuned) | 1258.1 | 1170.4–1355.7 | 0.207 | 19.38 | 11.46% (7.26%) |
| 20 | EBM (tuned + ensemble) | 1255.6 | 1155.1–1355.1 | 0.191 | 19.50 | 13.90% (7.32%) |
| 21 | NN_TORCH (tuned + ensemble) | 1252.5 | 1158.4–1364.2 | 0.238 | 19.66 | 11.81% (6.57%) |
| 22 | FASTAI (tuned + ensemble) | 1237.4 | 1142.7–1366.2 | 0.236 | 20.41 | 13.82% (7.96%) |
| 23 | MNCA_GPU (default) | 1227.4 | 1155.1–1303.9 | 0.175 | 20.91 | 13.42% (6.73%) |
| 24 | EBM (tuned) | 1189.3 | 1089.5–1289.1 | 0.124 | 22.81 | 14.60% (8.17%) |
| 25 | EBM (default) | 1166.6 | 1064.0–1265.7 | 0.144 | 23.94 | 15.27% (8.71%) |
| 26 | TABDPT_GPU (default) | 1159.0 | 1053.7–1266.3 | 0.216 | 24.31 | 14.13% (6.69%) |
| 27 | REALMLP (default) | 1152.0 | 1070.4–1242.6 | 0.103 | 24.66 | 13.79% (9.44%) |
| 28 | FASTAI (tuned) | 1136.6 | 1035.6–1251.2 | 0.109 | 25.41 | 15.47% (9.06%) |
| 29 | XT (tuned + ensemble) | 1120.5 | 1057.7–1181.0 | 0.087 | 26.19 | 16.26% (8.85%) |
| 30 | NN_TORCH (tuned) | 1116.5 | 1021.1–1217.0 | 0.101 | 26.38 | 14.19% (9.46%) |
| 31 | XGB (default) | 1114.6 | 1041.0–1191.3 | 0.095 | 26.47 | 14.80% (10.71%) |
| 32 | GBM (default) | 1069.7 | 1002.1–1149.8 | 0.067 | 28.56 | 15.57% (10.96%) |
| 33 | XT (tuned) | 1068.4 | 1005.8–1128.5 | 0.063 | 28.62 | 17.27% (10.42%) |
| 34 | RF (tuned + ensemble) | 1057.3 | 1034.4–1089.3 | 0.055 | 29.12 | 17.02% (10.36%) |
| 35 | HUGIML | 1056.6 | 958.8–1181.3 | 0.095 | 29.16 | 19.72% (9.40%) |
| 36 | RF (tuned) | 1000.0 | 1000.0–1000.0 | 0.031 | 31.59 | 18.23% (11.79%) |
| 37 | NN_TORCH (default) | 968.9 | 881.8–1053.5 | 0.029 | 32.84 | 18.90% (11.65%) |
| 38 | FASTAI (default) | 950.9 | 848.8–1059.6 | 0.031 | 33.53 | 20.54% (15.48%) |
| 39 | LR (tuned + ensemble) | 914.4 | 789.1–1028.9 | 0.050 | 34.86 | 25.30% (16.59%) |
| 40 | LR (tuned) | 882.0 | 745.2–1001.9 | 0.034 | 35.95 | 25.93% (16.71%) |
| 41 | LR (default) | 868.8 | 729.1–996.3 | 0.024 | 36.38 | 27.17% (16.75%) |
| 42 | RF (default) | 865.8 | 798.2–919.3 | 0.005 | 36.47 | 23.56% (15.51%) |
| 43 | XT (default) | 803.1 | 682.3–896.0 | 0.014 | 38.28 | 25.37% (17.66%) |
| 44 | KNN (tuned + ensemble) | 593.7 | 407.2–706.5 | 0.000 | 42.45 | 46.03% (40.29%) |
| 45 | KNN (tuned) | 506.1 | 265.7–635.7 | 0.000 | 43.55 | 47.87% (43.39%) |
| 46 | KNN (default) | 303.9 | -194.6–485.5 | 0.000 | 45.17 | 56.44% (52.34%) |
HUGIML versus each official method
Positive error reduction favors HUGIML.
| Official method | Wins | Ties | Losses | Error reduction · mean (median) |
|---|---|---|---|---|
| KNN (default) | 31 | 0 | 1 | 46.39% (48.28%) |
| KNN (tuned) | 30 | 0 | 2 | 36.26% (33.98%) |
| KNN (tuned + ensemble) | 29 | 0 | 3 | 33.47% (32.96%) |
| LR (default) | 27 | 0 | 5 | 8.45% (7.90%) |
| XT (default) | 25 | 0 | 7 | 4.97% (6.64%) |
| LR (tuned) | 27 | 0 | 5 | 4.55% (5.15%) |
| LR (tuned + ensemble) | 27 | 0 | 5 | 2.86% (4.93%) |
| RF (default) | 22 | 0 | 10 | 0.02% (5.09%) |
| FASTAI (default) | 21 | 0 | 11 | -3.58% (2.96%) |
| NN_TORCH (default) | 17 | 0 | 15 | -8.76% (0.51%) |
| RF (tuned) | 17 | 0 | 15 | -9.22% (0.36%) |
| XT (tuned) | 14 | 0 | 18 | -9.37% (-0.69%) |
| XT (tuned + ensemble) | 12 | 0 | 20 | -11.12% (-0.87%) |
| FASTAI (tuned) | 13 | 0 | 19 | -12.29% (-0.79%) |
| GBM (default) | 11 | 0 | 21 | -12.40% (-3.11%) |
| RF (tuned + ensemble) | 17 | 0 | 15 | -12.77% (0.14%) |
| EBM (default) | 7 | 0 | 25 | -14.07% (-3.05%) |
| FASTAI (tuned + ensemble) | 10 | 0 | 22 | -14.73% (-2.47%) |
| XGB (default) | 9 | 0 | 23 | -15.17% (-3.59%) |
| EBM (tuned) | 8 | 0 | 24 | -16.66% (-3.36%) |
| TABM_GPU (default) | 3 | 0 | 29 | -16.72% (-5.54%) |
| EBM (tuned + ensemble) | 6 | 0 | 26 | -18.10% (-4.25%) |
| NN_TORCH (tuned) | 13 | 0 | 19 | -18.29% (-1.61%) |
| REALMLP (default) | 14 | 0 | 18 | -19.92% (-1.42%) |
| MNCA_GPU (default) | 6 | 0 | 26 | -20.68% (-3.13%) |
| XGB (tuned) | 5 | 0 | 27 | -21.00% (-5.73%) |
| CAT (default) | 5 | 0 | 27 | -21.11% (-5.33%) |
| XGB (tuned + ensemble) | 5 | 0 | 27 | -21.34% (-5.80%) |
| GBM (tuned) | 4 | 0 | 28 | -21.74% (-5.20%) |
| GBM (tuned + ensemble) | 4 | 0 | 28 | -22.49% (-5.69%) |
| NN_TORCH (tuned + ensemble) | 8 | 0 | 24 | -23.12% (-3.99%) |
| REALMLP (tuned) | 9 | 0 | 23 | -24.37% (-3.67%) |
| TABDPT_GPU (default) | 13 | 0 | 19 | -24.68% (-1.55%) |
| CAT (tuned) | 5 | 0 | 27 | -26.63% (-5.02%) |
| CAT (tuned + ensemble) | 5 | 0 | 27 | -26.88% (-5.14%) |
| TABM_GPU (tuned) | 4 | 0 | 28 | -28.45% (-6.54%) |
| MNCA_GPU (tuned) | 8 | 0 | 24 | -28.48% (-5.41%) |
| MNCA_GPU (tuned + ensemble) | 7 | 0 | 25 | -28.68% (-7.07%) |
| TABM_GPU (tuned + ensemble) | 4 | 0 | 28 | -30.67% (-7.77%) |
| AutoGluon_v130_bq_4h8c | 5 | 0 | 27 | -31.41% (-6.04%) |
| REALMLP (tuned + ensemble) | 2 | 0 | 30 | -31.50% (-6.52%) |
| TABPFNV2_GPU (default) | 8 | 0 | 24 | -33.07% (-3.66%) |
| TABPFNV2_GPU (tuned) | 9 | 0 | 23 | -36.83% (-7.52%) |
| TABICL_GPU (default) | 5 | 0 | 27 | -40.91% (-4.99%) |
| TABPFNV2_GPU (tuned + ensemble) | 8 | 0 | 24 | -44.02% (-10.01%) |
Combined · binary
HUGIML plus 45 official variants · 26 completed datasets · Elo anchor RF (tuned) = 1000
Leaderboard
Every displayed statistic is recalculated using only this tab's methods.
| # | Method | Elo | 95% interval | Normalized score | Average rank | Improvability · mean (median) |
|---|---|---|---|---|---|---|
| 1 | TABICL_GPU (default) | 1495.6 | 1396.8–1605.2 | 0.602 | 9.08 | 4.64% (2.20%) |
| 2 | TABM_GPU (tuned + ensemble) | 1483.7 | 1371.9–1628.2 | 0.532 | 9.50 | 7.40% (3.21%) |
| 3 | AutoGluon_v130_bq_4h8c | 1458.0 | 1324.3–1613.5 | 0.568 | 10.46 | 6.43% (3.23%) |
| 4 | REALMLP (tuned + ensemble) | 1449.2 | 1357.2–1586.7 | 0.471 | 10.81 | 7.74% (3.81%) |
| 5 | GBM (tuned + ensemble) | 1442.4 | 1364.1–1551.9 | 0.439 | 11.08 | 9.21% (4.44%) |
| 6 | TABM_GPU (tuned) | 1390.4 | 1278.8–1527.5 | 0.434 | 13.27 | 8.40% (3.66%) |
| 7 | CAT (default) | 1374.9 | 1276.5–1485.5 | 0.395 | 13.96 | 9.32% (4.37%) |
| 8 | TABPFNV2_GPU (tuned + ensemble) | 1370.7 | 1209.0–1596.4 | 0.522 | 14.15 | 6.84% (3.49%) |
| 9 | GBM (tuned) | 1360.6 | 1286.4–1472.1 | 0.349 | 14.62 | 9.87% (5.12%) |
| 10 | CAT (tuned) | 1356.4 | 1269.1–1463.1 | 0.369 | 14.81 | 9.39% (5.30%) |
| 11 | CAT (tuned + ensemble) | 1354.0 | 1276.8–1466.8 | 0.374 | 14.92 | 9.42% (5.34%) |
| 12 | XGB (tuned + ensemble) | 1333.6 | 1257.0–1442.1 | 0.333 | 15.88 | 10.45% (6.04%) |
| 13 | MNCA_GPU (tuned) | 1328.7 | 1234.3–1450.5 | 0.335 | 16.12 | 8.85% (6.15%) |
| 14 | TABPFNV2_GPU (tuned) | 1295.5 | 1140.6–1518.2 | 0.401 | 17.73 | 9.31% (8.14%) |
| 15 | MNCA_GPU (tuned + ensemble) | 1290.1 | 1177.5–1439.3 | 0.401 | 18.00 | 9.76% (6.89%) |
| 16 | EBM (tuned + ensemble) | 1289.3 | 1201.6–1418.3 | 0.206 | 18.04 | 11.57% (6.20%) |
| 17 | XGB (tuned) | 1281.6 | 1215.9–1373.9 | 0.268 | 18.42 | 10.86% (6.47%) |
| 18 | TABM_GPU (default) | 1281.6 | 1181.8–1418.4 | 0.286 | 18.42 | 11.35% (4.49%) |
| 19 | TABPFNV2_GPU (default) | 1271.2 | 1131.3–1484.1 | 0.383 | 18.94 | 11.61% (7.70%) |
| 20 | NN_TORCH (tuned + ensemble) | 1260.0 | 1152.5–1389.3 | 0.245 | 19.50 | 10.07% (6.57%) |
| 21 | MNCA_GPU (default) | 1252.4 | 1179.3–1344.8 | 0.204 | 19.88 | 11.41% (5.63%) |
| 22 | REALMLP (tuned) | 1237.1 | 1146.0–1360.9 | 0.169 | 20.65 | 10.96% (7.26%) |
| 23 | FASTAI (tuned + ensemble) | 1235.6 | 1140.4–1350.7 | 0.209 | 20.73 | 12.29% (7.97%) |
| 24 | EBM (tuned) | 1215.8 | 1121.3–1340.1 | 0.131 | 21.73 | 12.27% (7.23%) |
| 25 | EBM (default) | 1214.3 | 1110.3–1334.2 | 0.177 | 21.81 | 12.52% (6.62%) |
| 26 | REALMLP (default) | 1181.4 | 1090.7–1292.4 | 0.126 | 23.46 | 11.59% (7.73%) |
| 27 | TABDPT_GPU (default) | 1166.0 | 1045.3–1279.6 | 0.198 | 24.23 | 11.42% (6.69%) |
| 28 | FASTAI (tuned) | 1133.3 | 1037.4–1237.1 | 0.089 | 25.85 | 13.94% (9.06%) |
| 29 | NN_TORCH (tuned) | 1126.9 | 1021.9–1252.0 | 0.106 | 26.15 | 12.09% (9.46%) |
| 30 | XGB (default) | 1115.0 | 1022.0–1211.8 | 0.114 | 26.73 | 13.67% (10.07%) |
| 31 | XT (tuned + ensemble) | 1110.2 | 1037.2–1182.0 | 0.070 | 26.96 | 15.43% (8.35%) |
| 32 | HUGIML | 1074.9 | 943.8–1210.2 | 0.115 | 28.62 | 17.96% (8.34%) |
| 33 | GBM (default) | 1074.9 | 1000.7–1169.3 | 0.067 | 28.62 | 14.10% (10.37%) |
| 34 | XT (tuned) | 1063.1 | 997.2–1138.7 | 0.050 | 29.15 | 16.22% (9.03%) |
| 35 | RF (tuned + ensemble) | 1043.3 | 1014.5–1076.3 | 0.029 | 30.04 | 16.44% (9.87%) |
| 36 | RF (tuned) | 1000.0 | 1000.0–1000.0 | 0.021 | 31.88 | 17.08% (10.17%) |
| 37 | NN_TORCH (default) | 983.9 | 883.9–1084.8 | 0.036 | 32.54 | 16.63% (10.42%) |
| 38 | FASTAI (default) | 972.2 | 845.6–1075.9 | 0.037 | 33.00 | 17.95% (14.46%) |
| 39 | LR (tuned + ensemble) | 940.6 | 808.4–1061.8 | 0.061 | 34.19 | 22.60% (15.78%) |
| 40 | LR (tuned) | 914.6 | 778.4–1046.3 | 0.041 | 35.12 | 23.08% (15.45%) |
| 41 | LR (default) | 907.9 | 736.0–1035.3 | 0.030 | 35.35 | 24.00% (15.45%) |
| 42 | RF (default) | 873.7 | 795.9–944.1 | 0.006 | 36.46 | 21.10% (14.57%) |
| 43 | XT (default) | 815.2 | 689.4–922.4 | 0.017 | 38.15 | 22.65% (17.62%) |
| 44 | KNN (tuned + ensemble) | 555.3 | 349.2–697.4 | 0.000 | 42.94 | 45.26% (40.29%) |
| 45 | KNN (tuned) | 499.0 | 235.1–650.7 | 0.000 | 43.56 | 45.94% (42.20%) |
| 46 | KNN (default) | 211.3 | -390.1–435.9 | 0.000 | 45.48 | 53.37% (48.49%) |
HUGIML versus each official method
Positive error reduction favors HUGIML.
| Official method | Wins | Ties | Losses | Error reduction · mean (median) |
|---|---|---|---|---|
| KNN (default) | 25 | 0 | 1 | 42.79% (44.54%) |
| KNN (tuned) | 24 | 0 | 2 | 33.94% (33.98%) |
| KNN (tuned + ensemble) | 24 | 0 | 2 | 32.95% (32.96%) |
| LR (default) | 21 | 0 | 5 | 6.23% (4.86%) |
| LR (tuned) | 22 | 0 | 4 | 4.64% (4.02%) |
| XT (default) | 21 | 0 | 5 | 4.32% (6.64%) |
| LR (tuned + ensemble) | 22 | 0 | 4 | 3.91% (3.61%) |
| RF (default) | 18 | 0 | 8 | 0.50% (4.62%) |
| XT (tuned) | 11 | 0 | 15 | -4.11% (-0.69%) |
| RF (tuned) | 14 | 0 | 12 | -4.52% (0.36%) |
| XT (tuned + ensemble) | 10 | 0 | 16 | -5.22% (-0.87%) |
| RF (tuned + ensemble) | 14 | 0 | 12 | -5.77% (0.14%) |
| FASTAI (default) | 16 | 0 | 10 | -5.78% (2.20%) |
| NN_TORCH (default) | 12 | 0 | 14 | -8.08% (-0.51%) |
| GBM (default) | 9 | 0 | 17 | -12.17% (-1.81%) |
| FASTAI (tuned) | 12 | 0 | 14 | -12.36% (-0.48%) |
| XGB (default) | 8 | 0 | 18 | -13.10% (-3.39%) |
| TABM_GPU (default) | 3 | 0 | 23 | -13.73% (-3.17%) |
| EBM (default) | 4 | 0 | 22 | -14.61% (-3.05%) |
| FASTAI (tuned + ensemble) | 9 | 0 | 17 | -14.72% (-2.27%) |
| EBM (tuned) | 6 | 0 | 20 | -15.96% (-3.04%) |
| EBM (tuned + ensemble) | 4 | 0 | 22 | -17.16% (-3.94%) |
| XGB (tuned) | 5 | 0 | 21 | -17.23% (-3.56%) |
| XGB (tuned + ensemble) | 5 | 0 | 21 | -17.74% (-4.00%) |
| GBM (tuned) | 4 | 0 | 22 | -18.59% (-4.36%) |
| NN_TORCH (tuned) | 11 | 0 | 15 | -19.64% (-1.61%) |
| GBM (tuned + ensemble) | 4 | 0 | 22 | -19.69% (-5.30%) |
| CAT (tuned + ensemble) | 5 | 0 | 21 | -19.81% (-4.39%) |
| CAT (default) | 5 | 0 | 21 | -20.09% (-4.73%) |
| REALMLP (default) | 11 | 0 | 15 | -20.17% (-1.42%) |
| CAT (tuned) | 5 | 0 | 21 | -20.24% (-4.37%) |
| REALMLP (tuned) | 8 | 0 | 18 | -20.63% (-3.28%) |
| MNCA_GPU (default) | 4 | 0 | 22 | -21.16% (-3.56%) |
| TABPFNV2_GPU (default) | 8 | 0 | 18 | -21.80% (-3.36%) |
| NN_TORCH (tuned + ensemble) | 8 | 0 | 18 | -23.17% (-2.84%) |
| TABM_GPU (tuned) | 4 | 0 | 22 | -25.86% (-4.33%) |
| REALMLP (tuned + ensemble) | 2 | 0 | 24 | -26.37% (-5.29%) |
| MNCA_GPU (tuned) | 7 | 0 | 19 | -27.20% (-5.41%) |
| MNCA_GPU (tuned + ensemble) | 7 | 0 | 19 | -27.34% (-7.07%) |
| TABM_GPU (tuned + ensemble) | 4 | 0 | 22 | -27.67% (-5.37%) |
| TABDPT_GPU (default) | 10 | 0 | 16 | -28.47% (-1.55%) |
| AutoGluon_v130_bq_4h8c | 5 | 0 | 21 | -31.09% (-4.77%) |
| TABPFNV2_GPU (tuned) | 9 | 0 | 17 | -32.52% (-4.80%) |
| TABPFNV2_GPU (tuned + ensemble) | 8 | 0 | 18 | -38.00% (-4.19%) |
| TABICL_GPU (default) | 4 | 0 | 22 | -41.15% (-4.99%) |
Combined · multiclass
HUGIML plus 45 official variants · 6 completed datasets · Elo anchor RF (tuned) = 1000
Leaderboard
Every displayed statistic is recalculated using only this tab's methods.
| # | Method | Elo | 95% interval | Normalized score | Average rank | Improvability · mean (median) |
|---|---|---|---|---|---|---|
| 1 | TABPFNV2_GPU (tuned + ensemble) | 1919.4 | 1716.6–6587.1 | 0.880 | 2.33 | 4.45% (0.34%) |
| 2 | REALMLP (tuned + ensemble) | 1640.8 | 1457.6–2420.3 | 0.637 | 6.50 | 9.29% (5.25%) |
| 3 | TABPFNV2_GPU (tuned) | 1619.7 | 1450.3–2396.3 | 0.674 | 7.00 | 9.15% (4.94%) |
| 4 | TABPFNV2_GPU (default) | 1551.3 | 1347.9–2377.0 | 0.570 | 8.83 | 4.99% (5.03%) |
| 5 | TABM_GPU (tuned + ensemble) | 1534.5 | 1252.3–2469.1 | 0.502 | 9.33 | 12.52% (8.00%) |
| 6 | AutoGluon_v130_bq_4h8c | 1487.4 | 1010.2–2543.4 | 0.498 | 10.83 | 13.52% (4.01%) |
| 7 | CAT (tuned + ensemble) | 1477.5 | 1357.9–2169.4 | 0.443 | 11.17 | 10.49% (8.69%) |
| 8 | TABM_GPU (tuned) | 1416.7 | 1121.8–2316.4 | 0.429 | 13.33 | 13.97% (8.96%) |
| 9 | REALMLP (tuned) | 1403.4 | 1177.8–2171.4 | 0.370 | 13.83 | 13.63% (8.20%) |
| 10 | XGB (tuned) | 1399.1 | 1196.0–2240.6 | 0.342 | 14.00 | 14.53% (10.25%) |
| 11 | CAT (tuned) | 1390.4 | 1256.9–2027.0 | 0.367 | 14.33 | 11.73% (9.93%) |
| 12 | GBM (tuned + ensemble) | 1386.1 | 1037.4–2226.7 | 0.349 | 14.50 | 14.45% (7.63%) |
| 13 | GBM (tuned) | 1377.5 | 1066.2–2217.1 | 0.326 | 14.83 | 14.60% (7.99%) |
| 14 | XGB (tuned + ensemble) | 1377.5 | 1162.1–2260.8 | 0.329 | 14.83 | 14.69% (10.31%) |
| 15 | TABICL_GPU (default) | 1369.0 | 1212.9–1904.7 | 0.377 | 15.17 | 15.52% (5.82%) |
| 16 | MNCA_GPU (tuned + ensemble) | 1356.4 | 1133.9–1901.7 | 0.322 | 15.67 | 15.39% (6.50%) |
| 17 | TABM_GPU (default) | 1327.5 | 1017.8–2300.2 | 0.326 | 16.83 | 16.79% (10.04%) |
| 18 | MNCA_GPU (tuned) | 1287.3 | 1121.4–1753.0 | 0.202 | 18.50 | 16.11% (8.68%) |
| 19 | FASTAI (tuned + ensemble) | 1275.4 | 704.5–2342.1 | 0.353 | 19.00 | 20.49% (6.21%) |
| 20 | NN_TORCH (tuned + ensemble) | 1243.8 | 814.6–1975.8 | 0.210 | 20.33 | 19.33% (9.80%) |
| 21 | CAT (default) | 1212.4 | 805.9–1934.2 | 0.130 | 21.67 | 18.02% (11.10%) |
| 22 | XT (tuned + ensemble) | 1185.0 | 1126.0–1338.5 | 0.159 | 22.83 | 19.84% (10.05%) |
| 23 | FASTAI (tuned) | 1169.2 | 533.0–2090.9 | 0.195 | 23.50 | 22.13% (8.28%) |
| 24 | TABDPT_GPU (default) | 1141.6 | 694.4–1670.4 | 0.297 | 24.67 | 25.87% (8.34%) |
| 25 | RF (tuned + ensemble) | 1129.6 | 1082.4–1243.2 | 0.170 | 25.17 | 19.49% (11.80%) |
| 26 | MNCA_GPU (default) | 1125.6 | 838.2–1582.6 | 0.052 | 25.33 | 22.15% (12.83%) |
| 27 | XGB (default) | 1125.6 | 859.1–1644.0 | 0.010 | 25.33 | 19.67% (14.30%) |
| 28 | EBM (tuned + ensemble) | 1113.5 | 830.0–1900.4 | 0.124 | 25.83 | 23.97% (21.33%) |
| 29 | XT (tuned) | 1101.4 | 1051.3–1197.4 | 0.118 | 26.33 | 21.78% (12.47%) |
| 30 | NN_TORCH (tuned) | 1076.8 | 632.9–1649.1 | 0.077 | 27.33 | 23.30% (14.59%) |
| 31 | EBM (tuned) | 1072.7 | 786.2–1840.5 | 0.096 | 27.50 | 24.67% (22.12%) |
| 32 | GBM (default) | 1051.8 | 545.1–1620.0 | 0.067 | 28.33 | 21.95% (13.75%) |
| 33 | REALMLP (default) | 1013.2 | 697.0–1476.3 | 0.000 | 29.83 | 23.36% (17.34%) |
| 34 | RF (tuned) | 1000.0 | 1000.0–1000.0 | 0.072 | 30.33 | 23.22% (14.73%) |
| 35 | HUGIML | 968.4 | 375.8–1601.8 | 0.010 | 31.50 | 27.35% (19.04%) |
| 36 | EBM (default) | 920.8 | 562.2–1435.4 | 0.002 | 33.17 | 27.16% (22.42%) |
| 37 | NN_TORCH (default) | 890.7 | 668.4–1217.1 | 0.000 | 34.17 | 28.73% (28.30%) |
| 38 | FASTAI (default) | 837.2 | 199.5–1396.3 | 0.005 | 35.83 | 31.76% (24.67%) |
| 39 | RF (default) | 814.3 | 539.6–905.6 | 0.000 | 36.50 | 34.21% (22.50%) |
| 40 | LR (tuned + ensemble) | 768.8 | 515.9–1047.5 | 0.000 | 37.75 | 37.01% (39.42%) |
| 41 | XT (default) | 725.8 | 260.4–883.7 | 0.000 | 38.83 | 37.16% (23.19%) |
| 42 | LR (tuned) | 693.7 | 331.5–994.8 | 0.000 | 39.58 | 38.28% (39.65%) |
| 43 | KNN (tuned + ensemble) | 659.2 | 56.0–825.1 | 0.000 | 40.33 | 49.38% (43.39%) |
| 44 | LR (default) | 634.6 | 26.1–1010.1 | 0.000 | 40.83 | 40.92% (39.54%) |
| 45 | KNN (tuned) | 467.8 | -5261.5–743.3 | 0.000 | 43.50 | 56.24% (57.22%) |
| 46 | KNN (default) | 439.9 | -10097.7–762.3 | 0.000 | 43.83 | 69.78% (71.79%) |
HUGIML versus each official method
Positive error reduction favors HUGIML.
| Official method | Wins | Ties | Losses | Error reduction · mean (median) |
|---|---|---|---|---|
| KNN (default) | 6 | 0 | 0 | 62.00% (66.27%) |
| KNN (tuned) | 6 | 0 | 0 | 46.31% (44.49%) |
| KNN (tuned + ensemble) | 5 | 0 | 1 | 35.73% (38.24%) |
| LR (default) | 6 | 0 | 0 | 18.05% (22.53%) |
| XT (default) | 4 | 0 | 2 | 7.80% (8.01%) |
| FASTAI (default) | 5 | 0 | 1 | 5.98% (5.79%) |
| LR (tuned) | 5 | 0 | 1 | 4.16% (22.67%) |
| LR (tuned + ensemble) | 5 | 0 | 1 | -1.68% (22.16%) |
| RF (default) | 4 | 0 | 2 | -2.03% (6.74%) |
| TABDPT_GPU (default) | 3 | 0 | 3 | -8.22% (-8.37%) |
| NN_TORCH (default) | 5 | 0 | 1 | -11.69% (3.48%) |
| EBM (default) | 3 | 0 | 3 | -11.70% (-1.77%) |
| FASTAI (tuned) | 1 | 0 | 5 | -11.97% (-5.93%) |
| NN_TORCH (tuned) | 2 | 0 | 4 | -12.42% (-3.15%) |
| GBM (default) | 2 | 0 | 4 | -13.44% (-9.16%) |
| FASTAI (tuned + ensemble) | 1 | 0 | 5 | -14.79% (-8.29%) |
| MNCA_GPU (default) | 2 | 0 | 4 | -18.60% (-2.36%) |
| REALMLP (default) | 3 | 0 | 3 | -18.84% (-2.35%) |
| EBM (tuned) | 2 | 0 | 4 | -19.72% (-5.33%) |
| EBM (tuned + ensemble) | 2 | 0 | 4 | -22.16% (-6.05%) |
| NN_TORCH (tuned + ensemble) | 0 | 0 | 6 | -22.92% (-7.15%) |
| XGB (default) | 1 | 0 | 5 | -24.16% (-4.38%) |
| CAT (default) | 0 | 0 | 6 | -25.54% (-9.85%) |
| RF (tuned) | 3 | 0 | 3 | -29.59% (-0.01%) |
| TABM_GPU (default) | 0 | 0 | 6 | -29.69% (-11.14%) |
| XT (tuned) | 3 | 0 | 3 | -32.14% (-1.07%) |
| AutoGluon_v130_bq_4h8c | 0 | 0 | 6 | -32.84% (-19.93%) |
| MNCA_GPU (tuned) | 1 | 0 | 5 | -34.06% (-7.22%) |
| MNCA_GPU (tuned + ensemble) | 0 | 0 | 6 | -34.45% (-8.56%) |
| GBM (tuned + ensemble) | 0 | 0 | 6 | -34.63% (-15.59%) |
| GBM (tuned) | 0 | 0 | 6 | -35.42% (-14.33%) |
| XT (tuned + ensemble) | 2 | 0 | 4 | -36.70% (-3.94%) |
| XGB (tuned + ensemble) | 0 | 0 | 6 | -36.97% (-10.83%) |
| XGB (tuned) | 0 | 0 | 6 | -37.36% (-10.83%) |
| TABM_GPU (tuned) | 0 | 0 | 6 | -39.67% (-12.43%) |
| TABICL_GPU (default) | 1 | 0 | 5 | -39.85% (-9.74%) |
| REALMLP (tuned) | 1 | 0 | 5 | -40.58% (-13.37%) |
| RF (tuned + ensemble) | 3 | 0 | 3 | -43.10% (-2.13%) |
| TABM_GPU (tuned + ensemble) | 0 | 0 | 6 | -43.69% (-13.62%) |
| REALMLP (tuned + ensemble) | 0 | 0 | 6 | -53.71% (-17.04%) |
| CAT (tuned) | 0 | 0 | 6 | -54.30% (-10.62%) |
| TABPFNV2_GPU (tuned) | 0 | 0 | 6 | -55.49% (-15.61%) |
| CAT (tuned + ensemble) | 0 | 0 | 6 | -57.50% (-12.78%) |
| TABPFNV2_GPU (tuned + ensemble) | 0 | 0 | 6 | -70.10% (-23.54%) |
| TABPFNV2_GPU (default) | 0 | 0 | 6 | -81.94% (-17.30%) |
Predictive metrics and HUGIML deltas
Positive delta favors HUGIML. Rows are ordered by mean ROC AUC.
| Method | ROC AUC | Balanced accuracy | F1 | Brier | ||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Mean | Median | HUGIML delta | Mean | Median | HUGIML delta | Mean | Median | HUGIML delta | Mean | Median | HUGIML delta | |
| TabPFNv2_GPU | 0.8717 | 0.8853 | -0.0116 | 0.7233 | 0.7283 | -0.0208 | 0.6085 | 0.6867 | -0.0290 | 0.1132 | 0.0960 | -0.0101 |
| TabICL_GPU | 0.8597 | 0.8586 | -0.0172 | 0.7027 | 0.7201 | -0.0205 | 0.5740 | 0.6460 | -0.0230 | 0.1074 | 0.0911 | -0.0095 |
| CatBoost | 0.8577 | 0.8672 | -0.0152 | 0.6963 | 0.7058 | -0.0142 | 0.5701 | 0.6420 | -0.0191 | 0.1102 | 0.0941 | -0.0067 |
| TabM_GPU | 0.8551 | 0.8573 | -0.0126 | 0.6978 | 0.7073 | -0.0157 | 0.5643 | 0.6488 | -0.0133 | 0.1113 | 0.0942 | -0.0056 |
| ModernNCA_GPU | 0.8546 | 0.8529 | -0.0121 | 0.6887 | 0.7043 | -0.0066 | 0.5635 | 0.6352 | -0.0126 | 0.1112 | 0.0954 | -0.0058 |
| RealMLP | 0.8528 | 0.8548 | -0.0102 | 0.7026 | 0.7090 | -0.0204 | 0.5799 | 0.6463 | -0.0290 | 0.1134 | 0.0978 | -0.0035 |
| XGBoost | 0.8510 | 0.8475 | -0.0085 | 0.6905 | 0.7005 | -0.0084 | 0.5613 | 0.6452 | -0.0104 | 0.1119 | 0.0956 | -0.0051 |
| ExplainableBM | 0.8509 | 0.8467 | -0.0083 | 0.6852 | 0.6939 | -0.0030 | 0.5593 | 0.6404 | -0.0084 | 0.1157 | 0.0933 | -0.0012 |
| TabDPT_GPU | 0.8508 | 0.8412 | -0.0083 | 0.6953 | 0.7016 | -0.0132 | 0.5663 | 0.6377 | -0.0153 | 0.1124 | 0.0986 | -0.0045 |
| LightGBM | 0.8496 | 0.8396 | -0.0071 | 0.6902 | 0.6953 | -0.0081 | 0.5610 | 0.6440 | -0.0101 | 0.1123 | 0.0957 | -0.0047 |
| NeuralNetTorch | 0.8445 | 0.8463 | -0.0020 | 0.6900 | 0.7095 | -0.0079 | 0.5570 | 0.6141 | -0.0060 | 0.1178 | 0.0972 | 0.0009 |
| HUGIML | 0.8425 | 0.8365 | 0.0000 | 0.6821 | 0.6981 | 0.0000 | 0.5509 | 0.6004 | 0.0000 | 0.1169 | 0.0976 | 0.0000 |
| RandomForest | 0.8391 | 0.8403 | 0.0034 | 0.6867 | 0.6818 | -0.0046 | 0.5620 | 0.6067 | -0.0111 | 0.1198 | 0.1014 | 0.0029 |
| NeuralNetFastAI | 0.8372 | 0.8290 | 0.0054 | 0.6759 | 0.6921 | 0.0062 | 0.5373 | 0.6049 | 0.0136 | 0.1198 | 0.0941 | 0.0029 |
| ExtraTrees | 0.8345 | 0.8347 | 0.0081 | 0.6726 | 0.6622 | 0.0095 | 0.5411 | 0.5698 | 0.0099 | 0.1233 | 0.1018 | 0.0064 |
| LinearModel | 0.8255 | 0.8082 | 0.0170 | 0.6529 | 0.6412 | 0.0292 | 0.5085 | 0.5741 | 0.0424 | 0.1300 | 0.1030 | 0.0130 |
| KNeighbors | 0.6615 | 0.6288 | 0.1696 | 0.5655 | 0.5514 | 0.0972 | 0.3620 | 0.3048 | 0.1357 | 0.1860 | 0.1742 | 0.0633 |
Predictive metrics and HUGIML deltas
Positive delta favors HUGIML. Rows are ordered by mean ROC AUC.
| Method | ROC AUC | Balanced accuracy | F1 | Brier | ||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Mean | Median | HUGIML delta | Mean | Median | HUGIML delta | Mean | Median | HUGIML delta | Mean | Median | HUGIML delta | |
| TabPFNv2_GPU | 0.8496 | 0.8331 | -0.0108 | 0.7106 | 0.7253 | -0.0183 | 0.5608 | 0.6479 | -0.0302 | 0.1004 | 0.0920 | -0.0053 |
| TabICL_GPU | 0.8397 | 0.8279 | -0.0177 | 0.6890 | 0.7101 | -0.0194 | 0.5301 | 0.6010 | -0.0234 | 0.0958 | 0.0883 | -0.0061 |
| CatBoost | 0.8378 | 0.8234 | -0.0158 | 0.6846 | 0.6886 | -0.0150 | 0.5282 | 0.5911 | -0.0215 | 0.0978 | 0.0893 | -0.0041 |
| ModernNCA_GPU | 0.8344 | 0.8148 | -0.0124 | 0.6751 | 0.6960 | -0.0056 | 0.5196 | 0.5843 | -0.0128 | 0.0987 | 0.0902 | -0.0033 |
| TabM_GPU | 0.8344 | 0.8247 | -0.0124 | 0.6848 | 0.6946 | -0.0153 | 0.5200 | 0.5906 | -0.0132 | 0.0989 | 0.0897 | -0.0030 |
| RealMLP | 0.8330 | 0.8224 | -0.0110 | 0.6905 | 0.7014 | -0.0210 | 0.5385 | 0.5833 | -0.0317 | 0.0992 | 0.0917 | -0.0027 |
| ExplainableBM | 0.8329 | 0.8075 | -0.0109 | 0.6798 | 0.6939 | -0.0102 | 0.5235 | 0.5781 | -0.0167 | 0.0993 | 0.0896 | -0.0027 |
| XGBoost | 0.8300 | 0.8144 | -0.0080 | 0.6756 | 0.6719 | -0.0061 | 0.5154 | 0.5858 | -0.0086 | 0.0997 | 0.0901 | -0.0023 |
| TabDPT_GPU | 0.8297 | 0.8096 | -0.0077 | 0.6837 | 0.7002 | -0.0141 | 0.5250 | 0.5809 | -0.0183 | 0.0984 | 0.0904 | -0.0035 |
| LightGBM | 0.8295 | 0.8153 | -0.0075 | 0.6768 | 0.6776 | -0.0072 | 0.5171 | 0.5872 | -0.0104 | 0.0995 | 0.0903 | -0.0025 |
| NeuralNetTorch | 0.8251 | 0.8168 | -0.0030 | 0.6800 | 0.7002 | -0.0105 | 0.5166 | 0.5797 | -0.0099 | 0.1016 | 0.0906 | -0.0003 |
| HUGIML | 0.8220 | 0.7947 | 0.0000 | 0.6696 | 0.6807 | 0.0000 | 0.5067 | 0.5607 | 0.0000 | 0.1019 | 0.0904 | 0.0000 |
| NeuralNetFastAI | 0.8192 | 0.8082 | 0.0028 | 0.6711 | 0.6757 | -0.0015 | 0.4986 | 0.5781 | 0.0082 | 0.1015 | 0.0904 | -0.0004 |
| RandomForest | 0.8162 | 0.8016 | 0.0058 | 0.6731 | 0.6642 | -0.0036 | 0.5188 | 0.5397 | -0.0120 | 0.1051 | 0.0937 | 0.0032 |
| ExtraTrees | 0.8108 | 0.7940 | 0.0112 | 0.6579 | 0.6528 | 0.0117 | 0.4943 | 0.5171 | 0.0124 | 0.1071 | 0.0951 | 0.0051 |
| LinearModel | 0.8070 | 0.7836 | 0.0150 | 0.6448 | 0.6215 | 0.0247 | 0.4660 | 0.4554 | 0.0407 | 0.1090 | 0.0961 | 0.0071 |
| KNeighbors | 0.6451 | 0.6074 | 0.1737 | 0.5832 | 0.5514 | 0.0813 | 0.3437 | 0.2606 | 0.1269 | 0.1541 | 0.1418 | 0.0476 |
Predictive metrics and HUGIML deltas
Positive delta favors HUGIML. Rows are ordered by mean ROC AUC.
| Method | ROC AUC | Balanced accuracy | F1 | Brier | ||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Mean | Median | HUGIML delta | Mean | Median | HUGIML delta | Mean | Median | HUGIML delta | Mean | Median | HUGIML delta | |
| TabICL_GPU | 0.9466 | 0.9656 | -0.0151 | 0.7618 | 0.8696 | -0.0253 | 0.7640 | 0.8673 | -0.0215 | 0.1577 | 0.1583 | -0.0243 |
| TabPFNv2_GPU | 0.9456 | 0.9600 | -0.0141 | 0.7657 | 0.8656 | -0.0293 | 0.7673 | 0.8622 | -0.0248 | 0.1558 | 0.1574 | -0.0262 |
| TabM_GPU | 0.9450 | 0.9485 | -0.0135 | 0.7540 | 0.8475 | -0.0176 | 0.7562 | 0.8410 | -0.0137 | 0.1652 | 0.1571 | -0.0168 |
| CatBoost | 0.9442 | 0.9549 | -0.0127 | 0.7471 | 0.8400 | -0.0107 | 0.7514 | 0.8416 | -0.0090 | 0.1641 | 0.1621 | -0.0178 |
| TabDPT_GPU | 0.9423 | 0.9643 | -0.0108 | 0.7457 | 0.8620 | -0.0093 | 0.7451 | 0.8658 | -0.0026 | 0.1732 | 0.1693 | -0.0088 |
| ModernNCA_GPU | 0.9421 | 0.9588 | -0.0106 | 0.7478 | 0.8428 | -0.0114 | 0.7539 | 0.8468 | -0.0114 | 0.1653 | 0.1673 | -0.0167 |
| XGBoost | 0.9421 | 0.9556 | -0.0106 | 0.7551 | 0.8530 | -0.0187 | 0.7606 | 0.8504 | -0.0182 | 0.1647 | 0.1647 | -0.0173 |
| RealMLP | 0.9385 | 0.9400 | -0.0070 | 0.7546 | 0.8257 | -0.0182 | 0.7594 | 0.8223 | -0.0169 | 0.1749 | 0.1648 | -0.0070 |
| RandomForest | 0.9383 | 0.9556 | -0.0069 | 0.7456 | 0.8345 | -0.0092 | 0.7495 | 0.8384 | -0.0070 | 0.1835 | 0.1753 | 0.0016 |
| ExtraTrees | 0.9370 | 0.9545 | -0.0056 | 0.7365 | 0.8264 | -0.0001 | 0.7437 | 0.8335 | -0.0012 | 0.1937 | 0.1881 | 0.0117 |
| LightGBM | 0.9369 | 0.9532 | -0.0054 | 0.7487 | 0.8437 | -0.0122 | 0.7514 | 0.8421 | -0.0089 | 0.1677 | 0.1695 | -0.0143 |
| HUGIML | 0.9315 | 0.9348 | 0.0000 | 0.7364 | 0.7965 | 0.0000 | 0.7425 | 0.7979 | 0.0000 | 0.1820 | 0.1668 | 0.0000 |
| NeuralNetTorch | 0.9289 | 0.9267 | 0.0025 | 0.7333 | 0.7985 | 0.0031 | 0.7319 | 0.7950 | 0.0106 | 0.1881 | 0.1735 | 0.0061 |
| ExplainableBM | 0.9285 | 0.9194 | 0.0029 | 0.7085 | 0.7126 | 0.0279 | 0.7145 | 0.7174 | 0.0280 | 0.1869 | 0.1923 | 0.0049 |
| NeuralNetFastAI | 0.9150 | 0.9203 | 0.0165 | 0.6970 | 0.7002 | 0.0394 | 0.7053 | 0.7100 | 0.0372 | 0.1994 | 0.1897 | 0.0174 |
| LinearModel | 0.9060 | 0.9157 | 0.0255 | 0.6878 | 0.6801 | 0.0486 | 0.6925 | 0.6895 | 0.0500 | 0.2207 | 0.2037 | 0.0388 |
| KNeighbors | 0.7599 | 0.8084 | 0.1448 | 0.4593 | 0.5080 | 0.1923 | 0.4722 | 0.5289 | 0.1883 | 0.3773 | 0.3734 | 0.1576 |
Predictive metrics and HUGIML deltas
Positive delta favors HUGIML. Rows are ordered by mean ROC AUC.
| Method | ROC AUC | Balanced accuracy | F1 | Brier | ||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Mean | Median | HUGIML delta | Mean | Median | HUGIML delta | Mean | Median | HUGIML delta | Mean | Median | HUGIML delta | |
| TabPFNv2_GPU | 0.8747 | 0.8913 | -0.0145 | 0.7244 | 0.7268 | -0.0219 | 0.6145 | 0.6869 | -0.0350 | 0.1127 | 0.0970 | -0.0106 |
| CatBoost | 0.8580 | 0.8675 | -0.0155 | 0.6986 | 0.7044 | -0.0165 | 0.5720 | 0.6418 | -0.0211 | 0.1093 | 0.0939 | -0.0076 |
| TabM_GPU | 0.8579 | 0.8593 | -0.0153 | 0.6987 | 0.7200 | -0.0166 | 0.5728 | 0.6483 | -0.0219 | 0.1087 | 0.0929 | -0.0082 |
| LightGBM | 0.8573 | 0.8582 | -0.0148 | 0.6967 | 0.7076 | -0.0146 | 0.5695 | 0.6436 | -0.0186 | 0.1091 | 0.0932 | -0.0078 |
| ModernNCA_GPU | 0.8573 | 0.8632 | -0.0147 | 0.7018 | 0.7101 | -0.0197 | 0.5695 | 0.6390 | -0.0186 | 0.1091 | 0.0955 | -0.0079 |
| XGBoost | 0.8564 | 0.8624 | -0.0139 | 0.6975 | 0.7047 | -0.0154 | 0.5707 | 0.6486 | -0.0197 | 0.1096 | 0.0938 | -0.0074 |
| RealMLP | 0.8550 | 0.8560 | -0.0125 | 0.7035 | 0.7123 | -0.0213 | 0.5780 | 0.6476 | -0.0270 | 0.1098 | 0.0993 | -0.0071 |
| ExplainableBM | 0.8515 | 0.8524 | -0.0089 | 0.6869 | 0.6911 | -0.0048 | 0.5616 | 0.6454 | -0.0107 | 0.1148 | 0.0935 | -0.0021 |
| NeuralNetTorch | 0.8513 | 0.8497 | -0.0087 | 0.6931 | 0.7093 | -0.0110 | 0.5613 | 0.6484 | -0.0104 | 0.1137 | 0.0978 | -0.0033 |
| ExtraTrees | 0.8469 | 0.8393 | -0.0043 | 0.6773 | 0.6650 | 0.0048 | 0.5379 | 0.5901 | 0.0131 | 0.1145 | 0.0956 | -0.0024 |
| NeuralNetFastAI | 0.8468 | 0.8475 | -0.0043 | 0.6824 | 0.7047 | -0.0003 | 0.5418 | 0.6159 | 0.0092 | 0.1149 | 0.0932 | -0.0020 |
| RandomForest | 0.8462 | 0.8352 | -0.0037 | 0.6918 | 0.6948 | -0.0097 | 0.5658 | 0.6312 | -0.0149 | 0.1146 | 0.0962 | -0.0023 |
| HUGIML | 0.8425 | 0.8365 | 0.0000 | 0.6821 | 0.6981 | 0.0000 | 0.5509 | 0.6004 | 0.0000 | 0.1169 | 0.0976 | 0.0000 |
| LinearModel | 0.8280 | 0.8168 | 0.0145 | 0.6564 | 0.6397 | 0.0258 | 0.5132 | 0.5731 | 0.0377 | 0.1284 | 0.1013 | 0.0115 |
| KNeighbors | 0.7053 | 0.6901 | 0.1257 | 0.5506 | 0.5206 | 0.1121 | 0.3143 | 0.2496 | 0.1834 | 0.1713 | 0.1484 | 0.0487 |
Predictive metrics and HUGIML deltas
Positive delta favors HUGIML. Rows are ordered by mean ROC AUC.
| Method | ROC AUC | Balanced accuracy | F1 | Brier | ||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Mean | Median | HUGIML delta | Mean | Median | HUGIML delta | Mean | Median | HUGIML delta | Mean | Median | HUGIML delta | |
| TabPFNv2_GPU | 0.8520 | 0.8309 | -0.0133 | 0.7119 | 0.7255 | -0.0195 | 0.5691 | 0.6505 | -0.0385 | 0.1006 | 0.0940 | -0.0050 |
| CatBoost | 0.8378 | 0.8228 | -0.0158 | 0.6848 | 0.6906 | -0.0152 | 0.5278 | 0.5877 | -0.0211 | 0.0977 | 0.0894 | -0.0042 |
| TabM_GPU | 0.8371 | 0.8240 | -0.0151 | 0.6843 | 0.7100 | -0.0147 | 0.5288 | 0.6012 | -0.0220 | 0.0971 | 0.0896 | -0.0048 |
| ModernNCA_GPU | 0.8368 | 0.8240 | -0.0148 | 0.6889 | 0.7071 | -0.0193 | 0.5260 | 0.5915 | -0.0193 | 0.0976 | 0.0902 | -0.0044 |
| LightGBM | 0.8368 | 0.8263 | -0.0148 | 0.6829 | 0.6971 | -0.0133 | 0.5255 | 0.5835 | -0.0187 | 0.0975 | 0.0896 | -0.0044 |
| XGBoost | 0.8355 | 0.8191 | -0.0135 | 0.6832 | 0.6900 | -0.0136 | 0.5262 | 0.5824 | -0.0195 | 0.0981 | 0.0895 | -0.0038 |
| RealMLP | 0.8339 | 0.8232 | -0.0119 | 0.6888 | 0.7090 | -0.0193 | 0.5340 | 0.5915 | -0.0273 | 0.0989 | 0.0928 | -0.0030 |
| ExplainableBM | 0.8328 | 0.8085 | -0.0108 | 0.6811 | 0.6911 | -0.0115 | 0.5253 | 0.5822 | -0.0186 | 0.0990 | 0.0897 | -0.0029 |
| NeuralNetTorch | 0.8319 | 0.8191 | -0.0099 | 0.6804 | 0.6991 | -0.0108 | 0.5184 | 0.5933 | -0.0117 | 0.0993 | 0.0912 | -0.0026 |
| NeuralNetFastAI | 0.8274 | 0.8182 | -0.0054 | 0.6703 | 0.6754 | -0.0007 | 0.4969 | 0.5665 | 0.0099 | 0.0994 | 0.0902 | -0.0025 |
| RandomForest | 0.8262 | 0.8099 | -0.0042 | 0.6782 | 0.6694 | -0.0086 | 0.5221 | 0.5816 | -0.0153 | 0.1016 | 0.0913 | -0.0004 |
| ExtraTrees | 0.8259 | 0.8100 | -0.0039 | 0.6603 | 0.6440 | 0.0092 | 0.4884 | 0.4821 | 0.0184 | 0.1022 | 0.0913 | 0.0002 |
| HUGIML | 0.8220 | 0.7947 | 0.0000 | 0.6696 | 0.6807 | 0.0000 | 0.5067 | 0.5607 | 0.0000 | 0.1019 | 0.0904 | 0.0000 |
| LinearModel | 0.8106 | 0.7912 | 0.0114 | 0.6489 | 0.6313 | 0.0207 | 0.4719 | 0.4776 | 0.0348 | 0.1079 | 0.0959 | 0.0059 |
| KNeighbors | 0.6945 | 0.6769 | 0.1243 | 0.5756 | 0.5206 | 0.0890 | 0.3004 | 0.1884 | 0.1702 | 0.1385 | 0.1251 | 0.0321 |
Predictive metrics and HUGIML deltas
Positive delta favors HUGIML. Rows are ordered by mean ROC AUC.
| Method | ROC AUC | Balanced accuracy | F1 | Brier | ||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Mean | Median | HUGIML delta | Mean | Median | HUGIML delta | Mean | Median | HUGIML delta | Mean | Median | HUGIML delta | |
| TabPFNv2_GPU | 0.9501 | 0.9622 | -0.0187 | 0.7660 | 0.8754 | -0.0295 | 0.7659 | 0.8689 | -0.0234 | 0.1529 | 0.1523 | -0.0290 |
| TabM_GPU | 0.9478 | 0.9557 | -0.0163 | 0.7612 | 0.8659 | -0.0248 | 0.7636 | 0.8569 | -0.0211 | 0.1590 | 0.1536 | -0.0229 |
| XGBoost | 0.9471 | 0.9579 | -0.0156 | 0.7594 | 0.8529 | -0.0230 | 0.7632 | 0.8503 | -0.0207 | 0.1592 | 0.1595 | -0.0228 |
| RealMLP | 0.9465 | 0.9580 | -0.0150 | 0.7668 | 0.8670 | -0.0304 | 0.7686 | 0.8592 | -0.0261 | 0.1572 | 0.1544 | -0.0248 |
| LightGBM | 0.9460 | 0.9579 | -0.0145 | 0.7565 | 0.8497 | -0.0200 | 0.7605 | 0.8489 | -0.0180 | 0.1595 | 0.1612 | -0.0225 |
| CatBoost | 0.9458 | 0.9580 | -0.0143 | 0.7588 | 0.8480 | -0.0224 | 0.7636 | 0.8492 | -0.0211 | 0.1595 | 0.1596 | -0.0224 |
| ModernNCA_GPU | 0.9457 | 0.9608 | -0.0143 | 0.7578 | 0.8646 | -0.0214 | 0.7581 | 0.8587 | -0.0156 | 0.1589 | 0.1604 | -0.0231 |
| ExtraTrees | 0.9379 | 0.9582 | -0.0064 | 0.7509 | 0.8483 | -0.0144 | 0.7525 | 0.8491 | -0.0100 | 0.1679 | 0.1660 | -0.0141 |
| NeuralNetTorch | 0.9354 | 0.9384 | -0.0039 | 0.7486 | 0.8348 | -0.0121 | 0.7472 | 0.8267 | -0.0047 | 0.1761 | 0.1594 | -0.0059 |
| RandomForest | 0.9330 | 0.9549 | -0.0015 | 0.7506 | 0.8434 | -0.0141 | 0.7553 | 0.8443 | -0.0129 | 0.1711 | 0.1664 | -0.0109 |
| ExplainableBM | 0.9325 | 0.9212 | -0.0011 | 0.7120 | 0.7163 | 0.0244 | 0.7188 | 0.7214 | 0.0236 | 0.1834 | 0.1888 | 0.0014 |
| HUGIML | 0.9315 | 0.9348 | 0.0000 | 0.7364 | 0.7965 | 0.0000 | 0.7425 | 0.7979 | 0.0000 | 0.1820 | 0.1668 | 0.0000 |
| NeuralNetFastAI | 0.9308 | 0.9360 | 0.0006 | 0.7348 | 0.7950 | 0.0017 | 0.7362 | 0.7954 | 0.0062 | 0.1821 | 0.1606 | 0.0002 |
| LinearModel | 0.9036 | 0.9156 | 0.0279 | 0.6887 | 0.6801 | 0.0477 | 0.6923 | 0.6894 | 0.0502 | 0.2176 | 0.2038 | 0.0357 |
| KNeighbors | 0.7705 | 0.8044 | 0.1342 | 0.4006 | 0.4178 | 0.2510 | 0.3978 | 0.4135 | 0.2627 | 0.3682 | 0.3794 | 0.1484 |
Methodology and interpretation
Comparison design
- Local HUGIML results are joined to published TabArena results by exact dataset name and outer-split number.
- Binary error is 1 − ROC AUC; multiclass error is log loss. Split errors are averaged within dataset before aggregation, giving every dataset equal weight.
- Each tab is an independent comparison pool. Elo, ranks, normalized score, improvability, confidence intervals, and HUGIML pairwise results are recomputed within that pool.
- AutoMLPipelineFeatureGenerator is fitted separately on every inner child training fold and retained with that child for validation and outer-test transformation; no validation or test rows contribute to preprocessing state.
- The outer tests and metrics align. HUGIML evaluates 16 configurations, while each tuned official baseline evaluates 200; retained ensembles and compute budgets remain method-specific.
- Detailed metric tables show mean, median, and the paired HUGIML advantage. Positive deltas favor HUGIML; Brier uses the lower-is-better direction.