Official-test comparison

HUGIML in the TabArena reference landscape

A dedicated leaderboard view for aligned outer-test comparisons. Search budgets and ensemble construction remain method-specific, so each pool is presented separately.

32 completed datasetsExact outer-split matchingDataset-balanced aggregation200 Elo bootstraps
Dataset-scale analysis

Tuned-model AUC gaps

Models follow their within-quadrant Elo rank. Bars show mean ROC-AUC delta; dots show median delta.

HUGIML mean deltaOfficial tuned model mean deltaMedian delta

Ordering is by TabArena rank, which uses ROC-AUC error for binary datasets and log loss for multiclass datasets. The displayed order is therefore not a ranking by the ROC-AUC values shown at right.

Reference pool

Default · overall

HUGIML plus 16 official variants · 32 completed datasets · Elo anchor RF (default) = 1000

HUGIML position11 / 17within this recomputed pool
Elo1158.695% interval 1067.5–1280.5
Average rank10.00lower is better
Normalized score0.138best = 1, dataset median = 0
Improvability18.41% (8.11%)mean (median); lower is better
Pool-relative results

Leaderboard

Every displayed statistic is recalculated using only this tab's methods.

#MethodElo95% intervalNormalized scoreAverage rankImprovability · mean (median)
1TABICL_GPU (default)1570.21480.0–1692.80.6893.224.59% (1.43%)
2CAT (default)1487.31392.2–1612.50.5204.289.12% (3.81%)
3TABM_GPU (default)1421.31306.9–1562.10.4575.2810.67% (3.38%)
4TABPFNV2_GPU (default)1388.21251.3–1541.50.5285.838.56% (3.92%)
5MNCA_GPU (default)1349.41267.4–1452.30.3046.5011.69% (5.45%)
6REALMLP (default)1304.31214.6–1409.80.2207.3112.00% (7.24%)
7EBM (default)1295.81207.8–1406.80.2617.4713.50% (6.39%)
8XGB (default)1270.41175.4–1380.50.2277.9413.06% (9.65%)
9TABDPT_GPU (default)1246.81165.1–1345.00.2458.3812.54% (5.86%)
10GBM (default)1233.41144.6–1348.20.1628.6213.88% (9.52%)
11HUGIML1158.61067.5–1280.50.13810.0018.41% (8.11%)
12NN_TORCH (default)1107.31004.9–1213.80.05910.9117.64% (9.32%)
13FASTAI (default)1077.7987.2–1178.00.05611.4119.34% (14.15%)
14RF (default)1000.01000.0–1000.00.01612.6222.30% (14.50%)
15LR (default)969.3848.3–1099.70.03813.0626.08% (16.35%)
16XT (default)924.0848.3–974.10.02913.6624.27% (16.75%)
17KNN (default)551.5217.1–697.90.00016.5255.91% (51.92%)
Dataset-level pairing

HUGIML versus each official method

Positive error reduction favors HUGIML.

Official methodWinsTiesLossesError reduction · mean (median)
KNN (default)310146.39% (48.28%)
LR (default)27058.45% (7.90%)
XT (default)25074.97% (6.64%)
RF (default)220100.02% (5.09%)
FASTAI (default)21011-3.58% (2.96%)
NN_TORCH (default)17015-8.76% (0.51%)
GBM (default)11021-12.40% (-3.11%)
EBM (default)7025-14.07% (-3.05%)
XGB (default)9023-15.17% (-3.59%)
TABM_GPU (default)3029-16.72% (-5.54%)
REALMLP (default)14018-19.92% (-1.42%)
MNCA_GPU (default)6026-20.68% (-3.13%)
CAT (default)5027-21.11% (-5.33%)
TABDPT_GPU (default)13019-24.68% (-1.55%)
TABPFNV2_GPU (default)8024-33.07% (-3.66%)
TABICL_GPU (default)5027-40.91% (-4.99%)
Default · overall

Predictive metrics and HUGIML deltas

Positive delta favors HUGIML. Rows are ordered by mean ROC AUC.

MethodROC AUCBalanced accuracyF1Brier
MeanMedianHUGIML deltaMeanMedianHUGIML deltaMeanMedianHUGIML deltaMeanMedianHUGIML delta
TabPFNv2_GPU0.87170.8853-0.01160.72330.7283-0.02080.60850.6867-0.02900.11320.0960-0.0101
TabICL_GPU0.85970.8586-0.01720.70270.7201-0.02050.57400.6460-0.02300.10740.0911-0.0095
CatBoost0.85770.8672-0.01520.69630.7058-0.01420.57010.6420-0.01910.11020.0941-0.0067
TabM_GPU0.85510.8573-0.01260.69780.7073-0.01570.56430.6488-0.01330.11130.0942-0.0056
ModernNCA_GPU0.85460.8529-0.01210.68870.7043-0.00660.56350.6352-0.01260.11120.0954-0.0058
RealMLP0.85280.8548-0.01020.70260.7090-0.02040.57990.6463-0.02900.11340.0978-0.0035
XGBoost0.85100.8475-0.00850.69050.7005-0.00840.56130.6452-0.01040.11190.0956-0.0051
ExplainableBM0.85090.8467-0.00830.68520.6939-0.00300.55930.6404-0.00840.11570.0933-0.0012
TabDPT_GPU0.85080.8412-0.00830.69530.7016-0.01320.56630.6377-0.01530.11240.0986-0.0045
LightGBM0.84960.8396-0.00710.69020.6953-0.00810.56100.6440-0.01010.11230.0957-0.0047
NeuralNetTorch0.84450.8463-0.00200.69000.7095-0.00790.55700.6141-0.00600.11780.09720.0009
HUGIML0.84250.83650.00000.68210.69810.00000.55090.60040.00000.11690.09760.0000
RandomForest0.83910.84030.00340.68670.6818-0.00460.56200.6067-0.01110.11980.10140.0029
NeuralNetFastAI0.83720.82900.00540.67590.69210.00620.53730.60490.01360.11980.09410.0029
ExtraTrees0.83450.83470.00810.67260.66220.00950.54110.56980.00990.12330.10180.0064
LinearModel0.82550.80820.01700.65290.64120.02920.50850.57410.04240.13000.10300.0130
KNeighbors0.66150.62880.16960.56550.55140.09720.36200.30480.13570.18600.17420.0633
Methodology and interpretation
Methodology and interpretation

Comparison design

  • Local HUGIML results are joined to published TabArena results by exact dataset name and outer-split number.
  • Binary error is 1 − ROC AUC; multiclass error is log loss. Split errors are averaged within dataset before aggregation, giving every dataset equal weight.
  • Each tab is an independent comparison pool. Elo, ranks, normalized score, improvability, confidence intervals, and HUGIML pairwise results are recomputed within that pool.
  • AutoMLPipelineFeatureGenerator is fitted separately on every inner child training fold and retained with that child for validation and outer-test transformation; no validation or test rows contribute to preprocessing state.
  • The outer tests and metrics align. HUGIML evaluates 16 configurations, while each tuned official baseline evaluates 200; retained ensembles and compute budgets remain method-specific.
  • Detailed metric tables show mean, median, and the paired HUGIML advantage. Positive deltas favor HUGIML; Brier uses the lower-is-better direction.