Given a named list of predicted-label vectors (one per prompt or model variant) plus a gold reference, compute reliability + validity for each variant and stack the results into a tidy comparison table.
Usage
stab(
predictions,
gold,
reliability_method = "cohen",
reliability_level = "nominal",
validity_metrics = c("f1_macro", "mcc", "balanced_accuracy")
)Examples
if (FALSE) { # \dontrun{
stab(
list("GPT-5" = labels$gpt5,
"Gemini-3" = labels$gemini,
"Llama-3.3" = labels$llama),
gold = labels$human
)
} # }