Benchmarks

  • Benchmark evaluating whether language models can generate and edit structured ASCII diagrams. 80 tasks across 4 categories, with public example tasks available on Hugging Face.
    3
  • A benchmark harness that runs Android agent tasks against a real phone and a real LLM, capturing phone and model performance metrics for every run.
    0