{"as_of":"2026-08-07T02:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8dbf6c738a73c6811e4ea0f8eefdcf8962664add1e114fe27d761ddc65903d1c","coverage":[{"denominator":90,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":90,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T01:19:54.081755Z","state":"measured"},{"denominator":91,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":91,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-13T02:31:04.773248Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.28480","last_updated":"2026-06-26T17:59:51Z","snapshot_observed_at":"2026-07-07T00:02:33.644076Z","submitted_at":"2026-06-26T17:59:51Z","title":"TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.28480","snapshot_observed_at":"2026-07-13T02:31:04.773248Z","title":"Tua-bench: A benchmark for general-purpose terminal-use agents,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09510","last_updated":"2026-07-10T15:25:56Z","snapshot_observed_at":"2026-08-06T08:47:38.877588Z","submitted_at":"2026-07-10T15:25:56Z","title":"Failure as a Process: An Anatomy of CLI Coding Agent Trajectories","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-13T02:31:04.773248Z"},"links":{"cited_paper":"/paper/2606.28480","citing_paper":"/paper/2607.09510"},"observation_digest":"sha256:034ed679a65f883d4778079a7b7366b0da0272bb181a1472e55e82aee3a6f922","observation_id":"a1efa79b-7ddd-4957-b462-5f8df85e3656","resolution":{"observed_at":"2026-07-13T02:31:04.773248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2606.28480/citation-record","integrity":"/paper/2606.28480/integrity","json":"/paper/2606.28480/citation-record.json","paper":"/paper/2606.28480"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T01:19:54.081755Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.28480","last_updated":"2026-06-26T17:59:51Z","snapshot_observed_at":"2026-07-07T00:02:33.644076Z","submitted_at":"2026-06-26T17:59:51Z","title":"TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-06-30T01:19:54.081755Z"},"links":{"citing_paper":"/paper/2606.28480"},"observation_digest":"sha256:4c2b0817f246d09000c49d5a4a35f4f30213638925e27275b99aee79d1ac7f90","observation_id":"16cfb3cf-facd-447c-a414-3976a292026c","resolution":{"observed_at":"2026-06-30T01:19:54.081755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T01:19:54.081755Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.28480","last_updated":"2026-06-26T17:59:51Z","snapshot_observed_at":"2026-07-07T00:02:33.644076Z","submitted_at":"2026-06-26T17:59:51Z","title":"TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-06-30T01:19:54.081755Z"},"links":{"citing_paper":"/paper/2606.28480"},"observation_digest":"sha256:70b9491e3c530e5b81735e1eaf9c48ad8bcd7614e9112344a0c26201d58c2e2a","observation_id":"bcb4b268-2d0d-42af-8a6d-24b070ff92de","resolution":{"observed_at":"2026-06-30T01:19:54.081755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T01:19:54.081755Z","title":"The twelfth international conference on learning representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.28480","last_updated":"2026-06-26T17:59:51Z","snapshot_observed_at":"2026-07-07T00:02:33.644076Z","submitted_at":"2026-06-26T17:59:51Z","title":"TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-06-30T01:19:54.081755Z"},"links":{"citing_paper":"/paper/2606.28480"},"observation_digest":"sha256:719dc38ef4fd4e5efcd39e0a417b40b13fbc0fb8fdcb001af3751c278eb8bf1d","observation_id":"d6244ebf-ebc1-4d81-aa44-c7f447dbcb68","resolution":{"observed_at":"2026-06-30T01:19:54.081755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T01:19:54.081755Z","title":"The Fourteenth International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.28480","last_updated":"2026-06-26T17:59:51Z","snapshot_observed_at":"2026-07-07T00:02:33.644076Z","submitted_at":"2026-06-26T17:59:51Z","title":"TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-06-30T01:19:54.081755Z"},"links":{"citing_paper":"/paper/2606.28480"},"observation_digest":"sha256:496ed3fb43ea6bccde85221edd9224527d217cc38aa6c060789e3ce40072c5ef","observation_id":"ec114795-28dd-4302-93bc-ff49c0bfdecb","resolution":{"observed_at":"2026-06-30T01:19:54.081755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T01:19:54.081755Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.28480","last_updated":"2026-06-26T17:59:51Z","snapshot_observed_at":"2026-07-07T00:02:33.644076Z","submitted_at":"2026-06-26T17:59:51Z","title":"TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-06-30T01:19:54.081755Z"},"links":{"citing_paper":"/paper/2606.28480"},"observation_digest":"sha256:f511216fc9d95fdcc509846d8ed6df7e6f46cfe011958b73edbad389dfafd3be","observation_id":"ffa0ba29-11d2-4e38-aa23-4030fe6289fd","resolution":{"observed_at":"2026-06-30T01:19:54.081755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T01:19:54.081755Z","title":"2026 , url=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.28480","last_updated":"2026-06-26T17:59:51Z","snapshot_observed_at":"2026-07-07T00:02:33.644076Z","submitted_at":"2026-06-26T17:59:51Z","title":"TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-06-30T01:19:54.081755Z"},"links":{"citing_paper":"/paper/2606.28480"},"observation_digest":"sha256:d4aab298a15ead7d029a9fd6431b2b33d3af4ab229291c7e03c8e3673c9e86d2","observation_id":"f57826e5-89d7-42b0-85fb-271a1ab802c5","resolution":{"observed_at":"2026-06-30T01:19:54.081755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T01:19:54.081755Z","title":"The Twelfth International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.28480","last_updated":"2026-06-26T17:59:51Z","snapshot_observed_at":"2026-07-07T00:02:33.644076Z","submitted_at":"2026-06-26T17:59:51Z","title":"TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-06-30T01:19:54.081755Z"},"links":{"citing_paper":"/paper/2606.28480"},"observation_digest":"sha256:bc1be258c850f530bc81a56bd77455781ee27ee08fcaef6a68fb6669c6d18ff5","observation_id":"1f99e34a-b8df-41a6-8138-5b2a5e9f92de","resolution":{"observed_at":"2026-06-30T01:19:54.081755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T01:19:54.081755Z","title":"2022 , month = nov, howpublished =","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.28480","last_updated":"2026-06-26T17:59:51Z","snapshot_observed_at":"2026-07-07T00:02:33.644076Z","submitted_at":"2026-06-26T17:59:51Z","title":"TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-06-30T01:19:54.081755Z"},"links":{"citing_paper":"/paper/2606.28480"},"observation_digest":"sha256:b5e0045079c001ef696b78d62198b153aed4f94dee231b3e28e2e98f4f96176b","observation_id":"22874d00-d8e3-4454-90bf-fdb6425f5449","resolution":{"observed_at":"2026-06-30T01:19:54.081755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T01:19:54.081755Z","title":"2026 , month = apr, day =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.28480","last_updated":"2026-06-26T17:59:51Z","snapshot_observed_at":"2026-07-07T00:02:33.644076Z","submitted_at":"2026-06-26T17:59:51Z","title":"TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-06-30T01:19:54.081755Z"},"links":{"citing_paper":"/paper/2606.28480"},"observation_digest":"sha256:5a809cf719e551f968a1050db8a6d879e72ae2cc6d09cf5dd9fda9ee80cd5140","observation_id":"b0627da8-2442-4cd7-babb-dea7e0d11283","resolution":{"observed_at":"2026-06-30T01:19:54.081755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T01:19:54.081755Z","title":"2025 , month = may, howpublished =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.28480","last_updated":"2026-06-26T17:59:51Z","snapshot_observed_at":"2026-07-07T00:02:33.644076Z","submitted_at":"2026-06-26T17:59:51Z","title":"TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-06-30T01:19:54.081755Z"},"links":{"citing_paper":"/paper/2606.28480"},"observation_digest":"sha256:0631c8b24d4ee103e93192f2e220a63a1f2e5fc93b287185458235307d6e9f4d","observation_id":"8fffffff-fab6-4473-ae8c-96a03309ac3f","resolution":{"observed_at":"2026-06-30T01:19:54.081755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T01:19:54.081755Z","title":"2026 , howpublished =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.28480","last_updated":"2026-06-26T17:59:51Z","snapshot_observed_at":"2026-07-07T00:02:33.644076Z","submitted_at":"2026-06-26T17:59:51Z","title":"TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-06-30T01:19:54.081755Z"},"links":{"citing_paper":"/paper/2606.28480"},"observation_digest":"sha256:dcc9e3784ff0d4c5619b7e071b4e0c39724793d4bfe1dc91799938bd24f93608","observation_id":"8c0e7760-b2a1-4cbb-bb48-00c18086e956","resolution":{"observed_at":"2026-06-30T01:19:54.081755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T01:19:54.081755Z","title":"2026 , howpublished =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.28480","last_updated":"2026-06-26T17:59:51Z","snapshot_observed_at":"2026-07-07T00:02:33.644076Z","submitted_at":"2026-06-26T17:59:51Z","title":"TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-06-30T01:19:54.081755Z"},"links":{"citing_paper":"/paper/2606.28480"},"observation_digest":"sha256:f9b4d3afe9e373b6e64fd354f3f0e9df4c7f03b13fab7c165c557db2a3336f3a","observation_id":"7a50b5cd-6354-469c-bcb8-33cfa08a4f1b","resolution":{"observed_at":"2026-06-30T01:19:54.081755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T01:19:54.081755Z","title":"2026 , howpublished =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.28480","last_updated":"2026-06-26T17:59:51Z","snapshot_observed_at":"2026-07-07T00:02:33.644076Z","submitted_at":"2026-06-26T17:59:51Z","title":"TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-06-30T01:19:54.081755Z"},"links":{"citing_paper":"/paper/2606.28480"},"observation_digest":"sha256:627a61d771a41f10de9cf553d1e5674eb99cba0067e2483c653db3fbeafdb94c","observation_id":"5f9f327c-20de-4cf1-acc1-478b970d9b65","resolution":{"observed_at":"2026-06-30T01:19:54.081755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T01:19:54.081755Z","title":"2026 , howpublished =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.28480","last_updated":"2026-06-26T17:59:51Z","snapshot_observed_at":"2026-07-07T00:02:33.644076Z","submitted_at":"2026-06-26T17:59:51Z","title":"TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-06-30T01:19:54.081755Z"},"links":{"citing_paper":"/paper/2606.28480"},"observation_digest":"sha256:27b1ef94bd6c58d3f092e4eef5fc8cc757da5382863dba2f184e492c0271003c","observation_id":"1a774057-46a7-48de-9edb-3df5e65f4d5a","resolution":{"observed_at":"2026-06-30T01:19:54.081755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T01:19:54.081755Z","title":"2023 , month = mar, howpublished =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.28480","last_updated":"2026-06-26T17:59:51Z","snapshot_observed_at":"2026-07-07T00:02:33.644076Z","submitted_at":"2026-06-26T17:59:51Z","title":"TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-06-30T01:19:54.081755Z"},"links":{"citing_paper":"/paper/2606.28480"},"observation_digest":"sha256:1534006ac27c3c3a6028c0a617f1f8ec1c73f6c01805ab12e027398f1bdb0517","observation_id":"0441792d-817e-448d-b4dc-aeeb1f3e1b27","resolution":{"observed_at":"2026-06-30T01:19:54.081755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T01:19:54.081755Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.28480","last_updated":"2026-06-26T17:59:51Z","snapshot_observed_at":"2026-07-07T00:02:33.644076Z","submitted_at":"2026-06-26T17:59:51Z","title":"TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-06-30T01:19:54.081755Z"},"links":{"citing_paper":"/paper/2606.28480"},"observation_digest":"sha256:ac2d7ee9f4f075171afab696a83ac30dc2d1bc614f74bcec74e5c91c41723adb","observation_id":"fe6c5f38-6076-4e3f-8a21-3eaea17a33d9","resolution":{"observed_at":"2026-06-30T01:19:54.081755Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T01:19:54.081755Z","title":"2025 , month = jun, howpublished =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.28480","last_updated":"2026-06-26T17:59:51Z","snapshot_observed_at":"2026-07-07T00:02:33.644076Z","submitted_at":"2026-06-26T17:59:51Z","title":"TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-06-30T01:19:54.081755Z"},"links":{"citing_paper":"/paper/2606.28480"},"observation_digest":"sha256:4d4789763675e945498d452ce24cde7f145bbaf8ff1c1bc2a6fc2a12537676dc","observation_id":"c2e426ca-5a34-4edc-9296-80e9024e3465","resolution":{"observed_at":"2026-06-30T01:19:54.081755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T01:19:54.081755Z","title":"2021 , month = jun, howpublished =","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.28480","last_updated":"2026-06-26T17:59:51Z","snapshot_observed_at":"2026-07-07T00:02:33.644076Z","submitted_at":"2026-06-26T17:59:51Z","title":"TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-06-30T01:19:54.081755Z"},"links":{"citing_paper":"/paper/2606.28480"},"observation_digest":"sha256:d3cb7b26b96092adca0a8d1409afd0d9c9b832734b67a23ef75cb15c8cd86c9b","observation_id":"f3f77f80-bb60-4b16-a79f-9558aa384fe1","resolution":{"observed_at":"2026-06-30T01:19:54.081755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T01:19:54.081755Z","title":"2026 , howpublished =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.28480","last_updated":"2026-06-26T17:59:51Z","snapshot_observed_at":"2026-07-07T00:02:33.644076Z","submitted_at":"2026-06-26T17:59:51Z","title":"TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-06-30T01:19:54.081755Z"},"links":{"citing_paper":"/paper/2606.28480"},"observation_digest":"sha256:f915f32a9d4c728f179c7f56d1e484f111b098ff37895dccca38637c7f2fc1d9","observation_id":"19d5aac0-b89e-49b9-9b6d-5ee04230eb6f","resolution":{"observed_at":"2026-06-30T01:19:54.081755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T01:19:54.081755Z","title":"2025 , month = mar, howpublished =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.28480","last_updated":"2026-06-26T17:59:51Z","snapshot_observed_at":"2026-07-07T00:02:33.644076Z","submitted_at":"2026-06-26T17:59:51Z","title":"TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-06-30T01:19:54.081755Z"},"links":{"citing_paper":"/paper/2606.28480"},"observation_digest":"sha256:666f29d35e2a7f4085961986d86521cbd40ed214cfdfd75b011d7dd5771e730d","observation_id":"28d7e823-5c70-4b5f-af80-5189b63b4c35","resolution":{"observed_at":"2026-06-30T01:19:54.081755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T01:19:54.081755Z","title":"2026 , howpublished =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.28480","last_updated":"2026-06-26T17:59:51Z","snapshot_observed_at":"2026-07-07T00:02:33.644076Z","submitted_at":"2026-06-26T17:59:51Z","title":"TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-06-30T01:19:54.081755Z"},"links":{"citing_paper":"/paper/2606.28480"},"observation_digest":"sha256:345be6cc9dca88f7ff7f9e22c5b357910340e2b4fe64f025504e5d4f82bac18c","observation_id":"98a3ad9b-1783-41ef-83c7-790dba89bcda","resolution":{"observed_at":"2026-06-30T01:19:54.081755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T01:19:54.081755Z","title":"The UNIX","venue":null,"work_id":null,"year":1979},"citing_paper":{"arxiv_id":"2606.28480","last_updated":"2026-06-26T17:59:51Z","snapshot_observed_at":"2026-07-07T00:02:33.644076Z","submitted_at":"2026-06-26T17:59:51Z","title":"TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-06-30T01:19:54.081755Z"},"links":{"citing_paper":"/paper/2606.28480"},"observation_digest":"sha256:3a9e2f3427f47967691969e4b48fd07b078d207fd8b1225d977a65d52d3821a9","observation_id":"61d5c112-bb4e-4570-b8d0-d041379ab85b","resolution":{"observed_at":"2026-06-30T01:19:54.081755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T01:19:54.081755Z","title":"2014 , publisher=","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2606.28480","last_updated":"2026-06-26T17:59:51Z","snapshot_observed_at":"2026-07-07T00:02:33.644076Z","submitted_at":"2026-06-26T17:59:51Z","title":"TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-06-30T01:19:54.081755Z"},"links":{"citing_paper":"/paper/2606.28480"},"observation_digest":"sha256:2e163a350eccc10fa733b31c24910f01bf1e9793f92f7c392e404900eee1423e","observation_id":"50339098-0413-462c-90cf-b5cf4c7fa2dd","resolution":{"observed_at":"2026-06-30T01:19:54.081755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T01:19:54.081755Z","title":"Gigascience , volume=","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2606.28480","last_updated":"2026-06-26T17:59:51Z","snapshot_observed_at":"2026-07-07T00:02:33.644076Z","submitted_at":"2026-06-26T17:59:51Z","title":"TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-06-30T01:19:54.081755Z"},"links":{"citing_paper":"/paper/2606.28480"},"observation_digest":"sha256:7f756605c3a25329eaf50ec0781aaaafbad0585ff2c12578ef858d368907ee07","observation_id":"55b3c148-4559-416c-97db-549e973e62cb","resolution":{"observed_at":"2026-06-30T01:19:54.081755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T01:19:54.081755Z","title":"GitHub repository , howpublished =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.28480","last_updated":"2026-06-26T17:59:51Z","snapshot_observed_at":"2026-07-07T00:02:33.644076Z","submitted_at":"2026-06-26T17:59:51Z","title":"TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-06-30T01:19:54.081755Z"},"links":{"citing_paper":"/paper/2606.28480"},"observation_digest":"sha256:de054240da8b8cc31f09ed9321fa8b65f63ddcac5ec4352f1af079f13e1f76c5","observation_id":"7b935939-fa0a-4716-9cb2-f321750a3db4","resolution":{"observed_at":"2026-06-30T01:19:54.081755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T01:19:54.081755Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.28480","last_updated":"2026-06-26T17:59:51Z","snapshot_observed_at":"2026-07-07T00:02:33.644076Z","submitted_at":"2026-06-26T17:59:51Z","title":"TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-06-30T01:19:54.081755Z"},"links":{"citing_paper":"/paper/2606.28480"},"observation_digest":"sha256:d183b964432d10c8d09cf010c91b115814902551673424aac525e70ac958e648","observation_id":"1f607a1f-d8b1-439c-ba17-bcf5a09f45e4","resolution":{"observed_at":"2026-06-30T01:19:54.081755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T01:19:54.081755Z","title":"2026 , howpublished =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.28480","last_updated":"2026-06-26T17:59:51Z","snapshot_observed_at":"2026-07-07T00:02:33.644076Z","submitted_at":"2026-06-26T17:59:51Z","title":"TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-06-30T01:19:54.081755Z"},"links":{"citing_paper":"/paper/2606.28480"},"observation_digest":"sha256:d67dec7613276a8f65a24cc93475f972d207f9525c710363770dcbd94eabfc15","observation_id":"0ec40198-fb28-4b93-b195-72e1584aa320","resolution":{"observed_at":"2026-06-30T01:19:54.081755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T01:19:54.081755Z","title":"2026 , howpublished =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.28480","last_updated":"2026-06-26T17:59:51Z","snapshot_observed_at":"2026-07-07T00:02:33.644076Z","submitted_at":"2026-06-26T17:59:51Z","title":"TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-06-30T01:19:54.081755Z"},"links":{"citing_paper":"/paper/2606.28480"},"observation_digest":"sha256:40cc4a2ab2824070af90d2d8275144ebf47bb39743eab3a772375c5442d64444","observation_id":"f1f128bc-71ac-4da7-aa20-b09f5e7e2419","resolution":{"observed_at":"2026-06-30T01:19:54.081755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T01:19:54.081755Z","title":"International Conference on Machine Learning , pages=","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.28480","last_updated":"2026-06-26T17:59:51Z","snapshot_observed_at":"2026-07-07T00:02:33.644076Z","submitted_at":"2026-06-26T17:59:51Z","title":"TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-06-30T01:19:54.081755Z"},"links":{"citing_paper":"/paper/2606.28480"},"observation_digest":"sha256:8fd78d449cf44331e9794f30f0d3165b996f600de6086104c252ebb584b6dcd7","observation_id":"f0ccc8e4-debc-46d0-b2aa-e022eedc2f31","resolution":{"observed_at":"2026-06-30T01:19:54.081755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T01:19:54.081755Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.28480","last_updated":"2026-06-26T17:59:51Z","snapshot_observed_at":"2026-07-07T00:02:33.644076Z","submitted_at":"2026-06-26T17:59:51Z","title":"TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-06-30T01:19:54.081755Z"},"links":{"citing_paper":"/paper/2606.28480"},"observation_digest":"sha256:a6a533f203638ce8c86e1f1917553892844abcbf76c22ac400866ae82dc2d4b5","observation_id":"141b71ce-e082-46d4-9cb0-e2e091df358e","resolution":{"observed_at":"2026-06-30T01:19:54.081755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T01:19:54.081755Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.28480","last_updated":"2026-06-26T17:59:51Z","snapshot_observed_at":"2026-07-07T00:02:33.644076Z","submitted_at":"2026-06-26T17:59:51Z","title":"TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-06-30T01:19:54.081755Z"},"links":{"citing_paper":"/paper/2606.28480"},"observation_digest":"sha256:9379dc4cc328b3a8fdca56bbbcfcbde59d7032832e9aa14036f2ddb807828a54","observation_id":"f1aef125-eb85-4a6f-a311-ee15acc2add8","resolution":{"observed_at":"2026-06-30T01:19:54.081755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T01:19:54.081755Z","title":"2025 USENIX Annual Technical Conference (USENIX ATC 25) , pages=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.28480","last_updated":"2026-06-26T17:59:51Z","snapshot_observed_at":"2026-07-07T00:02:33.644076Z","submitted_at":"2026-06-26T17:59:51Z","title":"TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-06-30T01:19:54.081755Z"},"links":{"citing_paper":"/paper/2606.28480"},"observation_digest":"sha256:4c6e9333dcdb2e85c980a2b953edce990c3da24d2866d7755d7ba7cbeeb59347","observation_id":"d2a94810-aa38-4064-bff0-5b0ebf94ebdd","resolution":{"observed_at":"2026-06-30T01:19:54.081755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T01:19:54.081755Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.28480","last_updated":"2026-06-26T17:59:51Z","snapshot_observed_at":"2026-07-07T00:02:33.644076Z","submitted_at":"2026-06-26T17:59:51Z","title":"TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-06-30T01:19:54.081755Z"},"links":{"citing_paper":"/paper/2606.28480"},"observation_digest":"sha256:1c06c9cba1b24d31e240feb550936fd9bbbb15c4838654232997585728e15802","observation_id":"4512cfde-0c37-46ff-af40-ddd90d579f93","resolution":{"observed_at":"2026-06-30T01:19:54.081755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T01:19:54.081755Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.28480","last_updated":"2026-06-26T17:59:51Z","snapshot_observed_at":"2026-07-07T00:02:33.644076Z","submitted_at":"2026-06-26T17:59:51Z","title":"TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-06-30T01:19:54.081755Z"},"links":{"citing_paper":"/paper/2606.28480"},"observation_digest":"sha256:6ab1ea38141356ba8c565cd02f460029822742972132ee4edf25f56c76f132a2","observation_id":"f5220853-9e58-4df9-8ec4-39af67d3f865","resolution":{"observed_at":"2026-06-30T01:19:54.081755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T01:19:54.081755Z","title":"The Fourteenth International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.28480","last_updated":"2026-06-26T17:59:51Z","snapshot_observed_at":"2026-07-07T00:02:33.644076Z","submitted_at":"2026-06-26T17:59:51Z","title":"TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-06-30T01:19:54.081755Z"},"links":{"citing_paper":"/paper/2606.28480"},"observation_digest":"sha256:840861fd9fd6d84047c25c64861820528f899a2481118428bdc391ee409264ce","observation_id":"bf3b99ec-4e11-4040-abfe-f72f7f0c0c4f","resolution":{"observed_at":"2026-06-30T01:19:54.081755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T01:19:54.081755Z","title":"Windows Agent Arena: Evaluating Multi-Modal","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.28480","last_updated":"2026-06-26T17:59:51Z","snapshot_observed_at":"2026-07-07T00:02:33.644076Z","submitted_at":"2026-06-26T17:59:51Z","title":"TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-06-30T01:19:54.081755Z"},"links":{"citing_paper":"/paper/2606.28480"},"observation_digest":"sha256:eaa1ac797dd483a30677209fdd2689e10f7b209b687b4679a5cfeec73b9e8c47","observation_id":"4b4ddfc4-fd36-42a6-819c-5c5a3d54c47c","resolution":{"observed_at":"2026-06-30T01:19:54.081755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T01:19:54.081755Z","title":"Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.28480","last_updated":"2026-06-26T17:59:51Z","snapshot_observed_at":"2026-07-07T00:02:33.644076Z","submitted_at":"2026-06-26T17:59:51Z","title":"TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-06-30T01:19:54.081755Z"},"links":{"citing_paper":"/paper/2606.28480"},"observation_digest":"sha256:27576fa8672d0868547bf027e97d275eee02d85f0441e63806fdc565f38b99bf","observation_id":"12cbcc37-5ce2-4d32-ad50-edd1aa4d7a31","resolution":{"observed_at":"2026-06-30T01:19:54.081755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T01:19:54.081755Z","title":"Introducing claude","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.28480","last_updated":"2026-06-26T17:59:51Z","snapshot_observed_at":"2026-07-07T00:02:33.644076Z","submitted_at":"2026-06-26T17:59:51Z","title":"TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-06-30T01:19:54.081755Z"},"links":{"citing_paper":"/paper/2606.28480"},"observation_digest":"sha256:80b12c2fa634b18af4f2f1f3c6e13fc8db72b41d704e54be6aae1dcab67002b3","observation_id":"50500e00-2d30-4fd7-bbb7-a5339d42ef8b","resolution":{"observed_at":"2026-06-30T01:19:54.081755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T01:19:54.081755Z","title":"Claude code","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.28480","last_updated":"2026-06-26T17:59:51Z","snapshot_observed_at":"2026-07-07T00:02:33.644076Z","submitted_at":"2026-06-26T17:59:51Z","title":"TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-06-30T01:19:54.081755Z"},"links":{"citing_paper":"/paper/2606.28480"},"observation_digest":"sha256:92f2bef617d6b5ed614855d665b6ca440e9cc89dd123a1914c36f4a30a1f6083","observation_id":"a1fe2693-dd1e-407a-9183-a6176a85aaac","resolution":{"observed_at":"2026-06-30T01:19:54.081755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T01:19:54.081755Z","title":"Introducing claude opus 4.7","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.28480","last_updated":"2026-06-26T17:59:51Z","snapshot_observed_at":"2026-07-07T00:02:33.644076Z","submitted_at":"2026-06-26T17:59:51Z","title":"TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-06-30T01:19:54.081755Z"},"links":{"citing_paper":"/paper/2606.28480"},"observation_digest":"sha256:2d1a05ccc9f1ef1108976320e41348f0e05fa5a11f7a8e91f0312dbe19f16102","observation_id":"454c51f5-17b4-4ff9-a973-fbe435cb549f","resolution":{"observed_at":"2026-06-30T01:19:54.081755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T01:19:54.081755Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.28480","last_updated":"2026-06-26T17:59:51Z","snapshot_observed_at":"2026-07-07T00:02:33.644076Z","submitted_at":"2026-06-26T17:59:51Z","title":"TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-06-30T01:19:54.081755Z"},"links":{"citing_paper":"/paper/2606.28480"},"observation_digest":"sha256:3a8e717d88e10a15494fcf208707c1acebd4fd648d61325f9c8b7c3d9b3b6b28","observation_id":"b55cd8d6-736b-4e00-9cca-887a6f6990e4","resolution":{"observed_at":"2026-06-30T01:19:54.081755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.09063","last_updated":"2025-07-11T22:45:07Z","snapshot_observed_at":"2026-08-06T18:02:57.107843Z","submitted_at":"2025-07-11T22:45:07Z","title":"SetupBench: Assessing Software Engineering Agents' Ability to Bootstrap Development Environments","version":1},"cited_work":{"arxiv_id":"2507.09063","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.09063","snapshot_observed_at":"2026-07-04T06:59:37.262688Z","title":"Setupbench: Assessing software engineering agents’ ability to bootstrap development environments","venue":null,"work_id":"db3dc07a-47e6-4f8a-9da7-0a5ad98429ad","year":2025},"citing_paper":{"arxiv_id":"2606.28480","last_updated":"2026-06-26T17:59:51Z","snapshot_observed_at":"2026-07-07T00:02:33.644076Z","submitted_at":"2026-06-26T17:59:51Z","title":"TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-06-30T01:19:54.081755Z"},"links":{"cited_paper":"/paper/2507.09063","citing_paper":"/paper/2606.28480"},"observation_digest":"sha256:26d6fcb2e2f0f9fe01ec047fd503b5164d4696607c6430f62196011fcc732439","observation_id":"d0300806-5c46-477b-aae5-08da90ed168a","resolution":{"observed_at":"2026-07-01T15:35:48.608177Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.17596","last_updated":"2026-04-19T20:04:02Z","snapshot_observed_at":"2026-07-06T23:04:41.564912Z","submitted_at":"2026-04-19T20:04:02Z","title":"Terminal Wrench: A Dataset of 331 Reward-Hackable Environments and 3,632 Exploit Trajectories","version":1},"cited_work":{"arxiv_id":"2604.17596","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.17596","snapshot_observed_at":"2026-07-03T00:17:29.169141Z","title":"Terminal Wrench: A Dataset of 331 Reward-Hackable Environments and 3,632 Exploit Trajectories","venue":"cs.CR","work_id":"ade05ec7-e557-4a99-892c-be73d02525d5","year":2026},"citing_paper":{"arxiv_id":"2606.28480","last_updated":"2026-06-26T17:59:51Z","snapshot_observed_at":"2026-07-07T00:02:33.644076Z","submitted_at":"2026-06-26T17:59:51Z","title":"TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-06-30T01:19:54.081755Z"},"links":{"cited_paper":"/paper/2604.17596","citing_paper":"/paper/2606.28480"},"observation_digest":"sha256:ed985861cdc98a622973fc4dd16cc6d5010225e307fefda24b4f318cd9be2288","observation_id":"404bda85-5126-45db-882c-bd7a7c1c8fc3","resolution":{"observed_at":"2026-07-01T15:35:48.611254Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T01:19:54.081755Z","title":"Windows agent arena: Evaluating multi-modal OS agents at scale","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.28480","last_updated":"2026-06-26T17:59:51Z","snapshot_observed_at":"2026-07-07T00:02:33.644076Z","submitted_at":"2026-06-26T17:59:51Z","title":"TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-06-30T01:19:54.081755Z"},"links":{"citing_paper":"/paper/2606.28480"},"observation_digest":"sha256:4a944b500abd23e7ee8c758a2d1b91dd697cd102a4750fdc20a0dff01868a6bf","observation_id":"48c7f167-f074-46bc-a756-b7d7ba52e967","resolution":{"observed_at":"2026-06-30T01:19:54.081755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T01:19:54.081755Z","title":"Scienceagentbench: Toward rigorous assessment of language agents for data-driven scientific discovery","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.28480","last_updated":"2026-06-26T17:59:51Z","snapshot_observed_at":"2026-07-07T00:02:33.644076Z","submitted_at":"2026-06-26T17:59:51Z","title":"TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-06-30T01:19:54.081755Z"},"links":{"citing_paper":"/paper/2606.28480"},"observation_digest":"sha256:a9b5d537057f629e100583987fcd4820838f3f494f2c8b6be825c73c3fd599b4","observation_id":"8aeb4e46-46b8-4c6e-b3f3-061ca3910e6c","resolution":{"observed_at":"2026-06-30T01:19:54.081755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.22535","last_updated":"2026-05-21T14:24:43Z","snapshot_observed_at":"2026-08-01T23:33:43.370851Z","submitted_at":"2026-05-21T14:24:43Z","title":"TerminalWorld: Benchmarking Agents on Real-World Terminal Tasks","version":1},"cited_work":{"arxiv_id":"2605.22535","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.22535","snapshot_observed_at":"2026-07-04T06:39:37.672046Z","title":"TerminalWorld: Benchmarking Agents on Real-World Terminal Tasks","venue":"cs.AI","work_id":"0a7a519d-c09d-4ff8-b5cf-dad45257b2e8","year":2026},"citing_paper":{"arxiv_id":"2606.28480","last_updated":"2026-06-26T17:59:51Z","snapshot_observed_at":"2026-07-07T00:02:33.644076Z","submitted_at":"2026-06-26T17:59:51Z","title":"TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-06-30T01:19:54.081755Z"},"links":{"cited_paper":"/paper/2605.22535","citing_paper":"/paper/2606.28480"},"observation_digest":"sha256:e17cfed1951127aa5a76795f885613fa271a3595b1ff2c975921dcee82baa1c3","observation_id":"60e49a49-b4a5-4670-8364-262be62c2eae","resolution":{"observed_at":"2026-07-01T15:35:48.602313Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T01:19:54.081755Z","title":"OpenCLI : Make any website your CLI --- an AI -native runtime for browser automation and dynamic web data extraction","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.28480","last_updated":"2026-06-26T17:59:51Z","snapshot_observed_at":"2026-07-07T00:02:33.644076Z","submitted_at":"2026-06-26T17:59:51Z","title":"TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-06-30T01:19:54.081755Z"},"links":{"citing_paper":"/paper/2606.28480"},"observation_digest":"sha256:1b69f19e3335279285ee695745b481088d0072b852d90d788057411f30882b52","observation_id":"10002721-e325-4517-9cec-1526657db245","resolution":{"observed_at":"2026-06-30T01:19:54.081755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.03570","last_updated":"2025-05-06T14:29:47Z","snapshot_observed_at":"2026-07-06T21:19:44.737182Z","submitted_at":"2025-05-06T14:29:47Z","title":"OSUniverse: Benchmark for Multimodal GUI-navigation AI Agents","version":1},"cited_work":{"arxiv_id":"2505.03570","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.03570","snapshot_observed_at":"2026-07-01T15:35:48.594905Z","title":"OSUniverse: Benchmark for Multimodal GUI -navigation AI Agents","venue":null,"work_id":"cb9f4461-0985-4fc7-8028-c2df99266d3c","year":2025},"citing_paper":{"arxiv_id":"2606.28480","last_updated":"2026-06-26T17:59:51Z","snapshot_observed_at":"2026-07-07T00:02:33.644076Z","submitted_at":"2026-06-26T17:59:51Z","title":"TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-06-30T01:19:54.081755Z"},"links":{"cited_paper":"/paper/2505.03570","citing_paper":"/paper/2606.28480"},"observation_digest":"sha256:3c612daa35349105808a825b4dd7b5f068599cc4773f73a447bf5bdc312c4acf","observation_id":"8c523803-4c8c-4fd8-bf5f-828cbe5fb9c8","resolution":{"observed_at":"2026-07-01T15:35:48.596562Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T01:19:54.081755Z","title":"Mind2web: Towards a generalist agent for the web","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.28480","last_updated":"2026-06-26T17:59:51Z","snapshot_observed_at":"2026-07-07T00:02:33.644076Z","submitted_at":"2026-06-26T17:59:51Z","title":"TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-06-30T01:19:54.081755Z"},"links":{"citing_paper":"/paper/2606.28480"},"observation_digest":"sha256:6b6927a3c48b107ddb69d9e681b89675e78fe81e00afdab91baf590a26b55105","observation_id":"51a2039e-440d-49a4-b9ac-01491f87daf8","resolution":{"observed_at":"2026-06-30T01:19:54.081755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T01:19:54.081755Z","title":"Introducing github copilot: Your ai pair programmer","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.28480","last_updated":"2026-06-26T17:59:51Z","snapshot_observed_at":"2026-07-07T00:02:33.644076Z","submitted_at":"2026-06-26T17:59:51Z","title":"TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-06-30T01:19:54.081755Z"},"links":{"citing_paper":"/paper/2606.28480"},"observation_digest":"sha256:aa9c37ea4f6bb622ca9912cac96d515eb07fa3f942f766137dad46df9d6ea547","observation_id":"bbb456b6-2e01-4718-8f26-e79addcc7fb7","resolution":{"observed_at":"2026-06-30T01:19:54.081755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T01:19:54.081755Z","title":"GitHub CLI Documentation","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.28480","last_updated":"2026-06-26T17:59:51Z","snapshot_observed_at":"2026-07-07T00:02:33.644076Z","submitted_at":"2026-06-26T17:59:51Z","title":"TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-06-30T01:19:54.081755Z"},"links":{"citing_paper":"/paper/2606.28480"},"observation_digest":"sha256:de654b3de436a5ae32f89476bfd23f8dcd36b6b57c15fb57ec78f35837c88bc5","observation_id":"c0e32623-65a5-4674-a3f7-0a4cb2467a0f","resolution":{"observed_at":"2026-06-30T01:19:54.081755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T01:19:54.081755Z","title":"Gemini cli: Your open-source ai agent","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.28480","last_updated":"2026-06-26T17:59:51Z","snapshot_observed_at":"2026-07-07T00:02:33.644076Z","submitted_at":"2026-06-26T17:59:51Z","title":"TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-06-30T01:19:54.081755Z"},"links":{"citing_paper":"/paper/2606.28480"},"observation_digest":"sha256:694992e4d4765549549fbc21e73d00ecabcb9a1ecc7af81d2df2b4c52df5aba3","observation_id":"663e74a4-fc5b-4773-8515-d5c90fea0424","resolution":{"observed_at":"2026-06-30T01:19:54.081755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T01:19:54.081755Z","title":"gcloud CLI Overview","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.28480","last_updated":"2026-06-26T17:59:51Z","snapshot_observed_at":"2026-07-07T00:02:33.644076Z","submitted_at":"2026-06-26T17:59:51Z","title":"TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-06-30T01:19:54.081755Z"},"links":{"citing_paper":"/paper/2606.28480"},"observation_digest":"sha256:6a1877428538784be6d32b6272b64f4b2af4587a4ef7098bb11e609e24487b10","observation_id":"dfbca054-3661-46bc-8bf9-d5de993477a6","resolution":{"observed_at":"2026-06-30T01:19:54.081755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T01:19:54.081755Z","title":"Terminus-2: Harbor's High-Performance Reference Agent Implementation","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.28480","last_updated":"2026-06-26T17:59:51Z","snapshot_observed_at":"2026-07-07T00:02:33.644076Z","submitted_at":"2026-06-26T17:59:51Z","title":"TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-06-30T01:19:54.081755Z"},"links":{"citing_paper":"/paper/2606.28480"},"observation_digest":"sha256:75061228b805edc70e669bd9ed568e908637b4d5324f84e1c1ac4dddf3039a5e","observation_id":"8d055695-6b98-4f24-a25b-65b82bbdc213","resolution":{"observed_at":"2026-06-30T01:19:54.081755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T01:19:54.081755Z","title":"Harbor: A framework for evaluating and optimizing agents and models in container environments , January 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.28480","last_updated":"2026-06-26T17:59:51Z","snapshot_observed_at":"2026-07-07T00:02:33.644076Z","submitted_at":"2026-06-26T17:59:51Z","title":"TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-06-30T01:19:54.081755Z"},"links":{"citing_paper":"/paper/2606.28480"},"observation_digest":"sha256:38de799b997c1c9683726605b3d52809e434501f45ad1f7b3c020c6dece0d88b","observation_id":"1d628c9d-d693-4ad0-822a-b7de05b8a950","resolution":{"observed_at":"2026-06-30T01:19:54.081755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T01:19:54.081755Z","title":"Webvoyager: Building an end-to-end web agent with large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.28480","last_updated":"2026-06-26T17:59:51Z","snapshot_observed_at":"2026-07-07T00:02:33.644076Z","submitted_at":"2026-06-26T17:59:51Z","title":"TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-06-30T01:19:54.081755Z"},"links":{"citing_paper":"/paper/2606.28480"},"observation_digest":"sha256:4ed23fb30b531d05ce82518270ac8484bbe5f9681a37c0f8a241a2c82c08e352","observation_id":"b1e4b799-7d9b-4196-8665-d04fbeee4ce0","resolution":{"observed_at":"2026-06-30T01:19:54.081755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T01:19:54.081755Z","title":"O'Reilly Media, Inc","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2606.28480","last_updated":"2026-06-26T17:59:51Z","snapshot_observed_at":"2026-07-07T00:02:33.644076Z","submitted_at":"2026-06-26T17:59:51Z","title":"TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-06-30T01:19:54.081755Z"},"links":{"citing_paper":"/paper/2606.28480"},"observation_digest":"sha256:17650913b283cf10f7649bcdd9e337535f7baca3f8c209d9ef6f0e6d587650cc","observation_id":"c31a12dd-56be-4bfc-88a8-2e9bf32de787","resolution":{"observed_at":"2026-06-30T01:19:54.081755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T01:19:54.081755Z","title":"OSW orld- MCP : Benchmarking MCP tool invocation in computer-use agents","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.28480","last_updated":"2026-06-26T17:59:51Z","snapshot_observed_at":"2026-07-07T00:02:33.644076Z","submitted_at":"2026-06-26T17:59:51Z","title":"TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-06-30T01:19:54.081755Z"},"links":{"citing_paper":"/paper/2606.28480"},"observation_digest":"sha256:1175fe7d719d2c0ce0883ef106886ea97ff1b2c7fb1cae0fa2a8720ad75a174c","observation_id":"a601bcbd-426c-4e9b-8438-e2c30be9366e","resolution":{"observed_at":"2026-06-30T01:19:54.081755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T01:19:54.081755Z","title":"Swe-bench: Can language models resolve real-world github issues? In The twelfth international conference on learning representations, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.28480","last_updated":"2026-06-26T17:59:51Z","snapshot_observed_at":"2026-07-07T00:02:33.644076Z","submitted_at":"2026-06-26T17:59:51Z","title":"TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-06-30T01:19:54.081755Z"},"links":{"citing_paper":"/paper/2606.28480"},"observation_digest":"sha256:6b78b476ed346759bf8f2ee1d6b4da894982e22fb902e1d398b684b484c1c001","observation_id":"c552e262-177f-4297-95af-626024d8aa13","resolution":{"observed_at":"2026-06-30T01:19:54.081755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T01:19:54.081755Z","title":"The unix programming environment","venue":null,"work_id":null,"year":1979},"citing_paper":{"arxiv_id":"2606.28480","last_updated":"2026-06-26T17:59:51Z","snapshot_observed_at":"2026-07-07T00:02:33.644076Z","submitted_at":"2026-06-26T17:59:51Z","title":"TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-06-30T01:19:54.081755Z"},"links":{"citing_paper":"/paper/2606.28480"},"observation_digest":"sha256:825e3fe16fe16f0b4775e6ab8e49bd16aaf035089a46a734706ee80fb8654f07","observation_id":"26cba6d3-fc3b-46f7-9bf4-12fc2935d14f","resolution":{"observed_at":"2026-06-30T01:19:54.081755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.25694","doi":"10.48550/arxiv.2510.25694","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2510.25694 , year=","venue":"arXiv (Cornell University)","work_id":"929672be-334e-4f27-befb-75d96c6175d0","year":2025},"citing_paper":{"arxiv_id":"2606.28480","last_updated":"2026-06-26T17:59:51Z","snapshot_observed_at":"2026-07-07T00:02:33.644076Z","submitted_at":"2026-06-26T17:59:51Z","title":"TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-06-30T01:19:54.081755Z"},"links":{"citing_paper":"/paper/2606.28480"},"observation_digest":"sha256:612b3bf369175a156744129e9f226d8b7f90582264cc869819b8e01cabb3de84","observation_id":"1837fdca-0704-45aa-8440-4020610f0106","resolution":{"observed_at":"2026-07-01T15:35:48.599600Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-11T01:50:52.034909+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T01:50:52.034909+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T01:19:54.081755Z","title":"The koala benchmarks for the shell: characterization and implications","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.28480","last_updated":"2026-06-26T17:59:51Z","snapshot_observed_at":"2026-07-07T00:02:33.644076Z","submitted_at":"2026-06-26T17:59:51Z","title":"TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-06-30T01:19:54.081755Z"},"links":{"citing_paper":"/paper/2606.28480"},"observation_digest":"sha256:c02903166cbb10d1d51e2ac539f46f15f00c310da5a8b3301fec96ac8289f3d5","observation_id":"0a3d865c-acd2-46d4-bce6-ed2a1ed6f376","resolution":{"observed_at":"2026-06-30T01:19:54.081755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T01:19:54.081755Z","title":"lark-cli: The official lark/feishu cli tool","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.28480","last_updated":"2026-06-26T17:59:51Z","snapshot_observed_at":"2026-07-07T00:02:33.644076Z","submitted_at":"2026-06-26T17:59:51Z","title":"TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-06-30T01:19:54.081755Z"},"links":{"citing_paper":"/paper/2606.28480"},"observation_digest":"sha256:49e964c461ac6277b8b8321cab4a6abd41dee2cffe4fcfb3c1b6bba8f5e4cf31","observation_id":"e016a4a9-61a5-4c8e-b7b7-10af2c6573de","resolution":{"observed_at":"2026-06-30T01:19:54.081755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T01:19:54.081755Z","title":"The tool decathlon: Benchmarking language agents for diverse, realistic, and long-horizon task execution","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.28480","last_updated":"2026-06-26T17:59:51Z","snapshot_observed_at":"2026-07-07T00:02:33.644076Z","submitted_at":"2026-06-26T17:59:51Z","title":"TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-06-30T01:19:54.081755Z"},"links":{"citing_paper":"/paper/2606.28480"},"observation_digest":"sha256:c32afd63ff864f43038c03634af0514fd934119b2ba1366255b1be37a71c9092","observation_id":"e019b000-df36-4581-bc53-a78367626c41","resolution":{"observed_at":"2026-06-30T01:19:54.081755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T01:19:54.081755Z","title":"Reinforcement learning on web interfaces using workflow-guided exploration","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.28480","last_updated":"2026-06-26T17:59:51Z","snapshot_observed_at":"2026-07-07T00:02:33.644076Z","submitted_at":"2026-06-26T17:59:51Z","title":"TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-06-30T01:19:54.081755Z"},"links":{"citing_paper":"/paper/2606.28480"},"observation_digest":"sha256:29b2b2a043ae0b063fb42994ce7428132debdf18b4ecdb5cb56e30b73c543583","observation_id":"431fefbd-afc3-4003-bde3-7a9e846cbb9a","resolution":{"observed_at":"2026-06-30T01:19:54.081755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.14704","last_updated":"2025-08-20T13:28:58Z","snapshot_observed_at":"2026-08-05T18:20:51.232791Z","submitted_at":"2025-08-20T13:28:58Z","title":"MCP-Universe: Benchmarking Large Language Models with Real-World Model Context Protocol Servers","version":1},"cited_work":{"arxiv_id":"2508.14704","doi":"10.48550/arxiv.2508.14704","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.14704","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Luo et al","venue":"ArXiv.org","work_id":"b8148e6c-83f1-4051-b36f-12da866268e3","year":2025},"citing_paper":{"arxiv_id":"2606.28480","last_updated":"2026-06-26T17:59:51Z","snapshot_observed_at":"2026-07-07T00:02:33.644076Z","submitted_at":"2026-06-26T17:59:51Z","title":"TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-06-30T01:19:54.081755Z"},"links":{"cited_paper":"/paper/2508.14704","citing_paper":"/paper/2606.28480"},"observation_digest":"sha256:43df6760658557b4e32caecd340fab116922e5f30b739d70cb4b6c227bb49c42","observation_id":"64bf4e58-c472-490b-9086-b2cd84c4b7e1","resolution":{"observed_at":"2026-07-01T15:35:48.601770Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T01:19:54.081755Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.28480","last_updated":"2026-06-26T17:59:51Z","snapshot_observed_at":"2026-07-07T00:02:33.644076Z","submitted_at":"2026-06-26T17:59:51Z","title":"TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-06-30T01:19:54.081755Z"},"links":{"citing_paper":"/paper/2606.28480"},"observation_digest":"sha256:a3e55a77620f84647240ff2e5056d455b1980ecffa820dbe481265dd319ef907","observation_id":"36102a31-14f0-42cf-9980-b8875ad12668","resolution":{"observed_at":"2026-06-30T01:19:54.081755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T01:19:54.081755Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.28480","last_updated":"2026-06-26T17:59:51Z","snapshot_observed_at":"2026-07-07T00:02:33.644076Z","submitted_at":"2026-06-26T17:59:51Z","title":"TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-06-30T01:19:54.081755Z"},"links":{"citing_paper":"/paper/2606.28480"},"observation_digest":"sha256:a4dd9e5cf06ca3ae21d57b669685633a326eaaa71a52d2ac31935e254f6a57a7","observation_id":"a7148fb0-6d85-4900-b247-6d3f046cdfbf","resolution":{"observed_at":"2026-06-30T01:19:54.081755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T01:19:54.081755Z","title":"Kimi Code : Next-gen ai code agent","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.28480","last_updated":"2026-06-26T17:59:51Z","snapshot_observed_at":"2026-07-07T00:02:33.644076Z","submitted_at":"2026-06-26T17:59:51Z","title":"TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-06-30T01:19:54.081755Z"},"links":{"citing_paper":"/paper/2606.28480"},"observation_digest":"sha256:addfdc0d436038c072422bd0153c6ef932dbb4fc43a4adffae8eba5e39cb9c57","observation_id":"ae1951f4-1842-4f36-ba98-6de2bb745aa0","resolution":{"observed_at":"2026-06-30T01:19:54.081755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T01:19:54.081755Z","title":"Introducing chatgpt","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.28480","last_updated":"2026-06-26T17:59:51Z","snapshot_observed_at":"2026-07-07T00:02:33.644076Z","submitted_at":"2026-06-26T17:59:51Z","title":"TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-06-30T01:19:54.081755Z"},"links":{"citing_paper":"/paper/2606.28480"},"observation_digest":"sha256:1778d471f1787ae06c64e31e4ddce174fbaf0345a1b10d3bd4d40ad9169c1d2c","observation_id":"efe768ab-8af4-413d-a5d7-0b9f9062d14f","resolution":{"observed_at":"2026-06-30T01:19:54.081755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T01:19:54.081755Z","title":"Introducing codex","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.28480","last_updated":"2026-06-26T17:59:51Z","snapshot_observed_at":"2026-07-07T00:02:33.644076Z","submitted_at":"2026-06-26T17:59:51Z","title":"TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-06-30T01:19:54.081755Z"},"links":{"citing_paper":"/paper/2606.28480"},"observation_digest":"sha256:e6a3b5d176d534f9fc68a1e9a2b57c4a8ab825fa53f5afb83d791d18afacf670","observation_id":"a36fc4ad-3632-4ce4-b91a-0260aa1f56c4","resolution":{"observed_at":"2026-06-30T01:19:54.081755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T01:19:54.081755Z","title":"Introducing GPT-5.5","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.28480","last_updated":"2026-06-26T17:59:51Z","snapshot_observed_at":"2026-07-07T00:02:33.644076Z","submitted_at":"2026-06-26T17:59:51Z","title":"TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-06-30T01:19:54.081755Z"},"links":{"citing_paper":"/paper/2606.28480"},"observation_digest":"sha256:3156330d4ad39cec514375411bc2a84fce71f58100a9a27fe64deebb9bb3785b","observation_id":"c84785ee-43bf-46d6-a6a3-2c8e6514cc11","resolution":{"observed_at":"2026-06-30T01:19:54.081755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T01:19:54.081755Z","title":"Openclaw: Personal ai assistant","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.28480","last_updated":"2026-06-26T17:59:51Z","snapshot_observed_at":"2026-07-07T00:02:33.644076Z","submitted_at":"2026-06-26T17:59:51Z","title":"TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-06-30T01:19:54.081755Z"},"links":{"citing_paper":"/paper/2606.28480"},"observation_digest":"sha256:efacc2687b8e149fdb3a2a321665b361bafc9dd21e2f7e2a5383230c270d28fc","observation_id":"b33322c7-2883-487b-bbfd-5aed69554bbd","resolution":{"observed_at":"2026-06-30T01:19:54.081755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T01:19:54.081755Z","title":"Opencode: A powerful ai coding agent built for the terminal","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.28480","last_updated":"2026-06-26T17:59:51Z","snapshot_observed_at":"2026-07-07T00:02:33.644076Z","submitted_at":"2026-06-26T17:59:51Z","title":"TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-06-30T01:19:54.081755Z"},"links":{"citing_paper":"/paper/2606.28480"},"observation_digest":"sha256:4e61cd4d17fc8b43989ef89cee4363b20c2500fcaf3a93226b4fd7fbbe523c22","observation_id":"8ac65447-d74e-40db-b09b-a558cac7a0da","resolution":{"observed_at":"2026-06-30T01:19:54.081755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.04374","last_updated":"2025-10-05T21:36:43Z","snapshot_observed_at":"2026-07-06T22:31:44.964774Z","submitted_at":"2025-10-05T21:36:43Z","title":"GDPval: Evaluating AI Model Performance on Real-World Economically Valuable Tasks","version":1},"cited_work":{"arxiv_id":"2510.04374","doi":"10.3102/0013189x023002005","metadata_source":"pith","pith_arxiv_id":"2510.04374","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GDPval: Evaluating AI Model Performance on Real-World Economically Valuable Tasks","venue":"cs.LG","work_id":"6eca346e-0e48-4240-961c-1ecee1e71aab","year":2025},"citing_paper":{"arxiv_id":"2606.28480","last_updated":"2026-06-26T17:59:51Z","snapshot_observed_at":"2026-07-07T00:02:33.644076Z","submitted_at":"2026-06-26T17:59:51Z","title":"TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-06-30T01:19:54.081755Z"},"links":{"cited_paper":"/paper/2510.04374","citing_paper":"/paper/2606.28480"},"observation_digest":"sha256:42ae2aad74568b1b36d971ac6f5d7016e9cedebfca8a9dab25bd6e8f2a46c43a","observation_id":"85f3b51e-4379-4a32-a0c7-b67c0ca0d4a0","resolution":{"observed_at":"2026-07-01T15:35:48.604798Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T01:19:54.081755Z","title":"Tools and techniques for computational reproducibility","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2606.28480","last_updated":"2026-06-26T17:59:51Z","snapshot_observed_at":"2026-07-07T00:02:33.644076Z","submitted_at":"2026-06-26T17:59:51Z","title":"TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-06-30T01:19:54.081755Z"},"links":{"citing_paper":"/paper/2606.28480"},"observation_digest":"sha256:e858f19e114f8b720483da0d36d3fcc208f0c8bdb32d5318f6d14f87463cacd7","observation_id":"d9af790e-20b0-4604-87b4-9b52e8531190","resolution":{"observed_at":"2026-06-30T01:19:54.081755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T01:19:54.081755Z","title":"Podman: The best free and open source container tools","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.28480","last_updated":"2026-06-26T17:59:51Z","snapshot_observed_at":"2026-07-07T00:02:33.644076Z","submitted_at":"2026-06-26T17:59:51Z","title":"TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-06-30T01:19:54.081755Z"},"links":{"citing_paper":"/paper/2606.28480"},"observation_digest":"sha256:b3fc1e8014cec6c04b9fd54f275f507d712346b0ba35bef59572e49e01945cfe","observation_id":"b36f6144-0c5c-40f1-a107-5b76cf344966","resolution":{"observed_at":"2026-06-30T01:19:54.081755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T01:19:54.081755Z","title":"Qwen Code : An open-source ai coding agent that lives in your terminal","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.28480","last_updated":"2026-06-26T17:59:51Z","snapshot_observed_at":"2026-07-07T00:02:33.644076Z","submitted_at":"2026-06-26T17:59:51Z","title":"TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-06-30T01:19:54.081755Z"},"links":{"citing_paper":"/paper/2606.28480"},"observation_digest":"sha256:7cae3c758c11e574bdacae6cec788ee7d15e60cb1bc78835dc7e619af715fabf","observation_id":"08affb35-932a-472c-aeb8-630951b46d47","resolution":{"observed_at":"2026-06-30T01:19:54.081755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T01:19:54.081755Z","title":"World of bits: An open-domain platform for web-based agents","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.28480","last_updated":"2026-06-26T17:59:51Z","snapshot_observed_at":"2026-07-07T00:02:33.644076Z","submitted_at":"2026-06-26T17:59:51Z","title":"TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-06-30T01:19:54.081755Z"},"links":{"citing_paper":"/paper/2606.28480"},"observation_digest":"sha256:c183da84abd12d1677b1cf6f5542590dc4c324195e5f21488d5abf4ca20970e7","observation_id":"08c3fea9-715d-49bf-a4ea-57fbc77b8e5f","resolution":{"observed_at":"2026-06-30T01:19:54.081755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T01:19:54.081755Z","title":"Slack CLI","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.28480","last_updated":"2026-06-26T17:59:51Z","snapshot_observed_at":"2026-07-07T00:02:33.644076Z","submitted_at":"2026-06-26T17:59:51Z","title":"TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-06-30T01:19:54.081755Z"},"links":{"citing_paper":"/paper/2606.28480"},"observation_digest":"sha256:0c2c0534a97c3cbd0ab1cd4042508cec92a28b87312dafa4af5027a4782647d7","observation_id":"e7dd5f20-4ecf-4cd8-be39-2d31eb00fd9a","resolution":{"observed_at":"2026-06-30T01:19:54.081755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T01:19:54.081755Z","title":"Gemini 3.1 pro: A smarter model for your most complex tasks","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.28480","last_updated":"2026-06-26T17:59:51Z","snapshot_observed_at":"2026-07-07T00:02:33.644076Z","submitted_at":"2026-06-26T17:59:51Z","title":"TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-06-30T01:19:54.081755Z"},"links":{"citing_paper":"/paper/2606.28480"},"observation_digest":"sha256:22c2ad4cf7d012d34bcb03731b6234e9f1189b533652746f84eee972b2e9eb1d","observation_id":"1f466802-afd2-4201-8417-3a0e80e61373","resolution":{"observed_at":"2026-06-30T01:19:54.081755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T01:19:54.081755Z","title":"Openhands: An open platform for ai software developers as generalist agents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.28480","last_updated":"2026-06-26T17:59:51Z","snapshot_observed_at":"2026-07-07T00:02:33.644076Z","submitted_at":"2026-06-26T17:59:51Z","title":"TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-06-30T01:19:54.081755Z"},"links":{"citing_paper":"/paper/2606.28480"},"observation_digest":"sha256:c771e6d893f2a10174063560f872ff3d460bb0cee5af934928f091fe4d226868","observation_id":"62fd88a1-c319-48ec-bc18-e14800606335","resolution":{"observed_at":"2026-06-30T01:19:54.081755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.19056","last_updated":"2024-07-26T19:27:17Z","snapshot_observed_at":"2026-08-03T10:35:13.470915Z","submitted_at":"2024-07-26T19:27:17Z","title":"OfficeBench: Benchmarking Language Agents across Multiple Applications for Office Automation","version":1},"cited_work":{"arxiv_id":"2407.19056","doi":"10.48550/arxiv.2407.19056","metadata_source":"pith","pith_arxiv_id":"2407.19056","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Officebench: Benchmarking language agents across multiple applications for office automation","venue":"cs.CL","work_id":"1f4b598a-160f-4513-9b90-2233578e53a0","year":2024},"citing_paper":{"arxiv_id":"2606.28480","last_updated":"2026-06-26T17:59:51Z","snapshot_observed_at":"2026-07-07T00:02:33.644076Z","submitted_at":"2026-06-26T17:59:51Z","title":"TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-06-30T01:19:54.081755Z"},"links":{"cited_paper":"/paper/2407.19056","citing_paper":"/paper/2606.28480"},"observation_digest":"sha256:2e1bd0157ac4b8e2245bccc415420aaea25e08b8595f7575fe731f313ec31049","observation_id":"3518003a-bc10-4f58-b364-081854468251","resolution":{"observed_at":"2026-07-01T15:35:48.605245Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T01:19:54.081755Z","title":"Llm-supported natural language to bash translation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.28480","last_updated":"2026-06-26T17:59:51Z","snapshot_observed_at":"2026-07-07T00:02:33.644076Z","submitted_at":"2026-06-26T17:59:51Z","title":"TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-06-30T01:19:54.081755Z"},"links":{"citing_paper":"/paper/2606.28480"},"observation_digest":"sha256:c780212521501ce54f2041c77be44304e069b62ace2a9887686d5bee78db05f9","observation_id":"ca32202f-05ad-4611-aca5-d843a438fc0c","resolution":{"observed_at":"2026-06-30T01:19:54.081755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T01:19:54.081755Z","title":"MiMo Code : Scaling coding agents to long-horizon tasks","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.28480","last_updated":"2026-06-26T17:59:51Z","snapshot_observed_at":"2026-07-07T00:02:33.644076Z","submitted_at":"2026-06-26T17:59:51Z","title":"TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-06-30T01:19:54.081755Z"},"links":{"citing_paper":"/paper/2606.28480"},"observation_digest":"sha256:f80873179181c12edfcddfe7bb3a745600fd15b5816ecf5d90aa21c79e8cec9a","observation_id":"29d7e58e-b0a8-4a0b-9af8-cbb7cd8d5fee","resolution":{"observed_at":"2026-06-30T01:19:54.081755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T01:19:54.081755Z","title":"Osworld: Benchmarking multimodal agents for open-ended tasks in real computer environments","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.28480","last_updated":"2026-06-26T17:59:51Z","snapshot_observed_at":"2026-07-07T00:02:33.644076Z","submitted_at":"2026-06-26T17:59:51Z","title":"TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-06-30T01:19:54.081755Z"},"links":{"citing_paper":"/paper/2606.28480"},"observation_digest":"sha256:ac3ef4eaa97bc64de8c6a2a80d0ee6a6ac180275362d1b3f6f2ea4af2b086211","observation_id":"e9c29a3f-9bea-4aa8-9b6a-2c094d0fb34b","resolution":{"observed_at":"2026-06-30T01:19:54.081755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T01:19:54.081755Z","title":"Swe-agent: Agent-computer interfaces enable automated software engineering","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.28480","last_updated":"2026-06-26T17:59:51Z","snapshot_observed_at":"2026-07-07T00:02:33.644076Z","submitted_at":"2026-06-26T17:59:51Z","title":"TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-06-30T01:19:54.081755Z"},"links":{"citing_paper":"/paper/2606.28480"},"observation_digest":"sha256:96080889510038a39be70707dd48ab1777413d30ece9b2eb51ef39f7f693d5bd","observation_id":"0b5dbc41-22a5-4c0e-a167-985b33358bac","resolution":{"observed_at":"2026-06-30T01:19:54.081755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T01:19:54.081755Z","title":"macosworld: A multilingual interactive benchmark for gui agents","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.28480","last_updated":"2026-06-26T17:59:51Z","snapshot_observed_at":"2026-07-07T00:02:33.644076Z","submitted_at":"2026-06-26T17:59:51Z","title":"TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-06-30T01:19:54.081755Z"},"links":{"citing_paper":"/paper/2606.28480"},"observation_digest":"sha256:ef5b0b3e66b24b2d17c85ddd1b29e719839d034b7b42dd3fa8845c14073358e4","observation_id":"00428fbd-4ce3-4cd7-9ee7-3f7e28924d1f","resolution":{"observed_at":"2026-06-30T01:19:54.081755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.03854","last_updated":"2026-06-02T16:30:33Z","snapshot_observed_at":"2026-08-06T14:43:37.104974Z","submitted_at":"2026-06-02T16:30:33Z","title":"CLI-Anything: Towards Agent-Native Computer Use","version":1},"cited_work":{"arxiv_id":"2606.03854","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.03854","snapshot_observed_at":"2026-07-04T10:59:46.552087Z","title":"CLI-Anything: Towards Agent-Native Computer Use","venue":"cs.HC","work_id":"dd37adfd-b8f9-4603-89e4-936fa909b3cc","year":2026},"citing_paper":{"arxiv_id":"2606.28480","last_updated":"2026-06-26T17:59:51Z","snapshot_observed_at":"2026-07-07T00:02:33.644076Z","submitted_at":"2026-06-26T17:59:51Z","title":"TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-06-30T01:19:54.081755Z"},"links":{"cited_paper":"/paper/2606.03854","citing_paper":"/paper/2606.28480"},"observation_digest":"sha256:5038132baf0cc88c8fb0383cb8e055d4e0334d3ddd1229e068ee6501c31dad12","observation_id":"e296fcdb-f575-4863-934d-4e97dc9610eb","resolution":{"observed_at":"2026-07-01T15:35:48.587209Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T01:19:54.081755Z","title":"Xu, Hao Zhu, Xuhui Zhou, Robert Lo, Abishek Sridhar, Xianyi Cheng, Tianyue Ou, Yonatan Bisk, Daniel Fried, Uri Alon, and Graham Neubig","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.28480","last_updated":"2026-06-26T17:59:51Z","snapshot_observed_at":"2026-07-07T00:02:33.644076Z","submitted_at":"2026-06-26T17:59:51Z","title":"TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-06-30T01:19:54.081755Z"},"links":{"citing_paper":"/paper/2606.28480"},"observation_digest":"sha256:976f40ec527cc92655bc95bc90c815e1199221288607c2e19c5085eae1605762","observation_id":"5d9a0a9e-ea04-475e-a76f-499582310dca","resolution":{"observed_at":"2026-06-30T01:19:54.081755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.28480","last_updated":"2026-06-26T17:59:51Z","latest_version":1,"primary_category":"cs.SE","snapshot_observed_at":"2026-07-07T00:02:33.644076Z","submitted_at":"2026-06-26T17:59:51Z","title":"TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents"},"reference_resolution":{"displayed":90,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":1,"unresolved":80,"verified_exact":7,"verified_fuzzy":0},"total_outbound_references":90},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 90 of 90 outbound references and 1 inbound Pith citation observation for arXiv:2606.28480."}