{"as_of":"2026-08-16T06:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2e03ecf89679b71167a8a96ec2315ae8c230ecb17cd8e76956597e39f8ddc138","coverage":[{"denominator":56,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":56,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T14:16:32.198253Z","state":"measured"},{"denominator":56,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":56,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.11434/citation-record","integrity":"/paper/2608.11434/integrity","json":"/paper/2608.11434/citation-record.json","paper":"/paper/2608.11434"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:16:31.911176Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-15T23:10:07.942718Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:31.911176Z"},"links":{"citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:7a9c4f8580050eea9bc54b7d050733197f9f8056ed32b40cb245556b85d18b23","observation_id":"459565ae-63e7-4dd6-a812-ad3413836f2f","resolution":{"observed_at":"2026-08-15T14:16:31.911176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15594","last_updated":"2025-10-19T10:32:43Z","snapshot_observed_at":"2026-08-13T06:43:22.011336Z","submitted_at":"2024-11-23T16:03:35Z","title":"A Survey on LLM-as-a-Judge","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15594","snapshot_observed_at":"2026-08-15T14:16:31.917445Z","title":"arXiv preprint arXiv:2411.15594 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-15T23:10:07.942718Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:31.917445Z"},"links":{"cited_paper":"/paper/2411.15594","citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:804dd56bd155eaa78ef51a8501176b46e7235506292496b26e7e48ae791e29e7","observation_id":"4c37776f-8270-447b-8722-155012e39f7b","resolution":{"observed_at":"2026-08-15T14:16:31.917445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05579","last_updated":"2024-12-10T05:49:12Z","snapshot_observed_at":"2026-08-11T23:22:45.789386Z","submitted_at":"2024-12-07T08:07:24Z","title":"LLMs-as-Judges: A Comprehensive Survey on LLM-based Evaluation Methods","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05579","snapshot_observed_at":"2026-08-15T14:16:31.923269Z","title":"arXiv preprint arXiv:2412.05579 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-15T23:10:07.942718Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:31.923269Z"},"links":{"cited_paper":"/paper/2412.05579","citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:de9719dbc67ad67c4d0dbc2ebd6ab8c9daefcf7871b8821cf1391fcf2361d88b","observation_id":"859ba63b-7930-4f89-a197-ccde841f800a","resolution":{"observed_at":"2026-08-15T14:16:31.923269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10934","last_updated":"2024-10-16T17:54:12Z","snapshot_observed_at":"2026-08-12T22:23:27.859816Z","submitted_at":"2024-10-14T17:57:02Z","title":"Agent-as-a-Judge: Evaluate Agents with Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10934","snapshot_observed_at":"2026-08-15T14:16:31.928785Z","title":"arXiv preprint arXiv:2410.10934 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-15T23:10:07.942718Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:31.928785Z"},"links":{"cited_paper":"/paper/2410.10934","citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:d31ba1f6c6b990f8a0977b27284df4c5f95997cd3b47d79a82935a0451fdebcc","observation_id":"22ce04ac-f32a-4eea-8542-f17a247c9d6e","resolution":{"observed_at":"2026-08-15T14:16:31.928785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.18370","last_updated":"2024-07-25T20:04:59Z","snapshot_observed_at":"2026-08-12T23:14:34.174205Z","submitted_at":"2024-07-25T20:04:59Z","title":"Trust or Escalate: LLM Judges with Provable Guarantees for Human Agreement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.18370","snapshot_observed_at":"2026-08-15T14:16:31.934258Z","title":"arXiv preprint arXiv:2407.18370 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-15T23:10:07.942718Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:31.934258Z"},"links":{"cited_paper":"/paper/2407.18370","citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:17e7ac66ced90fe1a97831965b84b44c2d3102a9417d21154603ce456a76938c","observation_id":"4159f734-2f57-418f-9a2e-69c61e1657ef","resolution":{"observed_at":"2026-08-15T14:16:31.934258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:16:31.939821Z","title":"arXiv preprint arXiv:2502.01534 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-15T23:10:07.942718Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:31.939821Z"},"links":{"citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:501488db90077abaa96ab2cb5e832a2e6d73fbb0ac46bb5045de8a6f0f8c275a","observation_id":"d1fa04e0-638a-4413-8c14-96337f107169","resolution":{"observed_at":"2026-08-15T14:16:31.939821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.17631","last_updated":"2025-03-01T17:06:43Z","snapshot_observed_at":"2026-08-15T19:00:00.338243Z","submitted_at":"2023-10-26T17:48:58Z","title":"JudgeLM: Fine-tuned Large Language Models are Scalable Judges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.17631","snapshot_observed_at":"2026-08-15T14:16:31.945269Z","title":"arXiv preprint arXiv:2310.17631 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-15T23:10:07.942718Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:31.945269Z"},"links":{"cited_paper":"/paper/2310.17631","citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:656a46f2075323d4963e89c895490985684fc28812f7df9f738bd077405b5fc4","observation_id":"59a8ad62-7e33-48fa-b8b8-bdeb29d4b960","resolution":{"observed_at":"2026-08-15T14:16:31.945269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00215","last_updated":"2024-06-28T19:53:17Z","snapshot_observed_at":"2026-08-12T23:32:25.133777Z","submitted_at":"2024-06-28T19:53:17Z","title":"LLM Critics Help Catch LLM Bugs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00215","snapshot_observed_at":"2026-08-15T14:16:31.951140Z","title":"arXiv preprint arXiv:2407.00215 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-15T23:10:07.942718Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:31.951140Z"},"links":{"cited_paper":"/paper/2407.00215","citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:833fecc832e4129f06a63e65a037eecc504a79a5a03c04063cc0bc13fadc8f04","observation_id":"04cf6c93-592c-4d2a-afaa-6fbdbd114091","resolution":{"observed_at":"2026-08-15T14:16:31.951140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:16:31.956961Z","title":"arXiv preprint arXiv:2504.08942 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-15T23:10:07.942718Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:31.956961Z"},"links":{"citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:ac7a213247e9d057018d240d67f21732a20f53b4050ea3f3d3719c34d6d275f9","observation_id":"53e2ec39-3c31-494c-baaa-6429e480fa76","resolution":{"observed_at":"2026-08-15T14:16:31.956961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06474","last_updated":"2024-10-07T14:19:37Z","snapshot_observed_at":"2026-08-15T11:05:27.808334Z","submitted_at":"2024-04-09T17:25:47Z","title":"Autonomous Evaluation and Refinement of Digital Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06474","snapshot_observed_at":"2026-08-15T14:16:31.962001Z","title":"arXiv preprint arXiv:2404.06474 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-15T23:10:07.942718Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:31.962001Z"},"links":{"cited_paper":"/paper/2404.06474","citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:85ccb6bcf6572163bf9eafa228ec5fd5545ee7b37244d67265b9f02239f337c7","observation_id":"032d1b18-e46a-41d3-90a3-a4e053a48ce1","resolution":{"observed_at":"2026-08-15T14:16:31.962001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:16:31.967653Z","title":"arXiv preprint arXiv:2503.02403 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-15T23:10:07.942718Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:31.967653Z"},"links":{"citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:fc83151b3fb998ea61bdef237204c9196b2e9535bf26161f5de0f193af2aee8a","observation_id":"098aef06-4c47-4b4e-82b4-11f191ecb904","resolution":{"observed_at":"2026-08-15T14:16:31.967653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:16:31.972605Z","title":"arXiv preprint arXiv:2504.01382 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-15T23:10:07.942718Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:31.972605Z"},"links":{"citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:3e013c7c27f32162e25e90e361acc19401ebdd39a41740e1be90b9650aeaebf6","observation_id":"416e280a-2822-4573-b6ef-49d966f55767","resolution":{"observed_at":"2026-08-15T14:16:31.972605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:16:33.349967Z","title":"Agentic Reward Modeling: Verifying","venue":null,"work_id":"ccb6be5c-0d09-440a-8841-a0fb9b0a07b0","year":null},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-15T23:10:07.942718Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:31.978148Z"},"links":{"citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:29da8553d36ffcdf837e74c60b8a84bb5a792d2a11e147b1c73fc37b101331aa","observation_id":"785bddc2-7648-4494-be09-4673ab7c0821","resolution":{"observed_at":"2026-08-15T14:16:33.355751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.21823","last_updated":"2026-04-15T09:19:46Z","snapshot_observed_at":"2026-07-06T22:30:50.642382Z","submitted_at":"2025-09-26T03:29:36Z","title":"ProRe: A Proactive Reward System for GUI Agents via Reasoner-Actor Collaboration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.21823","snapshot_observed_at":"2026-08-15T14:16:31.983082Z","title":"arXiv preprint arXiv:2509.21823 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-15T23:10:07.942718Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:31.983082Z"},"links":{"cited_paper":"/paper/2509.21823","citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:e1f5439698c49e472b0623cf6c0e834e9ca5618790b8e90b3d12f97169fce80e","observation_id":"8963812d-7c3d-4d88-8712-ca0ae5ca3e97","resolution":{"observed_at":"2026-08-15T14:16:31.983082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:16:31.988574Z","title":"The Thirteenth International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-15T23:10:07.942718Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:31.988574Z"},"links":{"citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:4a3a403de71319bf5932d778d1a380e352796a8210f92bf397121734c1354298","observation_id":"84019af1-727f-40e6-a9ce-30c178af32cc","resolution":{"observed_at":"2026-08-15T14:16:31.988574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:16:33.321610Z","title":"The Thirteenth International Conference on Learning Representations , year=","venue":null,"work_id":"18d48ea1-2955-4a68-86c6-c2d791d92e8d","year":null},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-15T23:10:07.942718Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:31.993527Z"},"links":{"citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:a744682816dac4e1048806ed8235c49b5a5fef09497272531f2102637169ddf7","observation_id":"51f932d1-9049-4148-b46e-9b8eb2ec1d99","resolution":{"observed_at":"2026-08-15T14:16:33.326938Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:16:33.305620Z","title":"2025 , eprint=","venue":null,"work_id":"8933a2f3-73d2-4db3-ba92-c0ae4bee7c6a","year":2025},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-15T23:10:07.942718Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:31.998716Z"},"links":{"citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:300723d8b1c8e8b74f7fba1e67407af946b35877aea12e2943245858b4d82921","observation_id":"f2883150-765b-44d4-bbb6-7f7d9e876b27","resolution":{"observed_at":"2026-08-15T14:16:33.310381Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:16:33.289841Z","title":"Proceedings of the 30th ACM SIGKDD conference on knowledge discovery and data mining , pages=","venue":null,"work_id":"e1d0e92d-c783-4e22-a669-55531555e6c9","year":null},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-15T23:10:07.942718Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:32.003906Z"},"links":{"citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:d9cad1c415e48011b28fbe88cb9120db6bf5fd4401a67a46eac0ebdddb7f5f5b","observation_id":"8ce83736-aed8-46d5-b7aa-a39987ff5fee","resolution":{"observed_at":"2026-08-15T14:16:33.295066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:16:32.008836Z","title":"Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-15T23:10:07.942718Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:32.008836Z"},"links":{"citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:3c26bfe4b3ab9b12b1ce7f5123126e1fac7dd580aff1ddba3d23577c960855cb","observation_id":"c76913cf-4f77-4859-8e4d-d017b199c749","resolution":{"observed_at":"2026-08-15T14:16:32.008836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16660","last_updated":"2025-07-21T02:55:09Z","snapshot_observed_at":"2026-08-13T00:22:13.699633Z","submitted_at":"2024-04-25T14:56:32Z","title":"Benchmarking Mobile Device Control Agents across Diverse Configurations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16660","snapshot_observed_at":"2026-08-15T14:16:32.013673Z","title":"arXiv preprint arXiv:2404.16660 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-15T23:10:07.942718Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:32.013673Z"},"links":{"cited_paper":"/paper/2404.16660","citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:f52a0297a734ab01e754ecf63c0dc85a7d40330cc781b680e8f3ef0880600649","observation_id":"20a63972-cfe0-4996-ad35-5a3959ff5151","resolution":{"observed_at":"2026-08-15T14:16:32.013673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:16:32.018875Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-15T23:10:07.942718Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:32.018875Z"},"links":{"citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:5c5c71b3e17aee04a7b5d09ec26ce9f0e63ec85799dcc728ba3c46820d0182df","observation_id":"0734db5b-9877-426b-a87b-8099740f23e8","resolution":{"observed_at":"2026-08-15T14:16:32.018875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:16:32.023625Z","title":"The Twelfth International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-15T23:10:07.942718Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:32.023625Z"},"links":{"citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:50d12f39a3a87f48405c7d6be133e21cccf2e97ea644d1affa3bab61d800375e","observation_id":"856bbb72-5629-41d5-9e79-8e999dc5a31e","resolution":{"observed_at":"2026-08-15T14:16:32.023625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:16:32.028406Z","title":"Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-15T23:10:07.942718Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:32.028406Z"},"links":{"citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:e2927d160f1ef1c723ec654c53a37c9d56cd5b78f77529a32fecc979b97309d7","observation_id":"40982bc3-e1a1-48a3-a05a-b807dd17939d","resolution":{"observed_at":"2026-08-15T14:16:32.028406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:16:32.033137Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-15T23:10:07.942718Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:32.033137Z"},"links":{"citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:3eff67909df49dc7f650c9864828d562b22786eda00c87b39e7b734afdff657d","observation_id":"c06a0372-89c0-4a33-8383-574f9f29d717","resolution":{"observed_at":"2026-08-15T14:16:32.033137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:16:32.038168Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-15T23:10:07.942718Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:32.038168Z"},"links":{"citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:2f8cbc94ac74892745adad00f058daf88e0942a79f75d9b5e5bb728f838a647e","observation_id":"3edaa242-13ea-49b3-ba36-5ac3246d2f18","resolution":{"observed_at":"2026-08-15T14:16:32.038168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:16:32.042790Z","title":"AgentBench: Evaluating","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-15T23:10:07.942718Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:32.042790Z"},"links":{"citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:e6f40e7a7b504b7e998390ea38ac57d527905f2dd616d41e8ed0cd2b47c77af3","observation_id":"e6b39dcc-4d15-4b58-b11c-f377d615c79f","resolution":{"observed_at":"2026-08-15T14:16:32.042790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:16:32.047694Z","title":"Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-15T23:10:07.942718Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:32.047694Z"},"links":{"citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:2e97a38950bcb9fcfe721a8021521b0d14e6533bf85053b257ed9bb9407cef25","observation_id":"44b90881-c4fa-42fd-9c9a-737df97b0901","resolution":{"observed_at":"2026-08-15T14:16:32.047694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:16:32.052364Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-15T23:10:07.942718Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:32.052364Z"},"links":{"citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:f313f7072b50b0b896ecba7bbae9f7957bd12f2abce022507f6e0eec3aef6e9c","observation_id":"174e94ea-8eff-427a-8fd1-b262c726d22e","resolution":{"observed_at":"2026-08-15T14:16:32.052364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:16:32.057692Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-15T23:10:07.942718Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:32.057692Z"},"links":{"citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:b65918baa9c6d8fd054961ca7f244980865a41d772cd52a54a49410f801d70d4","observation_id":"0d672b7b-1725-44eb-bf82-ced1257f74e2","resolution":{"observed_at":"2026-08-15T14:16:32.057692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:16:32.062580Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-15T23:10:07.942718Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:32.062580Z"},"links":{"citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:16edb6ea418c73461db72726931336b93afdde532d6adec9edca0687b76abf04","observation_id":"172e35b6-9782-4df1-82a2-1f2450f4ab0a","resolution":{"observed_at":"2026-08-15T14:16:32.062580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-16T03:49:00.703994Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-15T14:16:32.067446Z","title":"arXiv preprint arXiv:2212.08073 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-15T23:10:07.942718Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:32.067446Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:9b05b8525102a78f0fd620805281f4466fadab72ebac6349af70ba8d86933758","observation_id":"6cbe5f76-0556-41be-a8aa-af24c2fe83a4","resolution":{"observed_at":"2026-08-15T14:16:32.067446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:16:32.073219Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-15T23:10:07.942718Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:32.073219Z"},"links":{"citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:890558d8f155cc2eb066a9b60327810765db9dc76b56f533b5e7e52de3fddbdf","observation_id":"e9bd76ce-9bd4-40ed-b964-3c170892c2a6","resolution":{"observed_at":"2026-08-15T14:16:32.073219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:16:32.079033Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-15T23:10:07.942718Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:32.079033Z"},"links":{"citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:58c5d12f80c68f7e417e61ac8c0aa2929d881ffc3814fa65138153916d198832","observation_id":"03355267-5ae0-4dfa-b3dc-df89f733b8ed","resolution":{"observed_at":"2026-08-15T14:16:32.079033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:16:32.083855Z","title":"arXiv preprint arXiv:2509.18119 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-15T23:10:07.942718Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:32.083855Z"},"links":{"citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:f0dddf88d40589ec13002ee09a0c08b464caa480827a3f03a928470324382a64","observation_id":"296ab333-57e0-4942-948f-8679fa6474f2","resolution":{"observed_at":"2026-08-15T14:16:32.083855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05720","last_updated":"2025-07-08T07:07:53Z","snapshot_observed_at":"2026-08-14T16:53:04.784753Z","submitted_at":"2025-07-08T07:07:53Z","title":"MobileGUI-RL: Advancing Mobile GUI Agent through Reinforcement Learning in Online Environment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.05720","snapshot_observed_at":"2026-08-15T14:16:32.088344Z","title":"arXiv preprint arXiv:2507.05720 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-15T23:10:07.942718Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:32.088344Z"},"links":{"cited_paper":"/paper/2507.05720","citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:5d4b861567d0b6340c7f068b8061aa5ab5a4020aa927835f884aebf551bb1755","observation_id":"0f56b061-3d55-465d-a1bf-fc66b6dc4e69","resolution":{"observed_at":"2026-08-15T14:16:32.088344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:16:32.093292Z","title":"Findings of the Association for Computational Linguistics: NAACL 2025 , pages=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-15T23:10:07.942718Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:32.093292Z"},"links":{"citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:492a37c5856dfe23376b79a9cb63211679ec2e9e032d5067e1fa93370eb62e71","observation_id":"65c1156f-ba41-4315-a70f-56cb60bbc993","resolution":{"observed_at":"2026-08-15T14:16:32.093292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:16:32.098421Z","title":"International Conference on Machine Learning , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-15T23:10:07.942718Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:32.098421Z"},"links":{"citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:10f3a262a33ccf8c46499db49676572edf0d3f73732e856563b21b70c8fb2333","observation_id":"77aeb3c1-2a88-4476-9888-5e1845537f1c","resolution":{"observed_at":"2026-08-15T14:16:32.098421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2409.15922","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:16:32.464091Z","title":"arXiv preprint arXiv:2409.15922 , year=","venue":null,"work_id":"f0f2133f-fcac-40e3-8a17-9671f8d8140d","year":null},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-15T23:10:07.942718Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:32.104134Z"},"links":{"citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:e12ad2c7cd829e6a8dd7d1ae5ccf5f0200a0a93d8f489eca94e630f6186af105","observation_id":"fdc80167-d9ce-44c6-bdd7-9fc0bea76df0","resolution":{"observed_at":"2026-08-15T14:16:32.473314Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:16:32.109139Z","title":"The Eleventh International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-15T23:10:07.942718Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:32.109139Z"},"links":{"citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:caca1ed8577cc81d05c7e7a323518cacfd79efb87d57c75fcf1bc193b47bdd4b","observation_id":"596d336c-524c-4359-956c-5136dfa0cb19","resolution":{"observed_at":"2026-08-15T14:16:32.109139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:16:32.113664Z","title":"2023 , eprint=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-15T23:10:07.942718Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:32.113664Z"},"links":{"citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:935a0dccc5d6fe423e40b7e7311eb25439fe2bde83e7910e36c83eb2fa01bbfd","observation_id":"8ab4694e-adef-4b5b-a7e2-ad6578e1705d","resolution":{"observed_at":"2026-08-15T14:16:32.113664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:16:32.120720Z","title":"2023 , eprint=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-15T23:10:07.942718Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:32.120720Z"},"links":{"citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:99bc23e8e0fd428294c21aa3204c0d08ac2e70cde32f5673749317957be6281d","observation_id":"42469195-bcff-40ab-b82e-fcd6fd95bd22","resolution":{"observed_at":"2026-08-15T14:16:32.120720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12326","last_updated":"2025-01-21T17:48:10Z","snapshot_observed_at":"2026-07-06T20:23:58.426780Z","submitted_at":"2025-01-21T17:48:10Z","title":"UI-TARS: Pioneering Automated GUI Interaction with Native Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12326","snapshot_observed_at":"2026-08-15T14:16:32.125755Z","title":"arXiv preprint arXiv:2501.12326 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-15T23:10:07.942718Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:32.125755Z"},"links":{"cited_paper":"/paper/2501.12326","citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:ef5af93c8d10931a3ece43827f520255caf9b61b3ee29380860e86e4002b263b","observation_id":"467705c5-13bc-4cf1-bce6-df9e156c3a3c","resolution":{"observed_at":"2026-08-15T14:16:32.125755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:16:32.130803Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-15T23:10:07.942718Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:32.130803Z"},"links":{"citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:8409f6afc7f64062adeb7b3a3aeba5297f761533603c937efdefb8a785dc86c4","observation_id":"da50c88c-d8e9-4378-ae52-fba1444e3721","resolution":{"observed_at":"2026-08-15T14:16:32.130803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07718","last_updated":"2024-07-23T06:19:28Z","snapshot_observed_at":"2026-08-02T12:09:24.340284Z","submitted_at":"2024-03-12T14:58:45Z","title":"WorkArena: How Capable Are Web Agents at Solving Common Knowledge Work Tasks?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07718","snapshot_observed_at":"2026-08-15T14:16:32.135869Z","title":"arXiv preprint arXiv:2403.07718 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-15T23:10:07.942718Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:32.135869Z"},"links":{"cited_paper":"/paper/2403.07718","citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:2154d2afb2764460e4574d5a9b6b8e7965a0079eac6105e18520569d632260e0","observation_id":"813b31c9-9785-484a-896d-4cc80db9f165","resolution":{"observed_at":"2026-08-15T14:16:32.135869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02907","last_updated":"2025-02-05T18:56:51Z","snapshot_observed_at":"2026-08-12T22:31:19.020948Z","submitted_at":"2024-10-03T18:56:51Z","title":"NNetNav: Unsupervised Learning of Browser Agents Through Environment Interaction in the Wild","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02907","snapshot_observed_at":"2026-08-15T14:16:32.141202Z","title":"arXiv preprint arXiv:2410.02907 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-15T23:10:07.942718Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:32.141202Z"},"links":{"cited_paper":"/paper/2410.02907","citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:e7015bb22267f030468e49277c80394ab5a8408da1a6724e97974dee35cfdad7","observation_id":"db4c014c-b9a1-4712-8858-0f5ad09dbf9d","resolution":{"observed_at":"2026-08-15T14:16:32.141202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:16:32.146221Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-15T23:10:07.942718Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:32.146221Z"},"links":{"citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:4d5c70632aa0b787421738336df192ca8cf34865330c743c813fb0927a00006d","observation_id":"c169458d-480d-4331-b420-f2e2239d0b6c","resolution":{"observed_at":"2026-08-15T14:16:32.146221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12793","last_updated":"2024-07-30T03:58:11Z","snapshot_observed_at":"2026-08-14T09:56:00.692687Z","submitted_at":"2024-06-18T16:58:21Z","title":"ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12793","snapshot_observed_at":"2026-08-15T14:16:32.151042Z","title":"arXiv preprint arXiv:2406.12793 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-15T23:10:07.942718Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:32.151042Z"},"links":{"cited_paper":"/paper/2406.12793","citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:99d997f065d8b1e0ecb936f66edd5289a5736263e7a1599d8c6056f5c94c3e9a","observation_id":"65c21e3b-1e6f-475c-a3cf-39d8ca993a1e","resolution":{"observed_at":"2026-08-15T14:16:32.151042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-15T14:16:32.156301Z","title":"arXiv preprint arXiv:2407.21783 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-15T23:10:07.942718Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:32.156301Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:0e42b84a6270de3cb7aef567645aba2b1eadc168c4f6ce5ea396a1abd13bccd3","observation_id":"c2ca3d5b-87f6-4e61-9d75-a6c634fbc8c9","resolution":{"observed_at":"2026-08-15T14:16:32.156301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-08-15T14:16:32.161977Z","title":"arXiv preprint arXiv:2507.06261 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-15T23:10:07.942718Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:32.161977Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:89088b46fe01b128c06dbeee6ec22086539645d1c6efbb019071f72256da468c","observation_id":"9d0df293-bc95-447d-9e23-29eba29c88e9","resolution":{"observed_at":"2026-08-15T14:16:32.161977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:16:33.058099Z","title":null,"venue":null,"work_id":"83dbd22f-b379-4602-9663-5a505de83548","year":null},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-15T23:10:07.942718Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:32.167383Z"},"links":{"citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:af8b0ecfbffa8160e69e266ac032e06e20fdd3a8fcf690cea59b49a44c45756a","observation_id":"2fa48a6d-d961-44df-b778-5fc06d7491e0","resolution":{"observed_at":"2026-08-15T14:16:33.063532Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:16:33.040679Z","title":null,"venue":null,"work_id":"d286526e-f8ea-4206-96f8-38c7f17d8744","year":null},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-15T23:10:07.942718Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:32.173421Z"},"links":{"citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:4af54c5245215c5df378bb78ade2f993d72029d98670807ba7f0c2fd60751343","observation_id":"ecc1b69f-87eb-4487-9980-26640e937fbd","resolution":{"observed_at":"2026-08-15T14:16:33.046366Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:16:33.023088Z","title":"2025 , note=","venue":null,"work_id":"c85b3675-5380-4b30-80ac-728513fe9121","year":2025},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-15T23:10:07.942718Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:32.178476Z"},"links":{"citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:32d42c0e9aec8cb1195e123a79b732275f36a1320cb3773866ee2500931830e8","observation_id":"f791c250-faf3-4e16-b380-307aca291450","resolution":{"observed_at":"2026-08-15T14:16:33.027992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:16:32.183383Z","title":"2025 , note=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-15T23:10:07.942718Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:32.183383Z"},"links":{"citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:da43a310e4ad1aa8028ec66d8f8ef891cb338f8972db63bbbf6fe45b95013e99","observation_id":"eb6527f1-0fa1-40b0-8443-0b67c865ece4","resolution":{"observed_at":"2026-08-15T14:16:32.183383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-08-03T18:50:30.558321Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-08-15T14:16:32.188278Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-15T23:10:07.942718Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:32.188278Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:436ccc2fbb0c74dfd6b214ead983dc5a73166d0a9978336a5c94328b5d0e9397","observation_id":"248cf1fe-a7ce-41c4-a806-0b0cc83d4ad2","resolution":{"observed_at":"2026-08-15T14:16:32.188278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:16:32.995559Z","title":null,"venue":null,"work_id":"b7324563-0af1-4446-bda0-daf5d152a8fa","year":null},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-15T23:10:07.942718Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:32.193184Z"},"links":{"citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:8c2307284130500870b351c663472f3e3f7ca4ae8113cc876d5bea9c84327cd1","observation_id":"98d9f3cb-4d8f-45a5-83ab-d70e1bdd8a69","resolution":{"observed_at":"2026-08-15T14:16:33.001354Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:16:32.978787Z","title":null,"venue":null,"work_id":"62b39d66-abb7-4f5f-ba9d-895432c7e1ae","year":null},"citing_paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","snapshot_observed_at":"2026-08-15T23:10:07.942718Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-15T14:16:32.198253Z"},"links":{"citing_paper":"/paper/2608.11434"},"observation_digest":"sha256:bb0ac6264cd0e08988b9fe495a636c13c3f767c9516bbacb5dcfde48b94b9bce","observation_id":"347f05eb-0442-49f7-9010-a9d9604287db","resolution":{"observed_at":"2026-08-15T14:16:32.983736Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.11434","last_updated":"2026-08-11T21:00:46Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-15T23:10:07.942718Z","submitted_at":"2026-08-11T21:00:46Z","title":"Benchmarking LLM Judges for Mobile Agent Evaluation"},"reference_resolution":{"displayed":56,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":50,"verified_exact":1,"verified_fuzzy":5},"total_outbound_references":56},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 56 of 56 outbound references and 0 inbound Pith citation observations for arXiv:2608.11434."}