{"as_of":"2026-08-05T01:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:14d0a384b3e459cd4cbd0dca75c28b4a501d3226a7caa7a2fa4c019169d8f87c","coverage":[{"denominator":82,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":82,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T02:18:02.002869Z","state":"measured"},{"denominator":82,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":82,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.28609/citation-record","integrity":"/paper/2607.28609/integrity","json":"/paper/2607.28609/citation-record.json","paper":"/paper/2607.28609"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:18:01.559074Z","title":"Introducing Claude Haiku 4.5","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28609","last_updated":"2026-07-30T17:57:41Z","snapshot_observed_at":"2026-08-03T14:25:08.011501Z","submitted_at":"2026-07-30T17:57:41Z","title":"OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-31T02:18:01.559074Z"},"links":{"citing_paper":"/paper/2607.28609"},"observation_digest":"sha256:25a89dffef53cc267f6876a134a5fd60e5d966f722bb614df9a24f34bda282a6","observation_id":"6f0ece2c-cfe6-4b21-867c-df1a2639c695","resolution":{"observed_at":"2026-07-31T02:18:01.559074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:18:01.565401Z","title":"Introducing Claude Opus 4.6","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28609","last_updated":"2026-07-30T17:57:41Z","snapshot_observed_at":"2026-08-03T14:25:08.011501Z","submitted_at":"2026-07-30T17:57:41Z","title":"OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-31T02:18:01.565401Z"},"links":{"citing_paper":"/paper/2607.28609"},"observation_digest":"sha256:5365a772c445265766bb86c42de55f91e2516d8bbaa10db30d550254121c8e6d","observation_id":"86a9152b-3e6b-4a1c-af7f-bea75ae96674","resolution":{"observed_at":"2026-07-31T02:18:01.565401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:18:01.570451Z","title":"Introducing Claude Opus 4.8","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28609","last_updated":"2026-07-30T17:57:41Z","snapshot_observed_at":"2026-08-03T14:25:08.011501Z","submitted_at":"2026-07-30T17:57:41Z","title":"OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-31T02:18:01.570451Z"},"links":{"citing_paper":"/paper/2607.28609"},"observation_digest":"sha256:b1f119d3641375d10ae585050ca9d0304e032a0f3c4557eab214b2494c9ac58b","observation_id":"be37175b-0cae-4f68-bd30-485ee20ce7dd","resolution":{"observed_at":"2026-07-31T02:18:01.570451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:18:01.575664Z","title":"Introducing Claude Sonnet 4.6","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28609","last_updated":"2026-07-30T17:57:41Z","snapshot_observed_at":"2026-08-03T14:25:08.011501Z","submitted_at":"2026-07-30T17:57:41Z","title":"OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-31T02:18:01.575664Z"},"links":{"citing_paper":"/paper/2607.28609"},"observation_digest":"sha256:e6b1d4d5bed946b5fd89ac40e172d846303e928a58d4a8cd8410cdea8b52de70","observation_id":"7a2945e3-38c9-49de-9c5e-9df9d711e777","resolution":{"observed_at":"2026-07-31T02:18:01.575664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11896","last_updated":"2024-06-14T17:49:55Z","snapshot_observed_at":"2026-08-04T23:41:34.788169Z","submitted_at":"2024-06-14T17:49:55Z","title":"DigiRL: Training In-The-Wild Device-Control Agents with Autonomous Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11896","snapshot_observed_at":"2026-07-31T02:18:01.580579Z","title":"Digirl: Training in-the-wild device-control agents with autonomous reinforcement learning, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28609","last_updated":"2026-07-30T17:57:41Z","snapshot_observed_at":"2026-08-03T14:25:08.011501Z","submitted_at":"2026-07-30T17:57:41Z","title":"OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-31T02:18:01.580579Z"},"links":{"cited_paper":"/paper/2406.11896","citing_paper":"/paper/2607.28609"},"observation_digest":"sha256:7915b34814d6e792efd6d59b11ecebedc7114f1b610209dceeb9829155c82560","observation_id":"becb788d-5be3-4eb4-b251-72025671a35b","resolution":{"observed_at":"2026-07-31T02:18:01.580579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-07-31T02:18:01.586349Z","title":"Qwen3-vl technical report.arXiv preprint arXiv:2511.21631, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28609","last_updated":"2026-07-30T17:57:41Z","snapshot_observed_at":"2026-08-03T14:25:08.011501Z","submitted_at":"2026-07-30T17:57:41Z","title":"OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-31T02:18:01.586349Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2607.28609"},"observation_digest":"sha256:8d79caaa30b8c3d3fe2c9855c9904d26c336f57e08ea880fdf5a82003e19c929","observation_id":"a39e32f3-cf99-4948-87b7-1cf2397d94fd","resolution":{"observed_at":"2026-07-31T02:18:01.586349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.08264","last_updated":"2024-09-13T20:17:13Z","snapshot_observed_at":"2026-07-31T02:01:45.412049Z","submitted_at":"2024-09-12T17:56:43Z","title":"Windows Agent Arena: Evaluating Multi-Modal OS Agents at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.08264","snapshot_observed_at":"2026-07-31T02:18:01.593694Z","title":"Windowsagentarena: Evaluating multi-modal os agents at scale, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28609","last_updated":"2026-07-30T17:57:41Z","snapshot_observed_at":"2026-08-03T14:25:08.011501Z","submitted_at":"2026-07-30T17:57:41Z","title":"OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-31T02:18:01.593694Z"},"links":{"cited_paper":"/paper/2409.08264","citing_paper":"/paper/2607.28609"},"observation_digest":"sha256:a53b9eb4c495e4857cba5cd4f291b0a0536c7f3246ee7dae8a0b2a33a1ec4257","observation_id":"a8e28b60-e354-4d99-84b9-588fabf998a6","resolution":{"observed_at":"2026-07-31T02:18:01.593694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:18:01.599021Z","title":"Seed2.0 model card: Towards intelligence frontier for real-world complexity","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28609","last_updated":"2026-07-30T17:57:41Z","snapshot_observed_at":"2026-08-03T14:25:08.011501Z","submitted_at":"2026-07-30T17:57:41Z","title":"OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-31T02:18:01.599021Z"},"links":{"citing_paper":"/paper/2607.28609"},"observation_digest":"sha256:cda49b591806af975d2dc3ac1b7314d48b661c831d8ee4268e40d467348637a0","observation_id":"44906056-6099-4c43-9fec-8c20240e35b6","resolution":{"observed_at":"2026-07-31T02:18:01.599021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:18:01.604132Z","title":"Web-shepherd: Advancing PRMs for reinforcing web agents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28609","last_updated":"2026-07-30T17:57:41Z","snapshot_observed_at":"2026-08-03T14:25:08.011501Z","submitted_at":"2026-07-30T17:57:41Z","title":"OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-31T02:18:01.604132Z"},"links":{"citing_paper":"/paper/2607.28609"},"observation_digest":"sha256:c2d559f0c4b32a19b1b4b2f109a9950b408df9830a5fce200e9a3a6c7051f3d9","observation_id":"122a9ba3-117f-4d40-a272-4ddddee64a8b","resolution":{"observed_at":"2026-07-31T02:18:01.604132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:18:01.609714Z","title":"Gui-shepherd: Reliableprocessrewardand verification for long-sequence gui tasks, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28609","last_updated":"2026-07-30T17:57:41Z","snapshot_observed_at":"2026-08-03T14:25:08.011501Z","submitted_at":"2026-07-30T17:57:41Z","title":"OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-31T02:18:01.609714Z"},"links":{"citing_paper":"/paper/2607.28609"},"observation_digest":"sha256:7dee1596a7158bf19b02d7540be4d6bee80838a72f91ba16a65f3be75a56f208","observation_id":"2b1dc412-a8c4-4c38-81fd-de27687ab0d7","resolution":{"observed_at":"2026-07-31T02:18:01.609714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04788","last_updated":"2024-06-11T06:21:46Z","snapshot_observed_at":"2026-07-06T17:26:47.184846Z","submitted_at":"2024-02-07T12:28:32Z","title":"MLLM-as-a-Judge: Assessing Multimodal LLM-as-a-Judge with Vision-Language Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04788","snapshot_observed_at":"2026-07-31T02:18:01.617281Z","title":"Mllm-as-a-judge: Assessing multimodal llm-as-a-judge with vision-language benchmark, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28609","last_updated":"2026-07-30T17:57:41Z","snapshot_observed_at":"2026-08-03T14:25:08.011501Z","submitted_at":"2026-07-30T17:57:41Z","title":"OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-31T02:18:01.617281Z"},"links":{"cited_paper":"/paper/2402.04788","citing_paper":"/paper/2607.28609"},"observation_digest":"sha256:91362690fb47eb93c18221cd409418566c7d50683b4f5f9b93801c399733be57","observation_id":"50983d72-a1f0-41fc-9126-68fad673c8f0","resolution":{"observed_at":"2026-07-31T02:18:01.617281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.19132","last_updated":"2025-07-25T10:14:53Z","snapshot_observed_at":"2026-07-06T22:02:46.711356Z","submitted_at":"2025-07-25T10:14:53Z","title":"OS-MAP: How Far Can Computer-Using Agents Go in Breadth and Depth?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.19132","snapshot_observed_at":"2026-07-31T02:18:01.622960Z","title":"Os-map: How far can computer-using agents go in breadth and depth?arXiv preprint arXiv:2507.19132, 2025b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28609","last_updated":"2026-07-30T17:57:41Z","snapshot_observed_at":"2026-08-03T14:25:08.011501Z","submitted_at":"2026-07-30T17:57:41Z","title":"OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-31T02:18:01.622960Z"},"links":{"cited_paper":"/paper/2507.19132","citing_paper":"/paper/2607.28609"},"observation_digest":"sha256:1f0c3ceff0b078b78a9c624318aff26fe54cc9b0ab240ed684ce3cfcf2a64130","observation_id":"1535705b-2d8b-45b2-9893-b62b1256c7c5","resolution":{"observed_at":"2026-07-31T02:18:01.622960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:18:01.629392Z","title":"SeeClick: Harnessing GUI grounding for advanced visual GUI agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28609","last_updated":"2026-07-30T17:57:41Z","snapshot_observed_at":"2026-08-03T14:25:08.011501Z","submitted_at":"2026-07-30T17:57:41Z","title":"OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-31T02:18:01.629392Z"},"links":{"citing_paper":"/paper/2607.28609"},"observation_digest":"sha256:ab0daf950c349a46fa36c9005179a7b8087b07a9445195382250454b4e800e19","observation_id":"d6bb6f28-dd1c-4612-8a17-ab45032375c9","resolution":{"observed_at":"2026-07-31T02:18:01.629392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.15093","last_updated":"2026-04-16T14:53:08Z","snapshot_observed_at":"2026-07-06T23:02:44.990811Z","submitted_at":"2026-04-16T14:53:08Z","title":"OpenMobile: Building Open Mobile Agents with Task and Trajectory Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.15093","snapshot_observed_at":"2026-07-31T02:18:01.634294Z","title":"Openmobile: Building open mobile agents with task and trajectory synthesis.arXiv preprint arXiv:2604.15093, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28609","last_updated":"2026-07-30T17:57:41Z","snapshot_observed_at":"2026-08-03T14:25:08.011501Z","submitted_at":"2026-07-30T17:57:41Z","title":"OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-31T02:18:01.634294Z"},"links":{"cited_paper":"/paper/2604.15093","citing_paper":"/paper/2607.28609"},"observation_digest":"sha256:2a39c2cbcdfa6bddef552300aa4dd790f263f7005d3003e38f64dde6c57dda42","observation_id":"d84f5190-b757-43af-a4f7-56f8cd635c9c","resolution":{"observed_at":"2026-07-31T02:18:01.634294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-04T15:46:25.710484Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-07-31T02:18:01.639292Z","title":"Training verifiers to solve math word problems, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.28609","last_updated":"2026-07-30T17:57:41Z","snapshot_observed_at":"2026-08-03T14:25:08.011501Z","submitted_at":"2026-07-30T17:57:41Z","title":"OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-31T02:18:01.639292Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2607.28609"},"observation_digest":"sha256:39c1abf1f7660d6a6c04040ada5ee4b53f531dbebe620fe5d558a5e2e1930653","observation_id":"dadbfdf6-b7d9-4902-81d8-6210156fcf77","resolution":{"observed_at":"2026-07-31T02:18:01.639292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:18:01.643927Z","title":"A coefficient of agreement for nominal scales.Educational and Psychological Measure- ment, 20(1):37–46, 1960","venue":null,"work_id":null,"year":1960},"citing_paper":{"arxiv_id":"2607.28609","last_updated":"2026-07-30T17:57:41Z","snapshot_observed_at":"2026-08-03T14:25:08.011501Z","submitted_at":"2026-07-30T17:57:41Z","title":"OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-31T02:18:01.643927Z"},"links":{"citing_paper":"/paper/2607.28609"},"observation_digest":"sha256:a8d643804a32ef0dcaeb39a74f4dfd7cc2cdadb6c1c5dbaaaf803935b56c3aff","observation_id":"a180f979-82fa-42f8-84fa-d9bdc7fbafaa","resolution":{"observed_at":"2026-07-31T02:18:01.643927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-07-31T02:18:01.649199Z","title":"Gemini 2.5: Pushing the frontier with advanced reasoning, multimodality, long context, and next generation agentic capabilities","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28609","last_updated":"2026-07-30T17:57:41Z","snapshot_observed_at":"2026-08-03T14:25:08.011501Z","submitted_at":"2026-07-30T17:57:41Z","title":"OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-31T02:18:01.649199Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2607.28609"},"observation_digest":"sha256:32b802ea4077c47121948ce3c8a6c6aa80818bc3a09b441fb89ac62fdeb36e4d","observation_id":"39f6ae8c-87b7-4b0c-b087-26f7ba5d86ba","resolution":{"observed_at":"2026-07-31T02:18:01.649199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:18:01.654732Z","title":"Gemini 3 pro model card, November 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28609","last_updated":"2026-07-30T17:57:41Z","snapshot_observed_at":"2026-08-03T14:25:08.011501Z","submitted_at":"2026-07-30T17:57:41Z","title":"OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-31T02:18:01.654732Z"},"links":{"citing_paper":"/paper/2607.28609"},"observation_digest":"sha256:44c51d6c20d6d6a507a33b9465c50bd5905b3c87895069976709307f914cbaab","observation_id":"5df6b5e5-ba55-4476-9855-200a6c82ce69","resolution":{"observed_at":"2026-07-31T02:18:01.654732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:18:01.659486Z","title":"Navigating the digital world as humans do: Universal visual grounding for GUI agents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28609","last_updated":"2026-07-30T17:57:41Z","snapshot_observed_at":"2026-08-03T14:25:08.011501Z","submitted_at":"2026-07-30T17:57:41Z","title":"OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-31T02:18:01.659486Z"},"links":{"citing_paper":"/paper/2607.28609"},"observation_digest":"sha256:3e585cf5bac3b25d4c7a7a2e48435619583bf74fbc160297fe24600c14095b53","observation_id":"c38733fd-ba89-42bd-a48f-2022a4e2693a","resolution":{"observed_at":"2026-07-31T02:18:01.659486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-07-31T02:18:01.664032Z","title":"GPT-4o system card.arXiv preprint arXiv:2410.21276, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28609","last_updated":"2026-07-30T17:57:41Z","snapshot_observed_at":"2026-08-03T14:25:08.011501Z","submitted_at":"2026-07-30T17:57:41Z","title":"OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-31T02:18:01.664032Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2607.28609"},"observation_digest":"sha256:edb6bda8466b0da77e332b61e96fad31850951661608a46e9b6c43687c0625bc","observation_id":"97edba44-382a-4689-83b4-f3ca99232e22","resolution":{"observed_at":"2026-07-31T02:18:01.664032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2025.findings-acl.466","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:21:00.798616Z","title":"AgentStore: Scalable integration of heterogeneous agents as specialized generalist computer assistant","venue":null,"work_id":"16bdc5e7-c873-48d4-88ec-9f5cd840a7e3","year":2025},"citing_paper":{"arxiv_id":"2607.28609","last_updated":"2026-07-30T17:57:41Z","snapshot_observed_at":"2026-08-03T14:25:08.011501Z","submitted_at":"2026-07-30T17:57:41Z","title":"OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-31T02:18:01.668582Z"},"links":{"citing_paper":"/paper/2607.28609"},"observation_digest":"sha256:ce9bdd2dee3e555d9f573f1380b5f4e9261e030827efd137794758c4088eeb90","observation_id":"0def549d-f8df-41a6-a0fc-8b055e01c4cd","resolution":{"observed_at":"2026-07-31T02:21:00.870350Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:18:01.675609Z","title":"TreeCUA: Efficiently scaling GUI automation with tree-structured verifiable evolution","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28609","last_updated":"2026-07-30T17:57:41Z","snapshot_observed_at":"2026-08-03T14:25:08.011501Z","submitted_at":"2026-07-30T17:57:41Z","title":"OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-31T02:18:01.675609Z"},"links":{"citing_paper":"/paper/2607.28609"},"observation_digest":"sha256:10baedff0e16184aae24b939e314e404bbb814a1ef7a1d20bf7849a7cbd171da","observation_id":"0f075693-9c1c-44d6-ad9d-83017b7704c5","resolution":{"observed_at":"2026-07-31T02:18:01.675609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.02276","last_updated":"2026-02-02T16:17:38Z","snapshot_observed_at":"2026-07-06T22:44:09.804048Z","submitted_at":"2026-02-02T16:17:38Z","title":"Kimi K2.5: Visual Agentic Intelligence","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.02276","snapshot_observed_at":"2026-07-31T02:18:01.680543Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28609","last_updated":"2026-07-30T17:57:41Z","snapshot_observed_at":"2026-08-03T14:25:08.011501Z","submitted_at":"2026-07-30T17:57:41Z","title":"OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-31T02:18:01.680543Z"},"links":{"cited_paper":"/paper/2602.02276","citing_paper":"/paper/2607.28609"},"observation_digest":"sha256:8f183757d3086fbf57957d7b2db2df2b31900098159e17dee260173a75901bce","observation_id":"b1c09d96-f1fa-49f5-b354-354ba75bc02d","resolution":{"observed_at":"2026-07-31T02:18:01.680543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:18:01.688571Z","title":"Mobileworld: Benchmarking autonomous mobile agents in agent-user interactive and mcp-augmented environments","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28609","last_updated":"2026-07-30T17:57:41Z","snapshot_observed_at":"2026-08-03T14:25:08.011501Z","submitted_at":"2026-07-30T17:57:41Z","title":"OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-31T02:18:01.688571Z"},"links":{"citing_paper":"/paper/2607.28609"},"observation_digest":"sha256:6937d486a4f7bf368afb55d73d2add366c1b3fd6dfd75514b76dc3beae881cd9","observation_id":"1e795199-04f4-425b-912b-7f58b460ebf8","resolution":{"observed_at":"2026-07-31T02:18:01.688571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:18:01.696580Z","title":"Computing Krippendorff’s alpha-reliability","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2607.28609","last_updated":"2026-07-30T17:57:41Z","snapshot_observed_at":"2026-08-03T14:25:08.011501Z","submitted_at":"2026-07-30T17:57:41Z","title":"OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-31T02:18:01.696580Z"},"links":{"citing_paper":"/paper/2607.28609"},"observation_digest":"sha256:b49d39091bc688a134770c1ba3308f75ef7495c71edbe89dabde4f4e930d0710","observation_id":"6596f939-5842-46d7-92c7-a871d155d462","resolution":{"observed_at":"2026-07-31T02:18:01.696580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:18:01.704054Z","title":"Vl-rewardbench: a challenging benchmark for vision-language generative reward models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28609","last_updated":"2026-07-30T17:57:41Z","snapshot_observed_at":"2026-08-03T14:25:08.011501Z","submitted_at":"2026-07-30T17:57:41Z","title":"OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-31T02:18:01.704054Z"},"links":{"citing_paper":"/paper/2607.28609"},"observation_digest":"sha256:b234b0f854c92953c6e600d23a4a4706848a0a34204ff40b475ff1f448e46ad9","observation_id":"43abe647-55ec-4006-8221-de383503935b","resolution":{"observed_at":"2026-07-31T02:18:01.704054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:18:01.709379Z","title":"Os- themis: A scalable critic framework for generalist gui rewards, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28609","last_updated":"2026-07-30T17:57:41Z","snapshot_observed_at":"2026-08-03T14:25:08.011501Z","submitted_at":"2026-07-30T17:57:41Z","title":"OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-31T02:18:01.709379Z"},"links":{"citing_paper":"/paper/2607.28609"},"observation_digest":"sha256:686863787cdcc90c24baa7623d1c4fa3ab306d6666aa5d8cb28f5ea1761690d9","observation_id":"7ab18965-3338-461f-a5d7-d4fa8b553275","resolution":{"observed_at":"2026-07-31T02:18:01.709379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:18:01.714047Z","title":"Cuarewardbench: A benchmark for evaluating reward models on computer-using agent, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28609","last_updated":"2026-07-30T17:57:41Z","snapshot_observed_at":"2026-08-03T14:25:08.011501Z","submitted_at":"2026-07-30T17:57:41Z","title":"OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-31T02:18:01.714047Z"},"links":{"citing_paper":"/paper/2607.28609"},"observation_digest":"sha256:ed2afa79d4b5a9e41907a0e199914db50d89bf16f3adffa1c1700ef5012a28f7","observation_id":"53522066-f390-47fe-ae4e-86ed83598176","resolution":{"observed_at":"2026-07-31T02:18:01.714047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:18:01.718753Z","title":"ScaleCUA: Scaling open- source computer use agents with cross-platform data","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28609","last_updated":"2026-07-30T17:57:41Z","snapshot_observed_at":"2026-08-03T14:25:08.011501Z","submitted_at":"2026-07-30T17:57:41Z","title":"OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-31T02:18:01.718753Z"},"links":{"citing_paper":"/paper/2607.28609"},"observation_digest":"sha256:4d86790a9c2bac49eff0a07811e9eb7d726752b3e5265145fb7120e44b692c33","observation_id":"bd9d6844-5bc6-4bbc-b48c-a79602639f15","resolution":{"observed_at":"2026-07-31T02:18:01.718753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:18:01.724504Z","title":"Pal, and Siva Reddy","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28609","last_updated":"2026-07-30T17:57:41Z","snapshot_observed_at":"2026-08-03T14:25:08.011501Z","submitted_at":"2026-07-30T17:57:41Z","title":"OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-31T02:18:01.724504Z"},"links":{"citing_paper":"/paper/2607.28609"},"observation_digest":"sha256:3063c51261e5ddfb668cf4097c15c3689b35dbe82d3b02080f6541c5ae19e572","observation_id":"9ef05bf4-ca94-4e20-a70c-5f39c166c972","resolution":{"observed_at":"2026-07-31T02:18:01.724504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:18:01.729104Z","title":"Computer-using agent: Introducing a universal interface for ai to interact with the digital world, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28609","last_updated":"2026-07-30T17:57:41Z","snapshot_observed_at":"2026-08-03T14:25:08.011501Z","submitted_at":"2026-07-30T17:57:41Z","title":"OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-31T02:18:01.729104Z"},"links":{"citing_paper":"/paper/2607.28609"},"observation_digest":"sha256:76fa285da6463ad58fbf18e8d590b810c1540a7d48327c17bd12a58b44e234ba","observation_id":"a0eddbdf-16e5-4e1d-8023-0e22724882a0","resolution":{"observed_at":"2026-07-31T02:18:01.729104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:18:01.735104Z","title":"GPT-5 System Card","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28609","last_updated":"2026-07-30T17:57:41Z","snapshot_observed_at":"2026-08-03T14:25:08.011501Z","submitted_at":"2026-07-30T17:57:41Z","title":"OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-31T02:18:01.735104Z"},"links":{"citing_paper":"/paper/2607.28609"},"observation_digest":"sha256:3ee23d1d9176009cdac52c58ac00079bc3744edff5c6b7d37a6887d942614df1","observation_id":"7ca4923f-a0f6-4b92-9b04-969e31d5c3b3","resolution":{"observed_at":"2026-07-31T02:18:01.735104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:18:01.739977Z","title":"GPT-5.4 Thinking System Card","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28609","last_updated":"2026-07-30T17:57:41Z","snapshot_observed_at":"2026-08-03T14:25:08.011501Z","submitted_at":"2026-07-30T17:57:41Z","title":"OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-31T02:18:01.739977Z"},"links":{"citing_paper":"/paper/2607.28609"},"observation_digest":"sha256:ea4ec7394e996b4d0978b33a21c633757f2f6d7545e38e050245c927b373301a","observation_id":"2268efc2-f51c-4442-a390-d4966aabe0ef","resolution":{"observed_at":"2026-07-31T02:18:01.739977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:18:01.751636Z","title":"GPT-5.5 System Card","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28609","last_updated":"2026-07-30T17:57:41Z","snapshot_observed_at":"2026-08-03T14:25:08.011501Z","submitted_at":"2026-07-30T17:57:41Z","title":"OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-31T02:18:01.751636Z"},"links":{"citing_paper":"/paper/2607.28609"},"observation_digest":"sha256:2e90294e31d8955ecf6c6c2213f15e757734b943a3fc38a41a262db00a083962","observation_id":"72f5b3c5-cd05-45d9-b64f-3750870cbec4","resolution":{"observed_at":"2026-07-31T02:18:01.751636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:18:01.756864Z","title":"Autonomous evaluation and refinement of digital agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28609","last_updated":"2026-07-30T17:57:41Z","snapshot_observed_at":"2026-08-03T14:25:08.011501Z","submitted_at":"2026-07-30T17:57:41Z","title":"OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-31T02:18:01.756864Z"},"links":{"citing_paper":"/paper/2607.28609"},"observation_digest":"sha256:598adf8989a979c179459daf2c9363bfe7a5f4adcdd732fda7ee1e91f753abbc","observation_id":"54a84a0f-6312-4ffb-9af5-d3af6d168d01","resolution":{"observed_at":"2026-07-31T02:18:01.756864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02337","last_updated":"2025-01-27T11:56:15Z","snapshot_observed_at":"2026-07-06T19:45:00.034364Z","submitted_at":"2024-11-04T17:59:58Z","title":"WebRL: Training LLM Web Agents via Self-Evolving Online Curriculum Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02337","snapshot_observed_at":"2026-07-31T02:18:01.764481Z","title":"Webrl: Training llm web agents via self-evolving online curriculum reinforcement learning, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28609","last_updated":"2026-07-30T17:57:41Z","snapshot_observed_at":"2026-08-03T14:25:08.011501Z","submitted_at":"2026-07-30T17:57:41Z","title":"OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-31T02:18:01.764481Z"},"links":{"cited_paper":"/paper/2411.02337","citing_paper":"/paper/2607.28609"},"observation_digest":"sha256:069a57cc612da9eedf56b1e59ffaba174b9a484c75ee9d42575a3413bd390dde","observation_id":"258eb65e-660f-489a-ac9d-68331475c65b","resolution":{"observed_at":"2026-07-31T02:18:01.764481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12326","last_updated":"2025-01-21T17:48:10Z","snapshot_observed_at":"2026-07-06T20:23:58.426780Z","submitted_at":"2025-01-21T17:48:10Z","title":"UI-TARS: Pioneering Automated GUI Interaction with Native Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12326","snapshot_observed_at":"2026-07-31T02:18:01.769432Z","title":"Ui-tars: Pioneering automated gui interaction with native agents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28609","last_updated":"2026-07-30T17:57:41Z","snapshot_observed_at":"2026-08-03T14:25:08.011501Z","submitted_at":"2026-07-30T17:57:41Z","title":"OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-31T02:18:01.769432Z"},"links":{"cited_paper":"/paper/2501.12326","citing_paper":"/paper/2607.28609"},"observation_digest":"sha256:8ca0dba3541e777b94bb93f7eedea236cac59485d2816df64e78f49f2671c82d","observation_id":"4b9082c2-ae6b-46b9-ba30-b77e8c7cc08a","resolution":{"observed_at":"2026-07-31T02:18:01.769432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:18:01.775221Z","title":"Qwen3.5: Towards native multimodal agents, February 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28609","last_updated":"2026-07-30T17:57:41Z","snapshot_observed_at":"2026-08-03T14:25:08.011501Z","submitted_at":"2026-07-30T17:57:41Z","title":"OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-31T02:18:01.775221Z"},"links":{"citing_paper":"/paper/2607.28609"},"observation_digest":"sha256:8433e0ee5530c64d19e5e5a9d47116dd92b76e6ad58e3c0041a8143ea4973ddb","observation_id":"7c6c2432-e0fc-4ff6-a181-a8c2e7672d75","resolution":{"observed_at":"2026-07-31T02:18:01.775221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:18:01.782849Z","title":"Androidworld: A dynamic benchmarking environment for autonomous agents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28609","last_updated":"2026-07-30T17:57:41Z","snapshot_observed_at":"2026-08-03T14:25:08.011501Z","submitted_at":"2026-07-30T17:57:41Z","title":"OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-31T02:18:01.782849Z"},"links":{"citing_paper":"/paper/2607.28609"},"observation_digest":"sha256:dd2e61e486475048d2b52695cf6803e0239509d0627c0398e61d3f908a16afa6","observation_id":"06082ed4-d196-45e0-baa1-d74569d6ecf8","resolution":{"observed_at":"2026-07-31T02:18:01.782849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-07-31T02:18:01.789891Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28609","last_updated":"2026-07-30T17:57:41Z","snapshot_observed_at":"2026-08-03T14:25:08.011501Z","submitted_at":"2026-07-30T17:57:41Z","title":"OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-31T02:18:01.789891Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.28609"},"observation_digest":"sha256:89932946d75d93035635789ef3c645f64002e2ffb9ca39a424ccf8ffde6755e6","observation_id":"23e7573e-c538-4c57-bb3e-ec4926b5fa4c","resolution":{"observed_at":"2026-07-31T02:18:01.789891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-07-31T02:18:01.794382Z","title":"Hybridflow: A flexible and efficient RLHF framework.arXiv preprint arXiv:2409.19256, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28609","last_updated":"2026-07-30T17:57:41Z","snapshot_observed_at":"2026-08-03T14:25:08.011501Z","submitted_at":"2026-07-30T17:57:41Z","title":"OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-31T02:18:01.794382Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2607.28609"},"observation_digest":"sha256:a4207d275de80b9f7d694a3b1223f414776dc1780d207a1995ed80b3f6ed38d5","observation_id":"3bbdcff4-df2c-4b7b-ae41-c080f3c3758d","resolution":{"observed_at":"2026-07-31T02:18:01.794382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14734","last_updated":"2025-01-26T10:48:44Z","snapshot_observed_at":"2026-07-06T17:48:41.389936Z","submitted_at":"2024-03-21T08:54:56Z","title":"A Survey of Neural Code Intelligence: Paradigms, Advances and Beyond","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14734","snapshot_observed_at":"2026-07-31T02:18:01.800198Z","title":"A survey of neural code intelligence: Paradigms, advances and beyond.arXiv preprint arXiv:2403.14734, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28609","last_updated":"2026-07-30T17:57:41Z","snapshot_observed_at":"2026-08-03T14:25:08.011501Z","submitted_at":"2026-07-30T17:57:41Z","title":"OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-31T02:18:01.800198Z"},"links":{"cited_paper":"/paper/2403.14734","citing_paper":"/paper/2607.28609"},"observation_digest":"sha256:3518f19d6a33964184c8b3aa88c7e8d8062117473bdfa14508c4a95b5bb5b9b3","observation_id":"5056fae7-ba0e-470f-af70-e3c0863311c1","resolution":{"observed_at":"2026-07-31T02:18:01.800198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:18:01.804558Z","title":"Os-genesis: Automating gui agent trajectory construction via reverse task synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28609","last_updated":"2026-07-30T17:57:41Z","snapshot_observed_at":"2026-08-03T14:25:08.011501Z","submitted_at":"2026-07-30T17:57:41Z","title":"OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-31T02:18:01.804558Z"},"links":{"citing_paper":"/paper/2607.28609"},"observation_digest":"sha256:64dfc8a23ed96e1e5b0f014fa2e0a7ba5f8b2e3f4e95801356aa88f36d3c9c06","observation_id":"52a0cabb-29e5-48f3-a5db-b731a8d93ff4","resolution":{"observed_at":"2026-07-31T02:18:01.804558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:18:01.809067Z","title":"OS- sentinel: Towards safety-enhanced mobile GUI agents via hybrid validation in realistic workflows","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28609","last_updated":"2026-07-30T17:57:41Z","snapshot_observed_at":"2026-08-03T14:25:08.011501Z","submitted_at":"2026-07-30T17:57:41Z","title":"OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-31T02:18:01.809067Z"},"links":{"citing_paper":"/paper/2607.28609"},"observation_digest":"sha256:94986f8ed7b4424935d0c227e729d0875ee96249f35a29049120e7f9e889b2b1","observation_id":"c256251f-d902-424e-9f2f-a7ba998c57f7","resolution":{"observed_at":"2026-07-31T02:18:01.809067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:18:01.813520Z","title":"Scienceboard: Evaluating multimodal autonomous agents in realistic scientific workflows","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28609","last_updated":"2026-07-30T17:57:41Z","snapshot_observed_at":"2026-08-03T14:25:08.011501Z","submitted_at":"2026-07-30T17:57:41Z","title":"OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-31T02:18:01.813520Z"},"links":{"citing_paper":"/paper/2607.28609"},"observation_digest":"sha256:3d0cb0e7e8241918dac326dc8f7e0b425d43eed6c9491bc80099721eedc0e2b3","observation_id":"0cf55a1f-3454-4825-a8d3-cdb34e56c5a0","resolution":{"observed_at":"2026-07-31T02:18:01.813520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.20096","last_updated":"2025-08-27T17:59:50Z","snapshot_observed_at":"2026-07-06T22:19:38.462418Z","submitted_at":"2025-08-27T17:59:50Z","title":"CODA: Coordinating the Cerebrum and Cerebellum for a Dual-Brain Computer Use Agent with Decoupled Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.20096","snapshot_observed_at":"2026-07-31T02:18:01.817666Z","title":"Coda: Coordinating the cerebrum and cerebellum for a dual- brain computer use agent with decoupled reinforcement learning.arXiv preprint arXiv:2508.20096, 2025b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28609","last_updated":"2026-07-30T17:57:41Z","snapshot_observed_at":"2026-08-03T14:25:08.011501Z","submitted_at":"2026-07-30T17:57:41Z","title":"OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-31T02:18:01.817666Z"},"links":{"cited_paper":"/paper/2508.20096","citing_paper":"/paper/2607.28609"},"observation_digest":"sha256:9297742c50b9ccdb97161a92b782faf5151f41f97a87fb25da3e4bb8d117ba15","observation_id":"9d79eac9-d5b5-4c6e-bdd7-ca9363ed2204","resolution":{"observed_at":"2026-07-31T02:18:01.817666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06776","last_updated":"2025-05-22T17:59:11Z","snapshot_observed_at":"2026-07-06T20:34:11.407726Z","submitted_at":"2025-02-10T18:54:05Z","title":"InSTA: Towards Internet-Scale Training For Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06776","snapshot_observed_at":"2026-07-31T02:18:01.822251Z","title":"InSTA: Towards internet-scale training for agents.arXiv preprint arXiv:2502.06776, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28609","last_updated":"2026-07-30T17:57:41Z","snapshot_observed_at":"2026-08-03T14:25:08.011501Z","submitted_at":"2026-07-30T17:57:41Z","title":"OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-31T02:18:01.822251Z"},"links":{"cited_paper":"/paper/2502.06776","citing_paper":"/paper/2607.28609"},"observation_digest":"sha256:718d47ddf62a228588980f5e37292363bbd600acc2929217a5caa8c062cbbfd8","observation_id":"ae9c1a53-c75c-4d84-82f0-0a7ebaf1b595","resolution":{"observed_at":"2026-07-31T02:18:01.822251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:18:01.826853Z","title":"Math-shepherd: Verify and reinforce LLMs step-by-step without human annotations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28609","last_updated":"2026-07-30T17:57:41Z","snapshot_observed_at":"2026-08-03T14:25:08.011501Z","submitted_at":"2026-07-30T17:57:41Z","title":"OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-31T02:18:01.826853Z"},"links":{"citing_paper":"/paper/2607.28609"},"observation_digest":"sha256:c264bff4bf0df6d95c1c9f1bddbb8f0640afde3fdc716c2f73c758b0e974fa27","observation_id":"a344d516-3ad7-478a-9ec2-ba53f7da9601","resolution":{"observed_at":"2026-07-31T02:18:01.826853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:18:01.831507Z","title":"Charles, Zhilin Yang, and Tao Yu","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28609","last_updated":"2026-07-30T17:57:41Z","snapshot_observed_at":"2026-08-03T14:25:08.011501Z","submitted_at":"2026-07-30T17:57:41Z","title":"OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-31T02:18:01.831507Z"},"links":{"citing_paper":"/paper/2607.28609"},"observation_digest":"sha256:ffcd62e38e8961bff2cffb310c7481677b092171ab2e1f0cf206a0c54b80e085","observation_id":"382433c4-c952-4f06-8636-369b4aa22cf1","resolution":{"observed_at":"2026-07-31T02:18:01.831507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:18:01.836647Z","title":"SynthAgent: Adapting web agents with synthetic supervision","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28609","last_updated":"2026-07-30T17:57:41Z","snapshot_observed_at":"2026-08-03T14:25:08.011501Z","submitted_at":"2026-07-30T17:57:41Z","title":"OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-31T02:18:01.836647Z"},"links":{"citing_paper":"/paper/2607.28609"},"observation_digest":"sha256:938fdc4d154ba7f7bcb3281b2ef5fa749644bb99a39867589dc9a2ec5f38c250","observation_id":"8ba75244-b467-48c5-a019-eb17f4854ad6","resolution":{"observed_at":"2026-07-31T02:18:01.836647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03143","last_updated":"2025-06-03T17:59:08Z","snapshot_observed_at":"2026-08-01T17:23:14.885858Z","submitted_at":"2025-06-03T17:59:08Z","title":"GUI-Actor: Coordinate-Free Visual Grounding for GUI Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03143","snapshot_observed_at":"2026-07-31T02:18:01.841745Z","title":"Gui-actor: Coordinate-free visual grounding for gui agents","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28609","last_updated":"2026-07-30T17:57:41Z","snapshot_observed_at":"2026-08-03T14:25:08.011501Z","submitted_at":"2026-07-30T17:57:41Z","title":"OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-31T02:18:01.841745Z"},"links":{"cited_paper":"/paper/2506.03143","citing_paper":"/paper/2607.28609"},"observation_digest":"sha256:b1c1f675680af0b9844c453fffa48ae8a32625223683e90240c6e6a72267be4a","observation_id":"2fb1c925-27ce-4cfa-9784-d2c3c57326e4","resolution":{"observed_at":"2026-07-31T02:18:01.841745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:18:01.846403Z","title":"Os-oracle: A comprehensive framework for cross-platform gui critic models","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28609","last_updated":"2026-07-30T17:57:41Z","snapshot_observed_at":"2026-08-03T14:25:08.011501Z","submitted_at":"2026-07-30T17:57:41Z","title":"OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-31T02:18:01.846403Z"},"links":{"citing_paper":"/paper/2607.28609"},"observation_digest":"sha256:049b6b041d57b455f39dabb008e5f20fd6082ccb6b7b6bb89607d3543d793618","observation_id":"8de53c12-3cf2-4433-8b59-ddcb3b99b2f6","resolution":{"observed_at":"2026-07-31T02:18:01.846403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:18:01.851384Z","title":"Os-copilot: Towards generalist computer agents with self-improvement,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28609","last_updated":"2026-07-30T17:57:41Z","snapshot_observed_at":"2026-08-03T14:25:08.011501Z","submitted_at":"2026-07-30T17:57:41Z","title":"OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-31T02:18:01.851384Z"},"links":{"citing_paper":"/paper/2607.28609"},"observation_digest":"sha256:65f29fdfba7ee3faefbc9a3296cdadfa046ba65be23edba3c099ecaa81957339","observation_id":"e325db33-46bf-447a-8482-e35b1fd0b48e","resolution":{"observed_at":"2026-07-31T02:18:01.851384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:18:01.862476Z","title":"OS-ATLAS: Foundation action model for generalist GUI agents","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28609","last_updated":"2026-07-30T17:57:41Z","snapshot_observed_at":"2026-08-03T14:25:08.011501Z","submitted_at":"2026-07-30T17:57:41Z","title":"OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-31T02:18:01.862476Z"},"links":{"citing_paper":"/paper/2607.28609"},"observation_digest":"sha256:b3a0ca7c26ee4b8550e8cc7c4c66535ca6e6b15abac7b6c2f1522bb28ad7c3dc","observation_id":"53fbdd16-afea-40f8-9d1b-451ea7e1672b","resolution":{"observed_at":"2026-07-31T02:18:01.862476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:18:01.868149Z","title":"UI- genie: A self-improving approach for iteratively boosting MLLM-based mobile GUI agents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28609","last_updated":"2026-07-30T17:57:41Z","snapshot_observed_at":"2026-08-03T14:25:08.011501Z","submitted_at":"2026-07-30T17:57:41Z","title":"OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-31T02:18:01.868149Z"},"links":{"citing_paper":"/paper/2607.28609"},"observation_digest":"sha256:e547780687764dbe6851026f8a54fd82c96a6d5c7be987456d9f2033e3b4edd6","observation_id":"7c64305a-28dd-4fa5-a81f-0a21ec06e366","resolution":{"observed_at":"2026-07-31T02:18:01.868149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:18:01.874190Z","title":"OSWorld: Benchmarking multimodal agents for open-ended tasks in real computer environments","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28609","last_updated":"2026-07-30T17:57:41Z","snapshot_observed_at":"2026-08-03T14:25:08.011501Z","submitted_at":"2026-07-30T17:57:41Z","title":"OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-31T02:18:01.874190Z"},"links":{"citing_paper":"/paper/2607.28609"},"observation_digest":"sha256:ba6edf62999a7bc4fe04eebe7f115c435a8f0ec0d2321d6d0b42a3849c56e832","observation_id":"f54037f1-612c-44b4-a6d2-6a4e82dda62e","resolution":{"observed_at":"2026-07-31T02:18:01.874190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:18:01.880834Z","title":"Introducing osworld-verified.xlang.ai, July 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28609","last_updated":"2026-07-30T17:57:41Z","snapshot_observed_at":"2026-08-03T14:25:08.011501Z","submitted_at":"2026-07-30T17:57:41Z","title":"OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-31T02:18:01.880834Z"},"links":{"citing_paper":"/paper/2607.28609"},"observation_digest":"sha256:d9f4b16b6930e862315443717dffbfd20016082353cb72c7ba3b89ea25725c42","observation_id":"5ef1ba9d-0674-405a-8456-d7756185cea0","resolution":{"observed_at":"2026-07-31T02:18:01.880834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.05843","last_updated":"2026-06-04T17:59:52Z","snapshot_observed_at":"2026-08-03T04:08:05.711718Z","submitted_at":"2026-02-05T16:31:43Z","title":"OdysseyArena: Benchmarking Large Language Models For Long-Horizon, Active and Inductive Interactions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.05843","snapshot_observed_at":"2026-07-31T02:18:01.888233Z","title":"Odysseyarena: Benchmarking large language models for long-horizon, active and inductive interactions.arXiv preprint arXiv:2602.05843, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28609","last_updated":"2026-07-30T17:57:41Z","snapshot_observed_at":"2026-08-03T14:25:08.011501Z","submitted_at":"2026-07-30T17:57:41Z","title":"OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-31T02:18:01.888233Z"},"links":{"cited_paper":"/paper/2602.05843","citing_paper":"/paper/2607.28609"},"observation_digest":"sha256:7dc0f0ab6be964d70fd2c7e0a98ed813edce172195f44643ff460417d5cbb710","observation_id":"e53c8bbd-d6b2-4c87-a4c7-57212f0f7113","resolution":{"observed_at":"2026-07-31T02:18:01.888233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:18:01.893840Z","title":"Agenttrek: Agenttrajectorysynthesisviaguidingreplaywithwebtutorials","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28609","last_updated":"2026-07-30T17:57:41Z","snapshot_observed_at":"2026-08-03T14:25:08.011501Z","submitted_at":"2026-07-30T17:57:41Z","title":"OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-31T02:18:01.893840Z"},"links":{"citing_paper":"/paper/2607.28609"},"observation_digest":"sha256:063e00b028e818e6232545ce23f96b2ea06ec7c450555b3b462624d14c7c6132","observation_id":"ebdfee6d-fda7-4ea4-812a-5e48bfefec8e","resolution":{"observed_at":"2026-07-31T02:18:01.893840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:18:01.899968Z","title":"Aguvis: Unified pure vision agents for autonomous GUI interaction","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28609","last_updated":"2026-07-30T17:57:41Z","snapshot_observed_at":"2026-08-03T14:25:08.011501Z","submitted_at":"2026-07-30T17:57:41Z","title":"OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-31T02:18:01.899968Z"},"links":{"citing_paper":"/paper/2607.28609"},"observation_digest":"sha256:b85e808b763ebf38ada4903b033328992cd8a10b68275e33385010419bac1e5e","observation_id":"7b6bec37-da01-43a7-8c67-8644bae97af3","resolution":{"observed_at":"2026-07-31T02:18:01.899968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:18:01.905245Z","title":"EvoCUA: Evolving computer use agents via learning from scalable synthetic experience","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28609","last_updated":"2026-07-30T17:57:41Z","snapshot_observed_at":"2026-08-03T14:25:08.011501Z","submitted_at":"2026-07-30T17:57:41Z","title":"OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-31T02:18:01.905245Z"},"links":{"citing_paper":"/paper/2607.28609"},"observation_digest":"sha256:67640bfc2356e82d4d63eaf321ccf72f91ce8d03c47f72d59abe5994b2d4aadd","observation_id":"dfbe6fd2-2ad7-4bc1-827e-b61fd9eaff40","resolution":{"observed_at":"2026-07-31T02:18:01.905245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:18:01.909883Z","title":"An illusion of progress? assessing the current state of web agents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28609","last_updated":"2026-07-30T17:57:41Z","snapshot_observed_at":"2026-08-03T14:25:08.011501Z","submitted_at":"2026-07-30T17:57:41Z","title":"OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-31T02:18:01.909883Z"},"links":{"citing_paper":"/paper/2607.28609"},"observation_digest":"sha256:6359adaf3c12b36ea9a4aa623011191a00e10330e311d47d6eac6eef2ae034c9","observation_id":"45fd7341-0114-40c8-9992-91d3a5d21d60","resolution":{"observed_at":"2026-07-31T02:18:01.909883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.10356","last_updated":"2026-05-11T00:11:46Z","snapshot_observed_at":"2026-07-06T22:45:25.047172Z","submitted_at":"2026-02-10T23:06:02Z","title":"Autonomous Continual Learning for Environment Adaptation of Computer-Use Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.10356","snapshot_observed_at":"2026-07-31T02:18:01.915161Z","title":"Autonomous continual learning for environment adaptation of computer-use agents, 2026b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28609","last_updated":"2026-07-30T17:57:41Z","snapshot_observed_at":"2026-08-03T14:25:08.011501Z","submitted_at":"2026-07-30T17:57:41Z","title":"OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-07-31T02:18:01.915161Z"},"links":{"cited_paper":"/paper/2602.10356","citing_paper":"/paper/2607.28609"},"observation_digest":"sha256:efe1e1cb662024f26a57c1cc013811de1ea197a9571cc65d22e1abda87ec75d5","observation_id":"1c59e694-eefd-46d3-856c-637e8e3fa841","resolution":{"observed_at":"2026-07-31T02:18:01.915161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:18:01.920231Z","title":"OS-symphony: A holistic framework for robust and generalist computer-using agents","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28609","last_updated":"2026-07-30T17:57:41Z","snapshot_observed_at":"2026-08-03T14:25:08.011501Z","submitted_at":"2026-07-30T17:57:41Z","title":"OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-07-31T02:18:01.920231Z"},"links":{"citing_paper":"/paper/2607.28609"},"observation_digest":"sha256:9fb3cc4c8b9c3f9cd10c08dec62776d921e3889c965ad04b1a1837bfc73ea676","observation_id":"515506ea-fced-47ac-8251-51fcb02a2fad","resolution":{"observed_at":"2026-07-31T02:18:01.920231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11441","last_updated":"2023-11-06T07:39:49Z","snapshot_observed_at":"2026-08-04T03:29:49.409446Z","submitted_at":"2023-10-17T17:51:31Z","title":"Set-of-Mark Prompting Unleashes Extraordinary Visual Grounding in GPT-4V","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11441","snapshot_observed_at":"2026-07-31T02:18:01.925929Z","title":"Set-of-mark prompting unleashes extraordinary visual grounding in gpt-4v.arXiv preprint arXiv:2310.11441, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28609","last_updated":"2026-07-30T17:57:41Z","snapshot_observed_at":"2026-08-03T14:25:08.011501Z","submitted_at":"2026-07-30T17:57:41Z","title":"OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-07-31T02:18:01.925929Z"},"links":{"cited_paper":"/paper/2310.11441","citing_paper":"/paper/2607.28609"},"observation_digest":"sha256:0ab59c4ae231747d583078495f2f54c25e22ee887389f863474e121ef3f7f435","observation_id":"59b4aa22-7ead-4508-a002-6c176b145308","resolution":{"observed_at":"2026-07-31T02:18:01.925929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:18:01.931168Z","title":"Breaking the data barrier – building GUI agents through task generalization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28609","last_updated":"2026-07-30T17:57:41Z","snapshot_observed_at":"2026-08-03T14:25:08.011501Z","submitted_at":"2026-07-30T17:57:41Z","title":"OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-07-31T02:18:01.931168Z"},"links":{"citing_paper":"/paper/2607.28609"},"observation_digest":"sha256:0d8d1324832e8ac51a20c2dd8dc5e11d6d9ec90d2209826381dc978826d95caf","observation_id":"60050239-3626-401e-8617-c643f1b35367","resolution":{"observed_at":"2026-07-31T02:18:01.931168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:18:01.935775Z","title":"Agent learning via early experience","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28609","last_updated":"2026-07-30T17:57:41Z","snapshot_observed_at":"2026-08-03T14:25:08.011501Z","submitted_at":"2026-07-30T17:57:41Z","title":"OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-07-31T02:18:01.935775Z"},"links":{"citing_paper":"/paper/2607.28609"},"observation_digest":"sha256:01e7d07e8b568483f626dde9e23bcdf5bc8775cefd7c0f3042c4c00ccbb6bf42","observation_id":"722de82b-810a-4df9-ae7b-196d301cc430","resolution":{"observed_at":"2026-07-31T02:18:01.935775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:18:01.940319Z","title":"Gpt-4v(ision) is a generalist web agent, if grounded","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28609","last_updated":"2026-07-30T17:57:41Z","snapshot_observed_at":"2026-08-03T14:25:08.011501Z","submitted_at":"2026-07-30T17:57:41Z","title":"OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-07-31T02:18:01.940319Z"},"links":{"citing_paper":"/paper/2607.28609"},"observation_digest":"sha256:99173adec93aadb9c0402bff31f68e895208011386d100e7602e299eeedaf6f9","observation_id":"9a6c3e94-d649-4be3-9a8d-dfd27e49b1f1","resolution":{"observed_at":"2026-07-31T02:18:01.940319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:18:01.944619Z","title":"Xing, Hao Zhang, Joseph E","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28609","last_updated":"2026-07-30T17:57:41Z","snapshot_observed_at":"2026-08-03T14:25:08.011501Z","submitted_at":"2026-07-30T17:57:41Z","title":"OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-07-31T02:18:01.944619Z"},"links":{"citing_paper":"/paper/2607.28609"},"observation_digest":"sha256:995c816af8a1281ec9ec83b3584203e2153ae246f023a6f9392646c9836c95e4","observation_id":"6d9cf97e-1a11-4e3e-9660-34cabeac9e2b","resolution":{"observed_at":"2026-07-31T02:18:01.944619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-07-31T02:18:01.949050Z","title":"Gonzalez, Clark Barrett, and Ying Sheng","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28609","last_updated":"2026-07-30T17:57:41Z","snapshot_observed_at":"2026-08-03T14:25:08.011501Z","submitted_at":"2026-07-30T17:57:41Z","title":"OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-07-31T02:18:01.949050Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2607.28609"},"observation_digest":"sha256:fbfdd64d335192644a95ece0ec56cafceb1a57c93f97087dddcaf760279a58f3","observation_id":"5d8ce686-afd0-4d44-91a6-837c3db0be87","resolution":{"observed_at":"2026-07-31T02:18:01.949050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:18:01.953939Z","title":"RMB: Comprehensively benchmarking reward models in LLM alignment","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28609","last_updated":"2026-07-30T17:57:41Z","snapshot_observed_at":"2026-08-03T14:25:08.011501Z","submitted_at":"2026-07-30T17:57:41Z","title":"OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-07-31T02:18:01.953939Z"},"links":{"citing_paper":"/paper/2607.28609"},"observation_digest":"sha256:5d586a5bcf34705478b4bc44fc9a41bfa9c91478e467cf2c1e17393a6ccff870","observation_id":"4334b6a6-f6ac-45bf-b3c8-71cd76f6f721","resolution":{"observed_at":"2026-07-31T02:18:01.953939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:18:01.958291Z","title":"Xu, Hao Zhu, Xuhui Zhou, Robert Lo, Abishek Sridhar, Xianyi Cheng, Tianyue Ou, Yonatan Bisk, Daniel Fried, Uri Alon, and Graham Neubig","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28609","last_updated":"2026-07-30T17:57:41Z","snapshot_observed_at":"2026-08-03T14:25:08.011501Z","submitted_at":"2026-07-30T17:57:41Z","title":"OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-07-31T02:18:01.958291Z"},"links":{"citing_paper":"/paper/2607.28609"},"observation_digest":"sha256:0eb9671a86e9b13776d424b4d925e54975d7e7f53a38082376fb8aea85e0a833","observation_id":"870583bd-5863-476d-b880-c2ca9d5b31e6","resolution":{"observed_at":"2026-07-31T02:18:01.958291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:18:01.962720Z","title":"Ashley, Wenyi Wang, Dmitrii Khizbullin, Yunyang Xiong, Zechun Liu, Ernie Chang, Raghuraman Krishnamoorthi, Yuandong Tian, Yangyang Shi, Vikas Chandra, and Jürgen Schmidhuber","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28609","last_updated":"2026-07-30T17:57:41Z","snapshot_observed_at":"2026-08-03T14:25:08.011501Z","submitted_at":"2026-07-30T17:57:41Z","title":"OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-07-31T02:18:01.962720Z"},"links":{"citing_paper":"/paper/2607.28609"},"observation_digest":"sha256:d90dc1cc49ab5da673070fe797631ea6b49f39a1c4dc0e7a80f28dffeda84e88","observation_id":"3b2cee03-64b1-4456-af73-6f29faa3c7a3","resolution":{"observed_at":"2026-07-31T02:18:01.962720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:18:01.967005Z","title":"Intern-s1-pro: Scientific multimodal foundation model at trillion scale.arXiv preprint arXiv:2603.25040, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28609","last_updated":"2026-07-30T17:57:41Z","snapshot_observed_at":"2026-08-03T14:25:08.011501Z","submitted_at":"2026-07-30T17:57:41Z","title":"OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-07-31T02:18:01.967005Z"},"links":{"citing_paper":"/paper/2607.28609"},"observation_digest":"sha256:3b75ae312be527b53bccc0cf6ef35af35cbbaa9944e208cf34f65c9fd2ad627f","observation_id":"76ee57d2-1d50-41cd-a2d2-cd65237e00a6","resolution":{"observed_at":"2026-07-31T02:18:01.967005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:18:01.973135Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28609","last_updated":"2026-07-30T17:57:41Z","snapshot_observed_at":"2026-08-03T14:25:08.011501Z","submitted_at":"2026-07-30T17:57:41Z","title":"OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-07-31T02:18:01.973135Z"},"links":{"citing_paper":"/paper/2607.28609"},"observation_digest":"sha256:137a91a4c9d98f4d8f03a5dcfcff1284ea78b3ec2f7c8988cf3b969e7e7bb98a","observation_id":"ac6c3393-3e62-4f2a-bd6f-798aabcc1911","resolution":{"observed_at":"2026-07-31T02:18:01.973135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:18:01.977691Z","title":"For click-like actions, the action point may be highlighted with a red circle on the screenshot","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28609","last_updated":"2026-07-30T17:57:41Z","snapshot_observed_at":"2026-08-03T14:25:08.011501Z","submitted_at":"2026-07-30T17:57:41Z","title":"OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-07-31T02:18:01.977691Z"},"links":{"citing_paper":"/paper/2607.28609"},"observation_digest":"sha256:b6781606c487ed44c35e463e59aa45f3cc7be71d2cd29ece911ceba0596e8f43","observation_id":"7c080dcb-e7c2-427f-b0a8-fce226eade0a","resolution":{"observed_at":"2026-07-31T02:18:01.977691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:18:01.982279Z","title":"[EVALUATION GOAL] Your task is to synthesize all the evidence above and determine whether the agent reasonably completed the task according to the user’s instruction","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28609","last_updated":"2026-07-30T17:57:41Z","snapshot_observed_at":"2026-08-03T14:25:08.011501Z","submitted_at":"2026-07-30T17:57:41Z","title":"OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-07-31T02:18:01.982279Z"},"links":{"citing_paper":"/paper/2607.28609"},"observation_digest":"sha256:3c22646ca048b77c1220daab1fd550bdaeecdf7b3459c76a3fb0ddce059072f6","observation_id":"170dc844-e7e2-4626-b93b-1481eddf78b9","resolution":{"observed_at":"2026-07-31T02:18:01.982279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:18:01.986907Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28609","last_updated":"2026-07-30T17:57:41Z","snapshot_observed_at":"2026-08-03T14:25:08.011501Z","submitted_at":"2026-07-30T17:57:41Z","title":"OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-07-31T02:18:01.986907Z"},"links":{"citing_paper":"/paper/2607.28609"},"observation_digest":"sha256:b00b1c6e7ee018038aa0391df64f2ffe78eae7fb385f9274c52e3b94c3b8c324","observation_id":"e5a70814-dea6-49c3-b94b-57bc23dc8484","resolution":{"observed_at":"2026-07-31T02:18:01.986907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:18:01.992781Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28609","last_updated":"2026-07-30T17:57:41Z","snapshot_observed_at":"2026-08-03T14:25:08.011501Z","submitted_at":"2026-07-30T17:57:41Z","title":"OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-07-31T02:18:01.992781Z"},"links":{"citing_paper":"/paper/2607.28609"},"observation_digest":"sha256:e55682244ae6b1e1f82fe33e4b276a6ba77d4e024d3e1db14e2df2b66bddf812","observation_id":"587bb7b2-d8ea-4d5b-aa2e-109c97fea10b","resolution":{"observed_at":"2026-07-31T02:18:01.992781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:18:01.997718Z","title":"- Examples include system or OS barriers, login walls, CAPTCHAs, paywalls, region restrictions, network failures, and unavailable pages or apps","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28609","last_updated":"2026-07-30T17:57:41Z","snapshot_observed_at":"2026-08-03T14:25:08.011501Z","submitted_at":"2026-07-30T17:57:41Z","title":"OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-07-31T02:18:01.997718Z"},"links":{"citing_paper":"/paper/2607.28609"},"observation_digest":"sha256:8d2819f0312f68d5842cb5f469603aa5f2085c73841194fb7627eb97e9d57ba8","observation_id":"fb4a70b5-e1b6-4b5a-a475-9e36db622242","resolution":{"observed_at":"2026-07-31T02:18:01.997718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T02:18:02.002869Z","title":"recently popular","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28609","last_updated":"2026-07-30T17:57:41Z","snapshot_observed_at":"2026-08-03T14:25:08.011501Z","submitted_at":"2026-07-30T17:57:41Z","title":"OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-07-31T02:18:02.002869Z"},"links":{"citing_paper":"/paper/2607.28609"},"observation_digest":"sha256:7568a85b075d872b10ddb14cff0bc845cc430f1dcb974109f0b71a20feb8466d","observation_id":"10c3efbc-d33b-4617-ad09-84cd573180ff","resolution":{"observed_at":"2026-07-31T02:18:02.002869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07456","last_updated":"2024-02-15T09:30:48Z","snapshot_observed_at":"2026-07-06T17:28:43.842260Z","submitted_at":"2024-02-12T07:29:22Z","title":"OS-Copilot: Towards Generalist Computer Agents with Self-Improvement","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07456","snapshot_observed_at":"2026-07-31T02:18:01.857270Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28609","last_updated":"2026-07-30T17:57:41Z","snapshot_observed_at":"2026-08-03T14:25:08.011501Z","submitted_at":"2026-07-30T17:57:41Z","title":"OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-07-31T02:18:01.857270Z"},"links":{"cited_paper":"/paper/2402.07456","citing_paper":"/paper/2607.28609"},"observation_digest":"sha256:91a503829a47d629febd650a4c3f36ccf418168e7241ba3fd5b4ebda5fd4a216","observation_id":"6a7ab6ba-fdce-46df-ab5b-df00bf530e3a","resolution":{"observed_at":"2026-07-31T02:18:01.857270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.28609","last_updated":"2026-07-30T17:57:41Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-03T14:25:08.011501Z","submitted_at":"2026-07-30T17:57:41Z","title":"OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models"},"reference_resolution":{"displayed":82,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":81,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":82},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 82 of 82 outbound references and 0 inbound Pith citation observations for arXiv:2607.28609."}