{"as_of":"2026-08-10T10:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8aa4e69c900addf0089eb72c50d47561b7eafc72d103cd7b715b977d9a7c46f7","coverage":[{"denominator":26,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:11:48.561600Z","state":"measured"},{"denominator":26,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":26,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.03095/citation-record","integrity":"/paper/2506.03095/integrity","json":"/paper/2506.03095/citation-record.json","paper":"/paper/2506.03095"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.00906","last_updated":"2025-04-01T15:40:27Z","snapshot_observed_at":"2026-07-06T21:02:28.100677Z","submitted_at":"2025-04-01T15:40:27Z","title":"Agent S2: A Compositional Generalist-Specialist Framework for Computer Use Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.00906","snapshot_observed_at":"2026-08-07T11:11:46.803506Z","title":"Agent s2: A compositional generalist-specialist framework for computer use agents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03095","last_updated":"2025-06-03T17:27:04Z","snapshot_observed_at":"2026-08-10T04:04:21.667083Z","submitted_at":"2025-06-03T17:27:04Z","title":"DPO Learning with LLMs-Judge Signal for Computer Use Agents","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:11:46.803506Z"},"links":{"cited_paper":"/paper/2504.00906","citing_paper":"/paper/2506.03095"},"observation_digest":"sha256:2a4c6f2cae39b7b141e7eeba9d5fd2f21a75c4ae1fcf011e7587dfbcc1fd318d","observation_id":"84a62ef0-d64b-4099-8946-7d03bf5faaa2","resolution":{"observed_at":"2026-08-07T11:11:46.803506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-07T11:11:46.892805Z","title":"Qwen-vl: A versatile vision-language model for un- derstanding, localization, text reading, and beyond","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03095","last_updated":"2025-06-03T17:27:04Z","snapshot_observed_at":"2026-08-10T04:04:21.667083Z","submitted_at":"2025-06-03T17:27:04Z","title":"DPO Learning with LLMs-Judge Signal for Computer Use Agents","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:11:46.892805Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2506.03095"},"observation_digest":"sha256:50e1652fca4a4244f1616d741788569461e973a4d27d0473ce7fc8ffb38cedf7","observation_id":"ea1053d5-30ed-4248-9cb2-640ec29e577f","resolution":{"observed_at":"2026-08-07T11:11:46.892805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.08264","last_updated":"2024-09-13T20:17:13Z","snapshot_observed_at":"2026-08-05T14:11:56.506073Z","submitted_at":"2024-09-12T17:56:43Z","title":"Windows Agent Arena: Evaluating Multi-Modal OS Agents at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.08264","snapshot_observed_at":"2026-08-07T11:11:46.979114Z","title":"Windows agent arena: Evaluating multi-modal os agents at scale","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03095","last_updated":"2025-06-03T17:27:04Z","snapshot_observed_at":"2026-08-10T04:04:21.667083Z","submitted_at":"2025-06-03T17:27:04Z","title":"DPO Learning with LLMs-Judge Signal for Computer Use Agents","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:11:46.979114Z"},"links":{"cited_paper":"/paper/2409.08264","citing_paper":"/paper/2506.03095"},"observation_digest":"sha256:d345852dd5114f0bc4cf54c02f191d76c9112335a7c4ace180d9803342308fa0","observation_id":"05cea6c6-4d04-40f8-9aa7-ee208e20f0b7","resolution":{"observed_at":"2026-08-07T11:11:46.979114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:11:50.939418Z","title":"Deep reinforcement learn- ing from human preferences.Advances in neural information processing systems, 30, 2017","venue":null,"work_id":"b199ec23-4265-4028-b0ca-69cb53d6d5c6","year":2017},"citing_paper":{"arxiv_id":"2506.03095","last_updated":"2025-06-03T17:27:04Z","snapshot_observed_at":"2026-08-10T04:04:21.667083Z","submitted_at":"2025-06-03T17:27:04Z","title":"DPO Learning with LLMs-Judge Signal for Computer Use Agents","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:11:47.046229Z"},"links":{"citing_paper":"/paper/2506.03095"},"observation_digest":"sha256:493409e19e8e6fe8e4e3253cb768ad3df0d52181b8cbf2e90552518c5fa59ef6","observation_id":"7d4bee5d-5850-4a70-884f-3bf4e00f7f47","resolution":{"observed_at":"2026-08-07T11:11:51.007382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:11:50.616980Z","title":"Mind2web: Towards a generalist agent for the web","venue":null,"work_id":"77bab53b-49ed-4ffb-8dad-dfb682450dd6","year":2023},"citing_paper":{"arxiv_id":"2506.03095","last_updated":"2025-06-03T17:27:04Z","snapshot_observed_at":"2026-08-10T04:04:21.667083Z","submitted_at":"2025-06-03T17:27:04Z","title":"DPO Learning with LLMs-Judge Signal for Computer Use Agents","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:11:47.127378Z"},"links":{"citing_paper":"/paper/2506.03095"},"observation_digest":"sha256:9f50cf3e58bfc59f47c50913c66effbd71f475fa741cb277a19710e00944ea64","observation_id":"658122ca-daf3-4bc7-a0ad-804fd2eb11c1","resolution":{"observed_at":"2026-08-07T11:11:50.797671Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:11:50.349952Z","title":"Detecting and preventing hallucinations in large vision language models","venue":null,"work_id":"37c86a2b-73bb-4caf-8a30-691aee10e6c7","year":2024},"citing_paper":{"arxiv_id":"2506.03095","last_updated":"2025-06-03T17:27:04Z","snapshot_observed_at":"2026-08-10T04:04:21.667083Z","submitted_at":"2025-06-03T17:27:04Z","title":"DPO Learning with LLMs-Judge Signal for Computer Use Agents","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:11:47.230549Z"},"links":{"citing_paper":"/paper/2506.03095"},"observation_digest":"sha256:21a72924cfe79bbc6ee7fa4daefcfe0edd60ed47d6bf7c4b9ce013d377ade87e","observation_id":"e9c7f30d-34c8-4991-8b0f-56f0c395b6bc","resolution":{"observed_at":"2026-08-07T11:11:50.533904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:11:47.315267Z","title":"From gener- ation to judgment: Opportunities and challenges of llm-as-a- judge","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03095","last_updated":"2025-06-03T17:27:04Z","snapshot_observed_at":"2026-08-10T04:04:21.667083Z","submitted_at":"2025-06-03T17:27:04Z","title":"DPO Learning with LLMs-Judge Signal for Computer Use Agents","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:11:47.315267Z"},"links":{"citing_paper":"/paper/2506.03095"},"observation_digest":"sha256:e3985a5b3585f4a37ed1f4437ff0f4171442c2e47c9ada66b76cc03a57cc144e","observation_id":"0a2d819d-b698-43dc-bfaa-8625d3a61fd5","resolution":{"observed_at":"2026-08-07T11:11:47.315267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10665","last_updated":"2023-12-17T09:44:27Z","snapshot_observed_at":"2026-07-06T17:04:13.625458Z","submitted_at":"2023-12-17T09:44:27Z","title":"Silkie: Preference Distillation for Large Visual Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10665","snapshot_observed_at":"2026-08-07T11:11:47.407418Z","title":"Silkie: Preference distillation for large visual lan- guage models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03095","last_updated":"2025-06-03T17:27:04Z","snapshot_observed_at":"2026-08-10T04:04:21.667083Z","submitted_at":"2025-06-03T17:27:04Z","title":"DPO Learning with LLMs-Judge Signal for Computer Use Agents","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:11:47.407418Z"},"links":{"cited_paper":"/paper/2312.10665","citing_paper":"/paper/2506.03095"},"observation_digest":"sha256:6175ca2b7236199d63fff31b8332e7f885a9d16f2ffbe72115e318acee6c0f9e","observation_id":"2851502b-aa0c-47f8-bb4b-5bbecad3798b","resolution":{"observed_at":"2026-08-07T11:11:47.407418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:11:47.487075Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03095","last_updated":"2025-06-03T17:27:04Z","snapshot_observed_at":"2026-08-10T04:04:21.667083Z","submitted_at":"2025-06-03T17:27:04Z","title":"DPO Learning with LLMs-Judge Signal for Computer Use Agents","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:11:47.487075Z"},"links":{"citing_paper":"/paper/2506.03095"},"observation_digest":"sha256:7fe860b04e47407caeb4cbdac1b5773b960d5ace7475b27dd775d87088a49858","observation_id":"6492f508-04b4-4ca8-9b5f-0aecedd78d40","resolution":{"observed_at":"2026-08-07T11:11:47.487075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04575","last_updated":"2025-01-08T15:45:21Z","snapshot_observed_at":"2026-08-05T04:06:23.326388Z","submitted_at":"2025-01-08T15:45:21Z","title":"InfiGUIAgent: A Multimodal Generalist GUI Agent with Native Reasoning and Reflection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04575","snapshot_observed_at":"2026-08-07T11:11:47.579318Z","title":"Infiguiagent: A multimodal generalist gui agent with native reasoning and reflection.arXiv preprint arXiv:2501.04575, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03095","last_updated":"2025-06-03T17:27:04Z","snapshot_observed_at":"2026-08-10T04:04:21.667083Z","submitted_at":"2025-06-03T17:27:04Z","title":"DPO Learning with LLMs-Judge Signal for Computer Use Agents","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:11:47.579318Z"},"links":{"cited_paper":"/paper/2501.04575","citing_paper":"/paper/2506.03095"},"observation_digest":"sha256:d8f13243c8a518103b4429bff1b4daf3d44e50b1c0d6b1a95a8b7bacb4525b3c","observation_id":"3d6fae3a-0208-4387-b14c-424fea65d435","resolution":{"observed_at":"2026-08-07T11:11:47.579318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:11:50.073418Z","title":"Hello gpt-4o","venue":null,"work_id":"8c2e5f30-73c5-47ad-bdd5-4e9749204926","year":2024},"citing_paper":{"arxiv_id":"2506.03095","last_updated":"2025-06-03T17:27:04Z","snapshot_observed_at":"2026-08-10T04:04:21.667083Z","submitted_at":"2025-06-03T17:27:04Z","title":"DPO Learning with LLMs-Judge Signal for Computer Use Agents","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:11:47.641146Z"},"links":{"citing_paper":"/paper/2506.03095"},"observation_digest":"sha256:502946f7166943aee179bc53417261b08b03fc7f68cc94acdf3226751011e15b","observation_id":"b84ccf14-510c-4c8b-894c-088bc0000284","resolution":{"observed_at":"2026-08-07T11:11:50.238584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:11:49.822921Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":"48278555-475e-4d92-82d6-914e13e8800a","year":2022},"citing_paper":{"arxiv_id":"2506.03095","last_updated":"2025-06-03T17:27:04Z","snapshot_observed_at":"2026-08-10T04:04:21.667083Z","submitted_at":"2025-06-03T17:27:04Z","title":"DPO Learning with LLMs-Judge Signal for Computer Use Agents","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:11:47.702656Z"},"links":{"citing_paper":"/paper/2506.03095"},"observation_digest":"sha256:008d21b4ff4da04e1b868ffaabaa925b65d1313e50ec3e9d6e315389e4685d85","observation_id":"d39b2950-ae32-43f9-99d1-9a49b6d4d6cd","resolution":{"observed_at":"2026-08-07T11:11:49.985964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12326","last_updated":"2025-01-21T17:48:10Z","snapshot_observed_at":"2026-07-06T20:23:58.426780Z","submitted_at":"2025-01-21T17:48:10Z","title":"UI-TARS: Pioneering Automated GUI Interaction with Native Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12326","snapshot_observed_at":"2026-08-07T11:11:47.763545Z","title":"Ui-tars: Pioneering automated gui inter- action with native agents","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.03095","last_updated":"2025-06-03T17:27:04Z","snapshot_observed_at":"2026-08-10T04:04:21.667083Z","submitted_at":"2025-06-03T17:27:04Z","title":"DPO Learning with LLMs-Judge Signal for Computer Use Agents","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:11:47.763545Z"},"links":{"cited_paper":"/paper/2501.12326","citing_paper":"/paper/2506.03095"},"observation_digest":"sha256:89682b082f5b85d966a7b8327362c4e20fbbe7b374b6af995af651eb97f62f5d","observation_id":"4d16142b-d8d2-4b88-b24d-c4fd0f912613","resolution":{"observed_at":"2026-08-07T11:11:47.763545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:11:49.586412Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":"cff95801-71e6-4539-940f-5ddf2ec80efa","year":2023},"citing_paper":{"arxiv_id":"2506.03095","last_updated":"2025-06-03T17:27:04Z","snapshot_observed_at":"2026-08-10T04:04:21.667083Z","submitted_at":"2025-06-03T17:27:04Z","title":"DPO Learning with LLMs-Judge Signal for Computer Use Agents","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:11:47.819248Z"},"links":{"citing_paper":"/paper/2506.03095"},"observation_digest":"sha256:ab13590ef0dd5923f77b30cf06d033b9a923674dbcc868130424f5a0c89e367d","observation_id":"bef87bf5-1916-4d8e-bc38-e68ae7ee8514","resolution":{"observed_at":"2026-08-07T11:11:49.695754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:11:49.391934Z","title":"Androidinthewild: A large- scale dataset for android device control","venue":null,"work_id":"afebe5b3-8846-4a67-9f82-d536ea715bda","year":2023},"citing_paper":{"arxiv_id":"2506.03095","last_updated":"2025-06-03T17:27:04Z","snapshot_observed_at":"2026-08-10T04:04:21.667083Z","submitted_at":"2025-06-03T17:27:04Z","title":"DPO Learning with LLMs-Judge Signal for Computer Use Agents","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:11:47.869310Z"},"links":{"citing_paper":"/paper/2506.03095"},"observation_digest":"sha256:2d0d6397cf160eecb219f1ba2b109f074fae2c147fca8808295dc08ad6cf0263","observation_id":"c0f62f9f-6d31-4201-bc4e-345989574692","resolution":{"observed_at":"2026-08-07T11:11:49.492838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T11:11:47.932567Z","title":"Proximal policy optimization algo- rithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.03095","last_updated":"2025-06-03T17:27:04Z","snapshot_observed_at":"2026-08-10T04:04:21.667083Z","submitted_at":"2025-06-03T17:27:04Z","title":"DPO Learning with LLMs-Judge Signal for Computer Use Agents","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:11:47.932567Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.03095"},"observation_digest":"sha256:4df683a96b85950ee2366afd3e5e846a89d0e81da398adb31ec1aff107147fd5","observation_id":"85780b80-96e0-4ffa-8e75-495e650e76ea","resolution":{"observed_at":"2026-08-07T11:11:47.932567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11839","last_updated":"2024-10-07T17:59:42Z","snapshot_observed_at":"2026-08-10T04:03:39.633696Z","submitted_at":"2024-06-17T17:59:58Z","title":"mDPO: Conditional Preference Optimization for Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11839","snapshot_observed_at":"2026-08-07T11:11:47.992971Z","title":"mdpo: Conditional preference optimization for multimodal large language mod- els","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03095","last_updated":"2025-06-03T17:27:04Z","snapshot_observed_at":"2026-08-10T04:04:21.667083Z","submitted_at":"2025-06-03T17:27:04Z","title":"DPO Learning with LLMs-Judge Signal for Computer Use Agents","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:11:47.992971Z"},"links":{"cited_paper":"/paper/2406.11839","citing_paper":"/paper/2506.03095"},"observation_digest":"sha256:17aa2baa175fd73dc3a8e63e7aebd9b488ab6daaf0dd1644cd7afbd03a5619ca","observation_id":"52fc45d8-d8ae-47c0-8146-e8dab32c6959","resolution":{"observed_at":"2026-08-07T11:11:47.992971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07456","last_updated":"2024-02-15T09:30:48Z","snapshot_observed_at":"2026-08-08T22:28:54.714585Z","submitted_at":"2024-02-12T07:29:22Z","title":"OS-Copilot: Towards Generalist Computer Agents with Self-Improvement","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07456","snapshot_observed_at":"2026-08-07T11:11:48.072942Z","title":"Os-copilot: Towards generalist computer agents with self-improvement","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03095","last_updated":"2025-06-03T17:27:04Z","snapshot_observed_at":"2026-08-10T04:04:21.667083Z","submitted_at":"2025-06-03T17:27:04Z","title":"DPO Learning with LLMs-Judge Signal for Computer Use Agents","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:11:48.072942Z"},"links":{"cited_paper":"/paper/2402.07456","citing_paper":"/paper/2506.03095"},"observation_digest":"sha256:95d4afe6b14b6b363553bf75cb1b09d2b5a04dadd7c63d0b5d3634783c140d03","observation_id":"13a7da60-6ed7-43cf-b502-223ebe2c8838","resolution":{"observed_at":"2026-08-07T11:11:48.072942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:11:49.217682Z","title":"Osworld: Benchmark- ing multimodal agents for open-ended tasks in real computer environments","venue":null,"work_id":"eb20dca8-4ebd-4988-a2b2-be33be322e04","year":2024},"citing_paper":{"arxiv_id":"2506.03095","last_updated":"2025-06-03T17:27:04Z","snapshot_observed_at":"2026-08-10T04:04:21.667083Z","submitted_at":"2025-06-03T17:27:04Z","title":"DPO Learning with LLMs-Judge Signal for Computer Use Agents","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:11:48.154432Z"},"links":{"citing_paper":"/paper/2506.03095"},"observation_digest":"sha256:cf61a1483d3aa6a5da3c749d374bba9b27ff555d326fc5a63d2e147ed937baf6","observation_id":"2c4b1f6a-fc90-4e32-b79d-28036744c2b8","resolution":{"observed_at":"2026-08-07T11:11:49.294060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04454","last_updated":"2025-05-05T16:17:20Z","snapshot_observed_at":"2026-07-06T20:02:21.509050Z","submitted_at":"2024-12-05T18:58:26Z","title":"Aguvis: Unified Pure Vision Agents for Autonomous GUI Interaction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04454","snapshot_observed_at":"2026-08-07T11:11:48.195477Z","title":"Aguvis: Unified pure vision agents for autonomous gui interaction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03095","last_updated":"2025-06-03T17:27:04Z","snapshot_observed_at":"2026-08-10T04:04:21.667083Z","submitted_at":"2025-06-03T17:27:04Z","title":"DPO Learning with LLMs-Judge Signal for Computer Use Agents","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:11:48.195477Z"},"links":{"cited_paper":"/paper/2412.04454","citing_paper":"/paper/2506.03095"},"observation_digest":"sha256:15cca242dfc8578c2d920c325cd54f9e8e0302e73d02a5ecb19227285c0901ab","observation_id":"b940e2a0-ab9d-487c-ae4c-5a991da57c58","resolution":{"observed_at":"2026-08-07T11:11:48.195477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07562","last_updated":"2023-11-13T18:53:37Z","snapshot_observed_at":"2026-07-06T16:46:57.403995Z","submitted_at":"2023-11-13T18:53:37Z","title":"GPT-4V in Wonderland: Large Multimodal Models for Zero-Shot Smartphone GUI Navigation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07562","snapshot_observed_at":"2026-08-07T11:11:48.250484Z","title":"Gpt-4v in wonderland: Large multimodal models for zero-shot smartphone gui navigation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03095","last_updated":"2025-06-03T17:27:04Z","snapshot_observed_at":"2026-08-10T04:04:21.667083Z","submitted_at":"2025-06-03T17:27:04Z","title":"DPO Learning with LLMs-Judge Signal for Computer Use Agents","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:11:48.250484Z"},"links":{"cited_paper":"/paper/2311.07562","citing_paper":"/paper/2506.03095"},"observation_digest":"sha256:5f90ef8d315c98c39aacad1557431bda8cd7d618bfc5ca2eda0a5291f91ac782","observation_id":"f3e53efa-5ea7-40c2-a989-a6f99ef929aa","resolution":{"observed_at":"2026-08-07T11:11:48.250484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01258","last_updated":"2024-04-02T12:47:49Z","snapshot_observed_at":"2026-08-08T06:22:53.769876Z","submitted_at":"2024-04-01T17:28:16Z","title":"Direct Preference Optimization of Video Large Multimodal Models from Language Model Reward","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01258","snapshot_observed_at":"2026-08-07T11:11:48.321722Z","title":"Direct preference optimiza- tion of video large multimodal models from language model reward","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03095","last_updated":"2025-06-03T17:27:04Z","snapshot_observed_at":"2026-08-10T04:04:21.667083Z","submitted_at":"2025-06-03T17:27:04Z","title":"DPO Learning with LLMs-Judge Signal for Computer Use Agents","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:11:48.321722Z"},"links":{"cited_paper":"/paper/2404.01258","citing_paper":"/paper/2506.03095"},"observation_digest":"sha256:80155f0b591b6524519dae8ff0c34f8406839f13a4ee18f3b9a8a14437ad53be","observation_id":"a6d1d13c-c917-42b2-b910-fd47e5cd3e2d","resolution":{"observed_at":"2026-08-07T11:11:48.321722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:11:49.001392Z","title":"Gpt-4v (ision) is a generalist web agent, if grounded","venue":null,"work_id":"0f8a8315-99e1-47c2-bf32-71ec0d0220ff","year":2024},"citing_paper":{"arxiv_id":"2506.03095","last_updated":"2025-06-03T17:27:04Z","snapshot_observed_at":"2026-08-10T04:04:21.667083Z","submitted_at":"2025-06-03T17:27:04Z","title":"DPO Learning with LLMs-Judge Signal for Computer Use Agents","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:11:48.389540Z"},"links":{"citing_paper":"/paper/2506.03095"},"observation_digest":"sha256:cbf9e080e1c9610344438a167e934ad0cbab51ad2a579a599a39464d3d144ac5","observation_id":"2e782ce6-1f08-47c5-ab9b-cc56e749039c","resolution":{"observed_at":"2026-08-07T11:11:49.083792Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:11:48.864346Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena.Advances in Neural Information Processing Systems, 36:46595–46623, 2023","venue":null,"work_id":"6ab39fee-5107-44cd-a6ce-1c6bad6d60fb","year":2023},"citing_paper":{"arxiv_id":"2506.03095","last_updated":"2025-06-03T17:27:04Z","snapshot_observed_at":"2026-08-10T04:04:21.667083Z","submitted_at":"2025-06-03T17:27:04Z","title":"DPO Learning with LLMs-Judge Signal for Computer Use Agents","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:11:48.452167Z"},"links":{"citing_paper":"/paper/2506.03095"},"observation_digest":"sha256:ea70d2eba7fbd4d23333d224c91180fc687e58a035a465b5e5e4a54ef46debb9","observation_id":"2a5c22b9-21d8-49cf-93b3-dda022dd0684","resolution":{"observed_at":"2026-08-07T11:11:48.925875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.13854","last_updated":"2024-04-16T15:13:18Z","snapshot_observed_at":"2026-08-06T12:47:01.809185Z","submitted_at":"2023-07-25T22:59:32Z","title":"WebArena: A Realistic Web Environment for Building Autonomous Agents","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.13854","snapshot_observed_at":"2026-08-07T11:11:48.502654Z","title":"Webarena: A realistic web environment for building autonomous agents","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03095","last_updated":"2025-06-03T17:27:04Z","snapshot_observed_at":"2026-08-10T04:04:21.667083Z","submitted_at":"2025-06-03T17:27:04Z","title":"DPO Learning with LLMs-Judge Signal for Computer Use Agents","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:11:48.502654Z"},"links":{"cited_paper":"/paper/2307.13854","citing_paper":"/paper/2506.03095"},"observation_digest":"sha256:f5eedb97d8553bb9f3525075a72a2e0e561831cb9dae1230368d01146ee3e40e","observation_id":"b83d7520-3411-4e9f-a70c-3042e5b5d92c","resolution":{"observed_at":"2026-08-07T11:11:48.502654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-08-08T07:44:49.921146Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-08-07T11:11:48.561600Z","title":"Fine-tuning language models from human preferences","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2506.03095","last_updated":"2025-06-03T17:27:04Z","snapshot_observed_at":"2026-08-10T04:04:21.667083Z","submitted_at":"2025-06-03T17:27:04Z","title":"DPO Learning with LLMs-Judge Signal for Computer Use Agents","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:11:48.561600Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2506.03095"},"observation_digest":"sha256:7b89ec2e9d5a9ba1acffc5fcf37f5296a317e527f2b296c217f7f941532a62ac","observation_id":"552f0184-948a-4b4d-b4b4-5ce9554e9345","resolution":{"observed_at":"2026-08-07T11:11:48.561600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.03095","last_updated":"2025-06-03T17:27:04Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-10T04:04:21.667083Z","submitted_at":"2025-06-03T17:27:04Z","title":"DPO Learning with LLMs-Judge Signal for Computer Use Agents"},"reference_resolution":{"displayed":26,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":0,"verified_fuzzy":10},"total_outbound_references":26},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 26 of 26 outbound references and 0 inbound Pith citation observations for arXiv:2506.03095."}