{"as_of":"2026-08-21T01:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9ed697f3b9ed87051adf05b442dfd9d1b8e42f3d9f6ece9390a06bf52d05dbd4","coverage":[{"denominator":68,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":68,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T06:07:19.981554Z","state":"measured"},{"denominator":68,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":68,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.02499/citation-record","integrity":"/paper/2608.02499/integrity","json":"/paper/2608.02499/citation-record.json","paper":"/paper/2608.02499"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:07:10.248713Z","title":"Introducing Claude Fable 5","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02499","last_updated":"2026-08-03T17:03:19Z","snapshot_observed_at":"2026-08-16T23:22:17.506296Z","submitted_at":"2026-08-03T17:03:19Z","title":"SWE-Touch: Benchmarking Coding Agents When Users Touch the Code","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T06:07:10.248713Z"},"links":{"citing_paper":"/paper/2608.02499"},"observation_digest":"sha256:2a15ca359725076592eb69ce5c1b47ba088b49f8c7a7e7d179fd5834ac9d7d22","observation_id":"6c52e5ed-9f45-4791-ba9e-7b849c1202ab","resolution":{"observed_at":"2026-08-04T06:07:10.248713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:07:10.396860Z","title":"Introducing Claude Opus 4.8","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02499","last_updated":"2026-08-03T17:03:19Z","snapshot_observed_at":"2026-08-16T23:22:17.506296Z","submitted_at":"2026-08-03T17:03:19Z","title":"SWE-Touch: Benchmarking Coding Agents When Users Touch the Code","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T06:07:10.396860Z"},"links":{"citing_paper":"/paper/2608.02499"},"observation_digest":"sha256:d3480531a2aac335a632f951bf10475f01bdb9193548a0515f1cd940c79a9adf","observation_id":"3f89170b-51db-49d9-88e6-a1ab91fdf48b","resolution":{"observed_at":"2026-08-04T06:07:10.396860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:07:10.574763Z","title":"Program synthesis with large language models, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.02499","last_updated":"2026-08-03T17:03:19Z","snapshot_observed_at":"2026-08-16T23:22:17.506296Z","submitted_at":"2026-08-03T17:03:19Z","title":"SWE-Touch: Benchmarking Coding Agents When Users Touch the Code","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T06:07:10.574763Z"},"links":{"citing_paper":"/paper/2608.02499"},"observation_digest":"sha256:4cc3e295f057a5574a9bbe688084a37d67253d8a4313ded1b60ca5b4aab0457d","observation_id":"adaf73df-630f-46ee-a7de-3413af95bf7e","resolution":{"observed_at":"2026-08-04T06:07:10.574763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:07:10.749054Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02499","last_updated":"2026-08-03T17:03:19Z","snapshot_observed_at":"2026-08-16T23:22:17.506296Z","submitted_at":"2026-08-03T17:03:19Z","title":"SWE-Touch: Benchmarking Coding Agents When Users Touch the Code","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T06:07:10.749054Z"},"links":{"citing_paper":"/paper/2608.02499"},"observation_digest":"sha256:693c2bde81daf36b2d84e0e58c2f7f6aaca7048a37d4b0a151ecc307bc1d6977","observation_id":"4fd25f99-8567-4113-9af6-3081671b4538","resolution":{"observed_at":"2026-08-04T06:07:10.749054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:07:10.859826Z","title":"SWE-chat: Coding agent interactions from real users in the wild, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02499","last_updated":"2026-08-03T17:03:19Z","snapshot_observed_at":"2026-08-16T23:22:17.506296Z","submitted_at":"2026-08-03T17:03:19Z","title":"SWE-Touch: Benchmarking Coding Agents When Users Touch the Code","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T06:07:10.859826Z"},"links":{"citing_paper":"/paper/2608.02499"},"observation_digest":"sha256:b2f82060651a3993420579241f9588787da0e8c66796eddf51ca4fd6d1f3ef6d","observation_id":"4b8fba65-07ca-46c7-aa88-34de531c5f67","resolution":{"observed_at":"2026-08-04T06:07:10.859826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:07:11.008832Z","title":"Evaluating large language models trained on code, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.02499","last_updated":"2026-08-03T17:03:19Z","snapshot_observed_at":"2026-08-16T23:22:17.506296Z","submitted_at":"2026-08-03T17:03:19Z","title":"SWE-Touch: Benchmarking Coding Agents When Users Touch the Code","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T06:07:11.008832Z"},"links":{"citing_paper":"/paper/2608.02499"},"observation_digest":"sha256:8da26f8f64a7236cd83ff41ffeaf2c3df2cd316cb9ee78df5c23c06b62406d2a","observation_id":"578ec3cf-e8e9-41ac-a772-01f2b3d63929","resolution":{"observed_at":"2026-08-04T06:07:11.008832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.09801","last_updated":"2026-06-09T14:05:10Z","snapshot_observed_at":"2026-08-16T23:21:32.174404Z","submitted_at":"2025-10-10T19:04:28Z","title":"How can we assess human-agent interactions? Case studies in software agent design","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.09801","snapshot_observed_at":"2026-08-04T06:07:11.153704Z","title":"Tran,CalvinSmith,AmeetTalwalkar,andGrahamNeubig","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02499","last_updated":"2026-08-03T17:03:19Z","snapshot_observed_at":"2026-08-16T23:22:17.506296Z","submitted_at":"2026-08-03T17:03:19Z","title":"SWE-Touch: Benchmarking Coding Agents When Users Touch the Code","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T06:07:11.153704Z"},"links":{"cited_paper":"/paper/2510.09801","citing_paper":"/paper/2608.02499"},"observation_digest":"sha256:6745f2ed846affba8708c5efa09b3d411c25244e8365593529a85e83ff5aa985","observation_id":"ad659fd4-a5aa-42d8-b342-aecee5390ee9","resolution":{"observed_at":"2026-08-04T06:07:11.153704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:07:11.369041Z","title":"EDIT-Bench:Evaluating LLM abilities to perform real-world instructed code edits, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02499","last_updated":"2026-08-03T17:03:19Z","snapshot_observed_at":"2026-08-16T23:22:17.506296Z","submitted_at":"2026-08-03T17:03:19Z","title":"SWE-Touch: Benchmarking Coding Agents When Users Touch the Code","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T06:07:11.369041Z"},"links":{"citing_paper":"/paper/2608.02499"},"observation_digest":"sha256:fbf66cc444abdca3264fce0b6772ee291f713ceb55c5ad174fc131f2e4e12b9e","observation_id":"3a616fab-7870-42bb-8cbc-c1895c1429f4","resolution":{"observed_at":"2026-08-04T06:07:11.369041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:07:11.536002Z","title":"Jimenez, John Yang, Leyton Ho, Tejal Patwardhan, Kevin Liu, and Aleksander Madry","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02499","last_updated":"2026-08-03T17:03:19Z","snapshot_observed_at":"2026-08-16T23:22:17.506296Z","submitted_at":"2026-08-03T17:03:19Z","title":"SWE-Touch: Benchmarking Coding Agents When Users Touch the Code","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T06:07:11.536002Z"},"links":{"citing_paper":"/paper/2608.02499"},"observation_digest":"sha256:833750ecdd8a3858c5ecae67140722678867392bcb75a802f8f87549b26cc764","observation_id":"a594dbb8-5ea0-419d-8b70-727b176a0355","resolution":{"observed_at":"2026-08-04T06:07:11.536002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:07:11.647921Z","title":"FrontierSWE","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02499","last_updated":"2026-08-03T17:03:19Z","snapshot_observed_at":"2026-08-16T23:22:17.506296Z","submitted_at":"2026-08-03T17:03:19Z","title":"SWE-Touch: Benchmarking Coding Agents When Users Touch the Code","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T06:07:11.647921Z"},"links":{"citing_paper":"/paper/2608.02499"},"observation_digest":"sha256:29e929c25b58f6a6edc81e5ade74cf30f84f1257bcd2b512edbe68397923f079","observation_id":"ae3499d9-a9ca-4166-b7f9-688d2ea61f5e","resolution":{"observed_at":"2026-08-04T06:07:11.647921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:07:11.758762Z","title":"DeepSeek V4 Preview release","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02499","last_updated":"2026-08-03T17:03:19Z","snapshot_observed_at":"2026-08-16T23:22:17.506296Z","submitted_at":"2026-08-03T17:03:19Z","title":"SWE-Touch: Benchmarking Coding Agents When Users Touch the Code","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T06:07:11.758762Z"},"links":{"citing_paper":"/paper/2608.02499"},"observation_digest":"sha256:23f9ab88c1b3fcf8683239a156a14e56980dbdff6747979fa77fc477883e7b4a","observation_id":"4e3e93d7-6095-419f-a47b-dd6f14d7d195","resolution":{"observed_at":"2026-08-04T06:07:11.758762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:07:11.875146Z","title":"SWE-Bench Pro: Can AI agents solve long-horizon software engineering tasks?, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02499","last_updated":"2026-08-03T17:03:19Z","snapshot_observed_at":"2026-08-16T23:22:17.506296Z","submitted_at":"2026-08-03T17:03:19Z","title":"SWE-Touch: Benchmarking Coding Agents When Users Touch the Code","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T06:07:11.875146Z"},"links":{"citing_paper":"/paper/2608.02499"},"observation_digest":"sha256:77238a4b51f8545c48d3cb2d2ff046070021cc94f1040472f467f9f00bcd4cd7","observation_id":"5bd1e8f0-985d-420a-b28d-61f30face221","resolution":{"observed_at":"2026-08-04T06:07:11.875146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:07:12.080935Z","title":"Swe-marathon: Can agents autonomously complete ultra-long-horizon software work?, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02499","last_updated":"2026-08-03T17:03:19Z","snapshot_observed_at":"2026-08-16T23:22:17.506296Z","submitted_at":"2026-08-03T17:03:19Z","title":"SWE-Touch: Benchmarking Coding Agents When Users Touch the Code","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T06:07:12.080935Z"},"links":{"citing_paper":"/paper/2608.02499"},"observation_digest":"sha256:3c9ad3450e05e046d1c5c4a768dfc3182730114da92fc57fd5621cc1af60e516","observation_id":"02edd666-fb5d-438f-9dab-1d0c19bd44e1","resolution":{"observed_at":"2026-08-04T06:07:12.080935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:07:12.343505Z","title":"Ask or assume? uncertainty-aware clarification-seeking in coding agents, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02499","last_updated":"2026-08-03T17:03:19Z","snapshot_observed_at":"2026-08-16T23:22:17.506296Z","submitted_at":"2026-08-03T17:03:19Z","title":"SWE-Touch: Benchmarking Coding Agents When Users Touch the Code","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T06:07:12.343505Z"},"links":{"citing_paper":"/paper/2608.02499"},"observation_digest":"sha256:def4790444ad8d153ff12b8a53d9e185956d544c222ca6fbce3df1881d3f0f64","observation_id":"3b358f91-d93d-4b31-9b79-b5ecbe03445d","resolution":{"observed_at":"2026-08-04T06:07:12.343505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:07:12.539585Z","title":"Coding agents don’t know when to act, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02499","last_updated":"2026-08-03T17:03:19Z","snapshot_observed_at":"2026-08-16T23:22:17.506296Z","submitted_at":"2026-08-03T17:03:19Z","title":"SWE-Touch: Benchmarking Coding Agents When Users Touch the Code","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T06:07:12.539585Z"},"links":{"citing_paper":"/paper/2608.02499"},"observation_digest":"sha256:b249e62b5d1d559ce192b5248883fa9f9ba2d5d6e36d5588db88f5ff32e20ccf","observation_id":"136f494b-6d85-46c1-9aff-7f414305ebef","resolution":{"observed_at":"2026-08-04T06:07:12.539585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:07:12.627179Z","title":"SyncMind: Measuring agent out-of-sync recovery in collaborative software engineering","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02499","last_updated":"2026-08-03T17:03:19Z","snapshot_observed_at":"2026-08-16T23:22:17.506296Z","submitted_at":"2026-08-03T17:03:19Z","title":"SWE-Touch: Benchmarking Coding Agents When Users Touch the Code","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T06:07:12.627179Z"},"links":{"citing_paper":"/paper/2608.02499"},"observation_digest":"sha256:27874c2957955bd9a8e1ecc43040825c46752dfd3ca7fba9c05e5d12a80d87c5","observation_id":"82101c93-139a-4ce6-a1a0-500243b3cf43","resolution":{"observed_at":"2026-08-04T06:07:12.627179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:07:12.673142Z","title":"Harbor: A framework for evaluating and optimizing agents and models in container environments","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02499","last_updated":"2026-08-03T17:03:19Z","snapshot_observed_at":"2026-08-16T23:22:17.506296Z","submitted_at":"2026-08-03T17:03:19Z","title":"SWE-Touch: Benchmarking Coding Agents When Users Touch the Code","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T06:07:12.673142Z"},"links":{"citing_paper":"/paper/2608.02499"},"observation_digest":"sha256:6ef2e1e8e5eeb476e0ad1994ffa7f2c110faa918a4f60b30bde78b75f98ab693","observation_id":"b4023234-55f0-43fe-8ef3-6f4ab54c3419","resolution":{"observed_at":"2026-08-04T06:07:12.673142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:07:12.741347Z","title":"DeepSWE: Measuring frontier coding agents on original, long-horizon engineering tasks, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02499","last_updated":"2026-08-03T17:03:19Z","snapshot_observed_at":"2026-08-16T23:22:17.506296Z","submitted_at":"2026-08-03T17:03:19Z","title":"SWE-Touch: Benchmarking Coding Agents When Users Touch the Code","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T06:07:12.741347Z"},"links":{"citing_paper":"/paper/2608.02499"},"observation_digest":"sha256:ecd1ec5d734279e06167da07bc1a0b816bead557dffbf898fcb74e2ba713fcaa","observation_id":"bb8e2780-7941-4e3d-9683-9a18b5d80295","resolution":{"observed_at":"2026-08-04T06:07:12.741347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:07:12.832119Z","title":"DA-code: Agent data science code generation benchmark for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02499","last_updated":"2026-08-03T17:03:19Z","snapshot_observed_at":"2026-08-16T23:22:17.506296Z","submitted_at":"2026-08-03T17:03:19Z","title":"SWE-Touch: Benchmarking Coding Agents When Users Touch the Code","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T06:07:12.832119Z"},"links":{"citing_paper":"/paper/2608.02499"},"observation_digest":"sha256:32716fdcc00ba9b7ebe24792eaa955271dc327c95d1fb7d04a4d271e99d794d5","observation_id":"dfd6f522-34b6-476e-9e7a-b8ca03633d5f","resolution":{"observed_at":"2026-08-04T06:07:12.832119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:07:12.994613Z","title":"Jimenez, John Yang, Alexander Wettig, Shunyu Yao, Kexin Pei, Ofir Press, and Karthik Narasimhan","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02499","last_updated":"2026-08-03T17:03:19Z","snapshot_observed_at":"2026-08-16T23:22:17.506296Z","submitted_at":"2026-08-03T17:03:19Z","title":"SWE-Touch: Benchmarking Coding Agents When Users Touch the Code","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T06:07:12.994613Z"},"links":{"citing_paper":"/paper/2608.02499"},"observation_digest":"sha256:dc64d6d82dfcd84ce2f3815f6891be14cdd8a9db536cb8339c78de98993ef57f","observation_id":"79f699b9-a59f-42fc-9a08-f5649b8839a9","resolution":{"observed_at":"2026-08-04T06:07:12.994613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:07:13.152997Z","title":"Dialogue swe-bench: A benchmark for dialogue-driven coding agents, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02499","last_updated":"2026-08-03T17:03:19Z","snapshot_observed_at":"2026-08-16T23:22:17.506296Z","submitted_at":"2026-08-03T17:03:19Z","title":"SWE-Touch: Benchmarking Coding Agents When Users Touch the Code","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T06:07:13.152997Z"},"links":{"citing_paper":"/paper/2608.02499"},"observation_digest":"sha256:2ed2b4e6fe32cc0a208a0c75bbfa259c845fc6e502e529edcd7c57ac1a375cdd","observation_id":"0ac580b0-883f-4b9b-9bf5-c495faf0c427","resolution":{"observed_at":"2026-08-04T06:07:13.152997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:07:13.261113Z","title":"Swe-evo: Benchmarking coding agents in long-horizon software evolution scenarios, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02499","last_updated":"2026-08-03T17:03:19Z","snapshot_observed_at":"2026-08-16T23:22:17.506296Z","submitted_at":"2026-08-03T17:03:19Z","title":"SWE-Touch: Benchmarking Coding Agents When Users Touch the Code","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T06:07:13.261113Z"},"links":{"citing_paper":"/paper/2608.02499"},"observation_digest":"sha256:c946716b3c4588f59d97728c1ad968658d0df00d62b44a6f385c86735d90d8dc","observation_id":"92188491-5981-485c-87bc-ef1ebb3aafb2","resolution":{"observed_at":"2026-08-04T06:07:13.261113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:07:13.421012Z","title":"Liang, Chenyang Yang, and Brad A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02499","last_updated":"2026-08-03T17:03:19Z","snapshot_observed_at":"2026-08-16T23:22:17.506296Z","submitted_at":"2026-08-03T17:03:19Z","title":"SWE-Touch: Benchmarking Coding Agents When Users Touch the Code","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T06:07:13.421012Z"},"links":{"citing_paper":"/paper/2608.02499"},"observation_digest":"sha256:37c6febde756a350c18075a6afa9c87f876b2f1441babb168c1f9decb71421ba","observation_id":"623d493b-9f75-400f-b6eb-50b8fd04eca8","resolution":{"observed_at":"2026-08-04T06:07:13.421012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:07:13.596952Z","title":"Terminal-bench: Benchmarking agents on hard, realistic tasks in command line interfaces, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02499","last_updated":"2026-08-03T17:03:19Z","snapshot_observed_at":"2026-08-16T23:22:17.506296Z","submitted_at":"2026-08-03T17:03:19Z","title":"SWE-Touch: Benchmarking Coding Agents When Users Touch the Code","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T06:07:13.596952Z"},"links":{"citing_paper":"/paper/2608.02499"},"observation_digest":"sha256:d396cd7ed9e31ec26b7cc9c74e0121ec88c635d929d85b079127f9f40b162f64","observation_id":"d846949c-77e5-444f-b87d-8baa8429313b","resolution":{"observed_at":"2026-08-04T06:07:13.596952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:07:13.798850Z","title":"MiniMax M2.5: Built for real-world productivity","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02499","last_updated":"2026-08-03T17:03:19Z","snapshot_observed_at":"2026-08-16T23:22:17.506296Z","submitted_at":"2026-08-03T17:03:19Z","title":"SWE-Touch: Benchmarking Coding Agents When Users Touch the Code","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T06:07:13.798850Z"},"links":{"citing_paper":"/paper/2608.02499"},"observation_digest":"sha256:1babb31556831b4cc61585b0a57e28dbefb77338e0e9a1f8d66e7afc6c59d605","observation_id":"6d0c1d81-8e2d-40b7-aee0-372584737b4a","resolution":{"observed_at":"2026-08-04T06:07:13.798850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:07:14.064836Z","title":"MiniMax M2.7: Early echoes of self-evolution","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02499","last_updated":"2026-08-03T17:03:19Z","snapshot_observed_at":"2026-08-16T23:22:17.506296Z","submitted_at":"2026-08-03T17:03:19Z","title":"SWE-Touch: Benchmarking Coding Agents When Users Touch the Code","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T06:07:14.064836Z"},"links":{"citing_paper":"/paper/2608.02499"},"observation_digest":"sha256:1429155c0c676e2e6ffba70f4f925df6f37df21e01cf137876622b45b7f64373","observation_id":"23f0e3d0-222f-464b-baa3-eac73faa46b0","resolution":{"observed_at":"2026-08-04T06:07:14.064836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:07:14.238974Z","title":"Kimi-K2.6","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02499","last_updated":"2026-08-03T17:03:19Z","snapshot_observed_at":"2026-08-16T23:22:17.506296Z","submitted_at":"2026-08-03T17:03:19Z","title":"SWE-Touch: Benchmarking Coding Agents When Users Touch the Code","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T06:07:14.238974Z"},"links":{"citing_paper":"/paper/2608.02499"},"observation_digest":"sha256:9e39ab593ed92550650ad2fafd03235f52117b616b8adc6a276ea68dd8f565b4","observation_id":"26a52cee-4c17-4363-a5bc-ccb933e2d2d2","resolution":{"observed_at":"2026-08-04T06:07:14.238974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:07:14.505385Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02499","last_updated":"2026-08-03T17:03:19Z","snapshot_observed_at":"2026-08-16T23:22:17.506296Z","submitted_at":"2026-08-03T17:03:19Z","title":"SWE-Touch: Benchmarking Coding Agents When Users Touch the Code","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T06:07:14.505385Z"},"links":{"citing_paper":"/paper/2608.02499"},"observation_digest":"sha256:04d931b004d779a85e25119c5ddb392623b8ddd999fa3b400a0db1e3d5d11b85","observation_id":"b876b214-2eb2-457d-9106-65f167e03f59","resolution":{"observed_at":"2026-08-04T06:07:14.505385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:07:14.732168Z","title":"GPT-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02499","last_updated":"2026-08-03T17:03:19Z","snapshot_observed_at":"2026-08-16T23:22:17.506296Z","submitted_at":"2026-08-03T17:03:19Z","title":"SWE-Touch: Benchmarking Coding Agents When Users Touch the Code","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T06:07:14.732168Z"},"links":{"citing_paper":"/paper/2608.02499"},"observation_digest":"sha256:17cf5a631f969c88d2cb993a80ca071b17e6336adc714b565eb4e086d2a14e3a","observation_id":"2e162a44-456d-40eb-b84d-8407b05c99c5","resolution":{"observed_at":"2026-08-04T06:07:14.732168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:07:14.933895Z","title":"Introducing GPT-5.5","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02499","last_updated":"2026-08-03T17:03:19Z","snapshot_observed_at":"2026-08-16T23:22:17.506296Z","submitted_at":"2026-08-03T17:03:19Z","title":"SWE-Touch: Benchmarking Coding Agents When Users Touch the Code","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T06:07:14.933895Z"},"links":{"citing_paper":"/paper/2608.02499"},"observation_digest":"sha256:562d1f04ac53920f3fe09a3e09136c4415fb6f5b3bafc26207b1830311a4c6f5","observation_id":"ad4da4f0-6885-4e3e-9471-5898f22659d8","resolution":{"observed_at":"2026-08-04T06:07:14.933895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:07:15.164933Z","title":"Slopcodebench: Benchmarking how coding agents degrade over long-horizon iterative tasks, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02499","last_updated":"2026-08-03T17:03:19Z","snapshot_observed_at":"2026-08-16T23:22:17.506296Z","submitted_at":"2026-08-03T17:03:19Z","title":"SWE-Touch: Benchmarking Coding Agents When Users Touch the Code","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T06:07:15.164933Z"},"links":{"citing_paper":"/paper/2608.02499"},"observation_digest":"sha256:f463239510127c1f5d73d725b03c8850c3850d63e75a689dd8ac388844fb8f03","observation_id":"eed3b407-4571-41b7-ba80-f23619464826","resolution":{"observed_at":"2026-08-04T06:07:15.164933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:07:15.335808Z","title":"When benchmarks talk: Re-evaluating code LLMs with interactive feedback, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02499","last_updated":"2026-08-03T17:03:19Z","snapshot_observed_at":"2026-08-16T23:22:17.506296Z","submitted_at":"2026-08-03T17:03:19Z","title":"SWE-Touch: Benchmarking Coding Agents When Users Touch the Code","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T06:07:15.335808Z"},"links":{"citing_paper":"/paper/2608.02499"},"observation_digest":"sha256:0d4439d34f0c0dbaac1ae55307c9e87983c3523e02250693de16d9958ea78532","observation_id":"4bb31254-1eea-42e7-b537-b9e1afbeda72","resolution":{"observed_at":"2026-08-04T06:07:15.335808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:07:15.508188Z","title":"Icae-bench: Evaluating coding agents as interactive project builders, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02499","last_updated":"2026-08-03T17:03:19Z","snapshot_observed_at":"2026-08-16T23:22:17.506296Z","submitted_at":"2026-08-03T17:03:19Z","title":"SWE-Touch: Benchmarking Coding Agents When Users Touch the Code","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T06:07:15.508188Z"},"links":{"citing_paper":"/paper/2608.02499"},"observation_digest":"sha256:1f59bd32808c7fc1cced42b2ada03233998da10ac42baa6e0f732b69d1cbd2a4","observation_id":"ff82bf41-ed6e-4a79-9349-3e666b2c79e1","resolution":{"observed_at":"2026-08-04T06:07:15.508188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:07:15.630585Z","title":"UserBench: An interactive gym environment for user-centric agents, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02499","last_updated":"2026-08-03T17:03:19Z","snapshot_observed_at":"2026-08-16T23:22:17.506296Z","submitted_at":"2026-08-03T17:03:19Z","title":"SWE-Touch: Benchmarking Coding Agents When Users Touch the Code","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T06:07:15.630585Z"},"links":{"citing_paper":"/paper/2608.02499"},"observation_digest":"sha256:48af35f76ad4abecbf6a288e00a8b32d1feab69dbb8c63b5f6fa3358cdad9901","observation_id":"50ae1844-2237-4b22-8d2e-c952ed3000cd","resolution":{"observed_at":"2026-08-04T06:07:15.630585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:07:15.867237Z","title":"Qwen3-Coder: Agentic coding in the world","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02499","last_updated":"2026-08-03T17:03:19Z","snapshot_observed_at":"2026-08-16T23:22:17.506296Z","submitted_at":"2026-08-03T17:03:19Z","title":"SWE-Touch: Benchmarking Coding Agents When Users Touch the Code","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T06:07:15.867237Z"},"links":{"citing_paper":"/paper/2608.02499"},"observation_digest":"sha256:320b9a258c644bc171d7457ef111498a1d9f3c266d2b128de556fd7527f1ef0f","observation_id":"e17eba67-294c-402c-bd39-29930ad323cd","resolution":{"observed_at":"2026-08-04T06:07:15.867237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:07:16.119581Z","title":"Qwen3.7: the agent frontier","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02499","last_updated":"2026-08-03T17:03:19Z","snapshot_observed_at":"2026-08-16T23:22:17.506296Z","submitted_at":"2026-08-03T17:03:19Z","title":"SWE-Touch: Benchmarking Coding Agents When Users Touch the Code","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T06:07:16.119581Z"},"links":{"citing_paper":"/paper/2608.02499"},"observation_digest":"sha256:917e60305977efb51d6c09212bbdc94f3111c05919225940a3ef7bc2d123c068","observation_id":"18194766-7f38-419b-938e-2a73aa82e893","resolution":{"observed_at":"2026-08-04T06:07:16.119581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:07:16.234970Z","title":"SWE-INTERACT: Reimagin- ing SWE benchmarks as user-driven long-horizon coding sessions, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02499","last_updated":"2026-08-03T17:03:19Z","snapshot_observed_at":"2026-08-16T23:22:17.506296Z","submitted_at":"2026-08-03T17:03:19Z","title":"SWE-Touch: Benchmarking Coding Agents When Users Touch the Code","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T06:07:16.234970Z"},"links":{"citing_paper":"/paper/2608.02499"},"observation_digest":"sha256:2ad48f4f57c4bb8c9616288d71540e124f22cb778d4559f1ef73348c2359c1de","observation_id":"9454379a-0b27-43b0-8971-16272a6dbdcd","resolution":{"observed_at":"2026-08-04T06:07:16.234970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:07:16.407842Z","title":"Collaborative gym: A framework for enabling and evaluating human-agent collaboration, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02499","last_updated":"2026-08-03T17:03:19Z","snapshot_observed_at":"2026-08-16T23:22:17.506296Z","submitted_at":"2026-08-03T17:03:19Z","title":"SWE-Touch: Benchmarking Coding Agents When Users Touch the Code","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T06:07:16.407842Z"},"links":{"citing_paper":"/paper/2608.02499"},"observation_digest":"sha256:7a3e52dae0ef884d7c18b9e7e67dbe6aba04b8332af81b3e341e65585c831a90","observation_id":"86e47c50-1c26-4421-b7b5-17b3a180b623","resolution":{"observed_at":"2026-08-04T06:07:16.407842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:07:16.638390Z","title":"Evocode-bench: Evaluating coding agents in multi-turn iterative interactions, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02499","last_updated":"2026-08-03T17:03:19Z","snapshot_observed_at":"2026-08-16T23:22:17.506296Z","submitted_at":"2026-08-03T17:03:19Z","title":"SWE-Touch: Benchmarking Coding Agents When Users Touch the Code","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T06:07:16.638390Z"},"links":{"citing_paper":"/paper/2608.02499"},"observation_digest":"sha256:ea263afb5cbef934cec41f78513e86433baa2a2bc7eb517077b0cb72d5153d23","observation_id":"f439b36c-371b-403e-ac69-db9c19fb1af6","resolution":{"observed_at":"2026-08-04T06:07:16.638390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:07:16.810807Z","title":"Non-collaborative user simulators for tool agents","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02499","last_updated":"2026-08-03T17:03:19Z","snapshot_observed_at":"2026-08-16T23:22:17.506296Z","submitted_at":"2026-08-03T17:03:19Z","title":"SWE-Touch: Benchmarking Coding Agents When Users Touch the Code","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-04T06:07:16.810807Z"},"links":{"citing_paper":"/paper/2608.02499"},"observation_digest":"sha256:483e90684757e3d6411d86e35d6ddbbce48469b5b719b4dce22513ffcd5b2f68","observation_id":"46258231-0cff-4474-b34e-8100b008fe7e","resolution":{"observed_at":"2026-08-04T06:07:16.810807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:07:16.977947Z","title":"Hedwig:Dynamic autonomy for coding agents under local oversight, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02499","last_updated":"2026-08-03T17:03:19Z","snapshot_observed_at":"2026-08-16T23:22:17.506296Z","submitted_at":"2026-08-03T17:03:19Z","title":"SWE-Touch: Benchmarking Coding Agents When Users Touch the Code","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-04T06:07:16.977947Z"},"links":{"citing_paper":"/paper/2608.02499"},"observation_digest":"sha256:9901d95c8ac2c76117304f8a1b3cedf746aa6dd5e64ad5df15f6c63ffe6ce8ff","observation_id":"4bf98f01-4013-4592-b7ab-09073eb02335","resolution":{"observed_at":"2026-08-04T06:07:16.977947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:07:17.192172Z","title":"HiL- Bench (human-in-loop benchmark): Do agents know when to ask for help?, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02499","last_updated":"2026-08-03T17:03:19Z","snapshot_observed_at":"2026-08-16T23:22:17.506296Z","submitted_at":"2026-08-03T17:03:19Z","title":"SWE-Touch: Benchmarking Coding Agents When Users Touch the Code","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-04T06:07:17.192172Z"},"links":{"citing_paper":"/paper/2608.02499"},"observation_digest":"sha256:9781c174bc0fb59ffff855490bc6ee66275e6db3bce85529f3faa68e2bca946d","observation_id":"e92f1122-805b-418b-8eda-6f905f459de5","resolution":{"observed_at":"2026-08-04T06:07:17.192172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:07:17.378599Z","title":"Ambig-SWE: Interactive agents to overcome underspecificity in software engineering, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02499","last_updated":"2026-08-03T17:03:19Z","snapshot_observed_at":"2026-08-16T23:22:17.506296Z","submitted_at":"2026-08-03T17:03:19Z","title":"SWE-Touch: Benchmarking Coding Agents When Users Touch the Code","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-04T06:07:17.378599Z"},"links":{"citing_paper":"/paper/2608.02499"},"observation_digest":"sha256:8fdbdfbf4e423e6e291d5a29fa31affcbf7456b706147b6c2f7b3046355bcac4","observation_id":"dff0ef23-24d5-4877-9619-bb4b21cfddf3","resolution":{"observed_at":"2026-08-04T06:07:17.378599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:07:17.547627Z","title":"DEMO: Reframing dialogue interaction with fine-grained element modeling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02499","last_updated":"2026-08-03T17:03:19Z","snapshot_observed_at":"2026-08-16T23:22:17.506296Z","submitted_at":"2026-08-03T17:03:19Z","title":"SWE-Touch: Benchmarking Coding Agents When Users Touch the Code","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-04T06:07:17.547627Z"},"links":{"citing_paper":"/paper/2608.02499"},"observation_digest":"sha256:3f0b66d16c305359593f865b44f8c90a2a21be70d4075636879cf86d9a45e24c","observation_id":"ac295df2-e6d2-4df5-ada4-77a97342ca78","resolution":{"observed_at":"2026-08-04T06:07:17.547627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:07:17.734026Z","title":"Tartaglini, Valerie Chen, Yuxiang Wei, Zijian Wang, Lingming Zhang, Karthik R","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02499","last_updated":"2026-08-03T17:03:19Z","snapshot_observed_at":"2026-08-16T23:22:17.506296Z","submitted_at":"2026-08-03T17:03:19Z","title":"SWE-Touch: Benchmarking Coding Agents When Users Touch the Code","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-04T06:07:17.734026Z"},"links":{"citing_paper":"/paper/2608.02499"},"observation_digest":"sha256:ea228c8fa3c8f5fea1a581ae458d5084191a3134d65200628aad4d6cc3e8e6f6","observation_id":"7ce59624-f277-4f3f-bbf3-639d9cc9c276","resolution":{"observed_at":"2026-08-04T06:07:17.734026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:07:17.880918Z","title":"SWE-Together: Evaluating coding agents in interactive user sessions, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02499","last_updated":"2026-08-03T17:03:19Z","snapshot_observed_at":"2026-08-16T23:22:17.506296Z","submitted_at":"2026-08-03T17:03:19Z","title":"SWE-Touch: Benchmarking Coding Agents When Users Touch the Code","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-04T06:07:17.880918Z"},"links":{"citing_paper":"/paper/2608.02499"},"observation_digest":"sha256:9b1c08c5ae8efd9e05e1cc2c369df36a5360a2c91c9ed97b0c961fb8114c031e","observation_id":"7bad0c37-934a-44e5-8845-fa66cdc9fa74","resolution":{"observed_at":"2026-08-04T06:07:17.880918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:07:18.049214Z","title":"Jimenez, Alexander Wettig, Kilian Lieret, Shunyu Yao, Karthik Narasimhan, and Ofir Press","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02499","last_updated":"2026-08-03T17:03:19Z","snapshot_observed_at":"2026-08-16T23:22:17.506296Z","submitted_at":"2026-08-03T17:03:19Z","title":"SWE-Touch: Benchmarking Coding Agents When Users Touch the Code","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-04T06:07:18.049214Z"},"links":{"citing_paper":"/paper/2608.02499"},"observation_digest":"sha256:fac225c12bf4a7b74af4193c96fd718b704825f79f7a928ed531446bb6ce3e4d","observation_id":"b1d08d3f-5f86-4c23-97af-e670c1c74663","resolution":{"observed_at":"2026-08-04T06:07:18.049214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.21798","last_updated":"2025-05-21T17:21:45Z","snapshot_observed_at":"2026-08-19T12:38:52.976662Z","submitted_at":"2025-04-30T16:56:06Z","title":"SWE-smith: Scaling Data for Software Engineering Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.21798","snapshot_observed_at":"2026-08-04T06:07:18.177158Z","title":"Jimenez, Alexander Wettig, Kabir Khandpur, Yanzhe Zhang, Binyuan Hui, Ofir Press, Ludwig Schmidt, and Diyi Yang","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02499","last_updated":"2026-08-03T17:03:19Z","snapshot_observed_at":"2026-08-16T23:22:17.506296Z","submitted_at":"2026-08-03T17:03:19Z","title":"SWE-Touch: Benchmarking Coding Agents When Users Touch the Code","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-04T06:07:18.177158Z"},"links":{"cited_paper":"/paper/2504.21798","citing_paper":"/paper/2608.02499"},"observation_digest":"sha256:43999f97edf3dd045981e67467c9ec748cc918418a61ccacc5964553dc6d57b0","observation_id":"23917334-0383-4ba8-af63-b3ea5d0695d3","resolution":{"observed_at":"2026-08-04T06:07:18.177158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:07:18.297999Z","title":"Codeclash: Benchmarking goal-oriented software engineering, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02499","last_updated":"2026-08-03T17:03:19Z","snapshot_observed_at":"2026-08-16T23:22:17.506296Z","submitted_at":"2026-08-03T17:03:19Z","title":"SWE-Touch: Benchmarking Coding Agents When Users Touch the Code","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-04T06:07:18.297999Z"},"links":{"citing_paper":"/paper/2608.02499"},"observation_digest":"sha256:e806dda06a5337b49ee0446db2e04149fe198f59cd3325c695baad27f5107e78","observation_id":"578ef09e-bbc8-4d14-a146-97989e66e832","resolution":{"observed_at":"2026-08-04T06:07:18.297999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:07:18.406734Z","title":"Programbench: Can language models rebuild programs from scratch?, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02499","last_updated":"2026-08-03T17:03:19Z","snapshot_observed_at":"2026-08-16T23:22:17.506296Z","submitted_at":"2026-08-03T17:03:19Z","title":"SWE-Touch: Benchmarking Coding Agents When Users Touch the Code","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-04T06:07:18.406734Z"},"links":{"citing_paper":"/paper/2608.02499"},"observation_digest":"sha256:0a2a4e0946a054b4e9fba35f8cfbf88b8dad18ee0f84c0bbf823ce744c131bfc","observation_id":"cf4e3fc9-8028-4918-b400-3bd331276e81","resolution":{"observed_at":"2026-08-04T06:07:18.406734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:07:18.503099Z","title":"Talk2code: A multi-turn interaction benchmark with dual-track evaluation for code generation.Proceedings of the AAAI Conference on Artificial Intelligence, 40(40):34331–34339, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02499","last_updated":"2026-08-03T17:03:19Z","snapshot_observed_at":"2026-08-16T23:22:17.506296Z","submitted_at":"2026-08-03T17:03:19Z","title":"SWE-Touch: Benchmarking Coding Agents When Users Touch the Code","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-04T06:07:18.503099Z"},"links":{"citing_paper":"/paper/2608.02499"},"observation_digest":"sha256:217e97459c13e70ed1cd9f58717e6c37e8f0a6c16fd1b742c18681415bc69f5f","observation_id":"ee96418b-6ec1-4055-bc51-fef0922c9138","resolution":{"observed_at":"2026-08-04T06:07:18.503099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:07:18.574439Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02499","last_updated":"2026-08-03T17:03:19Z","snapshot_observed_at":"2026-08-16T23:22:17.506296Z","submitted_at":"2026-08-03T17:03:19Z","title":"SWE-Touch: Benchmarking Coding Agents When Users Touch the Code","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-04T06:07:18.574439Z"},"links":{"citing_paper":"/paper/2608.02499"},"observation_digest":"sha256:c01cb71342d3a3bb4305105087cf1c805e123a5cdfd2cd509f6c14e8a1a65221","observation_id":"7adcfb37-eea3-4aa9-a5e4-d78c41ad0117","resolution":{"observed_at":"2026-08-04T06:07:18.574439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:07:18.666496Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02499","last_updated":"2026-08-03T17:03:19Z","snapshot_observed_at":"2026-08-16T23:22:17.506296Z","submitted_at":"2026-08-03T17:03:19Z","title":"SWE-Touch: Benchmarking Coding Agents When Users Touch the Code","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-04T06:07:18.666496Z"},"links":{"citing_paper":"/paper/2608.02499"},"observation_digest":"sha256:7dd8a96602c2d8ecf65d0a452f8e938af60a25c8ec5a1b17cf9961c54f438c0f","observation_id":"1ea54d11-6f0b-4f0a-9e92-14c964626653","resolution":{"observed_at":"2026-08-04T06:07:18.666496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:07:18.752968Z","title":"SWE-Explore: Benchmarking how coding agents explore repositories, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02499","last_updated":"2026-08-03T17:03:19Z","snapshot_observed_at":"2026-08-16T23:22:17.506296Z","submitted_at":"2026-08-03T17:03:19Z","title":"SWE-Touch: Benchmarking Coding Agents When Users Touch the Code","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-04T06:07:18.752968Z"},"links":{"citing_paper":"/paper/2608.02499"},"observation_digest":"sha256:278fcd860da086c8a01cfbd16c69cf68835e98291df0278602ff312ec3501f9f","observation_id":"50f3f16a-324f-40f0-91d9-7038c9bf68f5","resolution":{"observed_at":"2026-08-04T06:07:18.752968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:07:18.844990Z","title":"TOM-SWE: User mental modeling for software engineering agents, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02499","last_updated":"2026-08-03T17:03:19Z","snapshot_observed_at":"2026-08-16T23:22:17.506296Z","submitted_at":"2026-08-03T17:03:19Z","title":"SWE-Touch: Benchmarking Coding Agents When Users Touch the Code","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-04T06:07:18.844990Z"},"links":{"citing_paper":"/paper/2608.02499"},"observation_digest":"sha256:ef229f2fba86eecb96af55f34f2a49e8bb1cbdbf8c271ffb9a9b5666ad51137d","observation_id":"509c50cf-7f61-4272-9d85-942eb5f1b176","resolution":{"observed_at":"2026-08-04T06:07:18.844990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:07:18.912600Z","title":"Bigcodebench: Benchmarking code generation with diverse function calls and complex instructions","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02499","last_updated":"2026-08-03T17:03:19Z","snapshot_observed_at":"2026-08-16T23:22:17.506296Z","submitted_at":"2026-08-03T17:03:19Z","title":"SWE-Touch: Benchmarking Coding Agents When Users Touch the Code","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-04T06:07:18.912600Z"},"links":{"citing_paper":"/paper/2608.02499"},"observation_digest":"sha256:7926d3597fc19577f1fe10ed1724e3db951be6609a92d9f9a515299ebfc0c1c5","observation_id":"16cea746-a260-456a-84fb-bd4b2abaec89","resolution":{"observed_at":"2026-08-04T06:07:18.912600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:07:19.066788Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02499","last_updated":"2026-08-03T17:03:19Z","snapshot_observed_at":"2026-08-16T23:22:17.506296Z","submitted_at":"2026-08-03T17:03:19Z","title":"SWE-Touch: Benchmarking Coding Agents When Users Touch the Code","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-04T06:07:19.066788Z"},"links":{"citing_paper":"/paper/2608.02499"},"observation_digest":"sha256:5841b191521d9ca47827c585e2647dfc1466fdfc990f21cdcd77031797770d65","observation_id":"3d61ad65-f825-43ff-ae00-5249f1ba42cf","resolution":{"observed_at":"2026-08-04T06:07:19.066788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:07:19.146574Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02499","last_updated":"2026-08-03T17:03:19Z","snapshot_observed_at":"2026-08-16T23:22:17.506296Z","submitted_at":"2026-08-03T17:03:19Z","title":"SWE-Touch: Benchmarking Coding Agents When Users Touch the Code","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-04T06:07:19.146574Z"},"links":{"citing_paper":"/paper/2608.02499"},"observation_digest":"sha256:03bad4491c6d1faafcaab28cb9d89ec478fbc745f02ce8f47097a496a3845b2d","observation_id":"0f62158f-aaf0-4306-a62d-0c8830c5f646","resolution":{"observed_at":"2026-08-04T06:07:19.146574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:07:19.243786Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02499","last_updated":"2026-08-03T17:03:19Z","snapshot_observed_at":"2026-08-16T23:22:17.506296Z","submitted_at":"2026-08-03T17:03:19Z","title":"SWE-Touch: Benchmarking Coding Agents When Users Touch the Code","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-04T06:07:19.243786Z"},"links":{"citing_paper":"/paper/2608.02499"},"observation_digest":"sha256:6b82285452890933f7f8a9c44429ab079f20d53930cc75d682999291b4077e98","observation_id":"3a8dea33-077a-4b14-ac7f-83a386db26e3","resolution":{"observed_at":"2026-08-04T06:07:19.243786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:07:19.337223Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02499","last_updated":"2026-08-03T17:03:19Z","snapshot_observed_at":"2026-08-16T23:22:17.506296Z","submitted_at":"2026-08-03T17:03:19Z","title":"SWE-Touch: Benchmarking Coding Agents When Users Touch the Code","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-04T06:07:19.337223Z"},"links":{"citing_paper":"/paper/2608.02499"},"observation_digest":"sha256:0f5764616971b918b809a74a3717f5a46bc440e82a7e83f328a1b5e87a6f84d3","observation_id":"c36d7f56-e116-48e7-8cfe-1c64afdb73e2","resolution":{"observed_at":"2026-08-04T06:07:19.337223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:07:19.419524Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02499","last_updated":"2026-08-03T17:03:19Z","snapshot_observed_at":"2026-08-16T23:22:17.506296Z","submitted_at":"2026-08-03T17:03:19Z","title":"SWE-Touch: Benchmarking Coding Agents When Users Touch the Code","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-04T06:07:19.419524Z"},"links":{"citing_paper":"/paper/2608.02499"},"observation_digest":"sha256:872eeddb69f00ca94c9da61833c34893a03a1c9d77abb0629e130a71980b800d","observation_id":"08220aaa-12e3-494a-98b2-fdb5b83a3321","resolution":{"observed_at":"2026-08-04T06:07:19.419524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:07:19.514864Z","title":"Implementation files are those that appear in both the read intersection and the files modified by at least one trajectory","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02499","last_updated":"2026-08-03T17:03:19Z","snapshot_observed_at":"2026-08-16T23:22:17.506296Z","submitted_at":"2026-08-03T17:03:19Z","title":"SWE-Touch: Benchmarking Coding Agents When Users Touch the Code","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-04T06:07:19.514864Z"},"links":{"citing_paper":"/paper/2608.02499"},"observation_digest":"sha256:a888c332e130fed49d41a1c89d39da44adc5449437e8c657af031f41422b6798","observation_id":"1c85fdd4-75e4-441c-826d-0b61f2a3e96c","resolution":{"observed_at":"2026-08-04T06:07:19.514864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:07:19.606443Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02499","last_updated":"2026-08-03T17:03:19Z","snapshot_observed_at":"2026-08-16T23:22:17.506296Z","submitted_at":"2026-08-03T17:03:19Z","title":"SWE-Touch: Benchmarking Coding Agents When Users Touch the Code","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-04T06:07:19.606443Z"},"links":{"citing_paper":"/paper/2608.02499"},"observation_digest":"sha256:32fc575f88d296def6f63a7038e9983f3162278e0dd632fbbec6dc3eba3686cb","observation_id":"9db8fc39-4441-4f7d-884c-239a839a2530","resolution":{"observed_at":"2026-08-04T06:07:19.606443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:07:19.707330Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02499","last_updated":"2026-08-03T17:03:19Z","snapshot_observed_at":"2026-08-16T23:22:17.506296Z","submitted_at":"2026-08-03T17:03:19Z","title":"SWE-Touch: Benchmarking Coding Agents When Users Touch the Code","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-04T06:07:19.707330Z"},"links":{"citing_paper":"/paper/2608.02499"},"observation_digest":"sha256:33ba466180ace46dec0799b7f5197ad8a517303a1870d9771d4a34c7ab386875","observation_id":"9ad76d40-f0ad-49f1-beb6-87a54514c69e","resolution":{"observed_at":"2026-08-04T06:07:19.707330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:07:19.798278Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02499","last_updated":"2026-08-03T17:03:19Z","snapshot_observed_at":"2026-08-16T23:22:17.506296Z","submitted_at":"2026-08-03T17:03:19Z","title":"SWE-Touch: Benchmarking Coding Agents When Users Touch the Code","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-04T06:07:19.798278Z"},"links":{"citing_paper":"/paper/2608.02499"},"observation_digest":"sha256:b302e35a4750c5ffd9d547e8df7926c326a4f10a6558627e54d0d1df8f478f4f","observation_id":"281314b4-e878-41e1-8534-1736a291a9c2","resolution":{"observed_at":"2026-08-04T06:07:19.798278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:07:19.889274Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02499","last_updated":"2026-08-03T17:03:19Z","snapshot_observed_at":"2026-08-16T23:22:17.506296Z","submitted_at":"2026-08-03T17:03:19Z","title":"SWE-Touch: Benchmarking Coding Agents When Users Touch the Code","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-04T06:07:19.889274Z"},"links":{"citing_paper":"/paper/2608.02499"},"observation_digest":"sha256:63ba7bff3a8689a8733f07dc14b06a37fd368d57f59447dfc33c6d1725f0ab19","observation_id":"5dddaf02-6743-432e-b5aa-486c249be15b","resolution":{"observed_at":"2026-08-04T06:07:19.889274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:07:19.981554Z","title":"primary_failure_mode","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02499","last_updated":"2026-08-03T17:03:19Z","snapshot_observed_at":"2026-08-16T23:22:17.506296Z","submitted_at":"2026-08-03T17:03:19Z","title":"SWE-Touch: Benchmarking Coding Agents When Users Touch the Code","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-04T06:07:19.981554Z"},"links":{"citing_paper":"/paper/2608.02499"},"observation_digest":"sha256:416f904b9b0215e88adcf1c8925268fd0d30abb05910f3c5ed77171f04292ee9","observation_id":"2bd4685d-08a8-49fb-bbc6-26624b8bb152","resolution":{"observed_at":"2026-08-04T06:07:19.981554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:07:18.978717Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02499","last_updated":"2026-08-03T17:03:19Z","snapshot_observed_at":"2026-08-16T23:22:17.506296Z","submitted_at":"2026-08-03T17:03:19Z","title":"SWE-Touch: Benchmarking Coding Agents When Users Touch the Code","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-04T06:07:18.978717Z"},"links":{"citing_paper":"/paper/2608.02499"},"observation_digest":"sha256:ba04b2bf3fdff5d8fab4bba040c7f4e34ad611e0824718e9da6fa46cf68159ed","observation_id":"62f8e63b-f084-401d-8a7c-03131b34a066","resolution":{"observed_at":"2026-08-04T06:07:18.978717Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.02499","last_updated":"2026-08-03T17:03:19Z","latest_version":1,"primary_category":"cs.SE","snapshot_observed_at":"2026-08-16T23:22:17.506296Z","submitted_at":"2026-08-03T17:03:19Z","title":"SWE-Touch: Benchmarking Coding Agents When Users Touch the Code"},"reference_resolution":{"displayed":68,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":67,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":68},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 68 of 68 outbound references and 0 inbound Pith citation observations for arXiv:2608.02499."}