{"as_of":"2026-08-14T10:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4c96c686fff7b91112f0b869898811353a621563ed73d9d3f58e73860e364d16","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":41,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T04:39:14.638892Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-09T06:06:01.699658Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.06992","last_updated":"2024-10-10T13:13:09Z","snapshot_observed_at":"2026-08-12T22:27:08.380398Z","submitted_at":"2024-10-09T15:38:53Z","title":"SWE-Bench+: Enhanced Coding Benchmark for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06992","snapshot_observed_at":"2026-08-12T16:38:42.349704Z","title":"Swe-bench+: Enhanced coding benchmark for llms,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13323","last_updated":"2025-03-31T13:02:51Z","snapshot_observed_at":"2026-08-13T04:57:00.540234Z","submitted_at":"2024-11-20T13:46:04Z","title":"Are Large Language Models Memorizing Bug Benchmarks?","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:42.349704Z"},"links":{"cited_paper":"/paper/2410.06992","citing_paper":"/paper/2411.13323"},"observation_digest":"sha256:7e843dc75fd23b7c99d40580270dc0b5528cdb656333eea4c2a20892126bc51b","observation_id":"734c1bc4-4623-40cb-aa05-49b7d4d376e7","resolution":{"observed_at":"2026-08-12T16:38:42.349704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06992","last_updated":"2024-10-10T13:13:09Z","snapshot_observed_at":"2026-08-12T22:27:08.380398Z","submitted_at":"2024-10-09T15:38:53Z","title":"SWE-Bench+: Enhanced Coding Benchmark for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06992","snapshot_observed_at":"2026-08-11T23:02:34.174469Z","title":"Swe-bench+: Enhanced coding benchmark for LLMs,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02883","last_updated":"2024-12-03T22:38:05Z","snapshot_observed_at":"2026-08-12T09:53:53.379621Z","submitted_at":"2024-12-03T22:38:05Z","title":"TDD-Bench Verified: Can LLMs Generate Tests for Issues Before They Get Resolved?","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T23:02:34.174469Z"},"links":{"cited_paper":"/paper/2410.06992","citing_paper":"/paper/2412.02883"},"observation_digest":"sha256:8c86e800f34fc5aae438bb30e946a3601bd0d17ef016d61e89ca0195791649f8","observation_id":"b0720d43-ead2-4c3b-8ad8-dc7370652551","resolution":{"observed_at":"2026-08-11T23:02:34.174469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06992","last_updated":"2024-10-10T13:13:09Z","snapshot_observed_at":"2026-08-12T22:27:08.380398Z","submitted_at":"2024-10-09T15:38:53Z","title":"SWE-Bench+: Enhanced Coding Benchmark for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06992","snapshot_observed_at":"2026-08-10T04:37:16.653625Z","title":"Swe-bench+: Enhanced coding benchmark for llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.18465","last_updated":"2025-01-29T12:01:00Z","snapshot_observed_at":"2026-08-10T18:57:28.400329Z","submitted_at":"2025-01-29T12:01:00Z","title":"Empirical Research on Utilizing LLM-based Agents for Automated Bug Fixing via LangGraph","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-10T04:37:16.653625Z"},"links":{"cited_paper":"/paper/2410.06992","citing_paper":"/paper/2502.18465"},"observation_digest":"sha256:7eaa19136ce14c3943ae71f96ba7c97c599299a477e5a94baca994820030cb70","observation_id":"33aeee14-9ed4-4008-ba10-896630427d4f","resolution":{"observed_at":"2026-08-10T04:37:16.653625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06992","last_updated":"2024-10-10T13:13:09Z","snapshot_observed_at":"2026-08-12T22:27:08.380398Z","submitted_at":"2024-10-09T15:38:53Z","title":"SWE-Bench+: Enhanced Coding Benchmark for LLMs","version":2},"cited_work":{"arxiv_id":"2410.06992","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.06992","snapshot_observed_at":"2026-07-09T06:06:01.699658Z","title":"ArXiv, abs/2410.06992","venue":"cs.SE","work_id":"a0e2ddd0-ff8a-46d5-a2d8-234dae74cc22","year":2024},"citing_paper":{"arxiv_id":"2503.16416","last_updated":"2026-04-23T17:36:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-20T17:59:23Z","title":"Survey on Evaluation of LLM-based Agents","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-22T22:53:21.789769Z"},"links":{"cited_paper":"/paper/2410.06992","citing_paper":"/paper/2503.16416"},"observation_digest":"sha256:e10bb1851b5702bc1517a66255575d2f2b821b470493ac9b7caebe758005b505","observation_id":"d6fd010e-2f4e-401d-ae27-e2b6d8badf8d","resolution":{"observed_at":"2026-05-22T22:55:12.249970Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06992","last_updated":"2024-10-10T13:13:09Z","snapshot_observed_at":"2026-08-12T22:27:08.380398Z","submitted_at":"2024-10-09T15:38:53Z","title":"SWE-Bench+: Enhanced Coding Benchmark for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06992","snapshot_observed_at":"2026-08-07T11:49:00.759281Z","title":"Reem Aleithan, Haoran Xue, Mohammad Mahdi Mohajer, Elijah Nnorom, Gias Uddin, and Song Wang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.01372","last_updated":"2025-06-09T09:01:24Z","snapshot_observed_at":"2026-08-13T21:20:34.845018Z","submitted_at":"2025-06-02T06:59:10Z","title":"AI Scientists Fail Without Strong Implementation Capability","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:00.759281Z"},"links":{"cited_paper":"/paper/2410.06992","citing_paper":"/paper/2506.01372"},"observation_digest":"sha256:dbc25ba6a93ce883251b5f2cb49fea3d0a48e602c8fef660339e9a3e4e38e143","observation_id":"03c1fc2a-f737-4294-88ae-31b39d749740","resolution":{"observed_at":"2026-08-07T11:49:00.759281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06992","last_updated":"2024-10-10T13:13:09Z","snapshot_observed_at":"2026-08-12T22:27:08.380398Z","submitted_at":"2024-10-09T15:38:53Z","title":"SWE-Bench+: Enhanced Coding Benchmark for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06992","snapshot_observed_at":"2026-08-07T04:57:01.065245Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09289","last_updated":"2025-06-10T22:56:49Z","snapshot_observed_at":"2026-08-09T11:07:05.731678Z","submitted_at":"2025-06-10T22:56:49Z","title":"UTBoost: Rigorous Evaluation of Coding Agents on SWE-Bench","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:01.065245Z"},"links":{"cited_paper":"/paper/2410.06992","citing_paper":"/paper/2506.09289"},"observation_digest":"sha256:8b3872e24389261db97c50fe66f3c343666aa728a737b47dd390ae2bde684ef6","observation_id":"28f50129-f104-4548-8edb-974f1bb26935","resolution":{"observed_at":"2026-08-07T04:57:01.065245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06992","last_updated":"2024-10-10T13:13:09Z","snapshot_observed_at":"2026-08-12T22:27:08.380398Z","submitted_at":"2024-10-09T15:38:53Z","title":"SWE-Bench+: Enhanced Coding Benchmark for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06992","snapshot_observed_at":"2026-08-07T06:00:17.909889Z","title":"Swe-bench+: En- hanced coding benchmark for llms,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11102","last_updated":"2025-06-06T17:52:18Z","snapshot_observed_at":"2026-08-07T05:54:56.593167Z","submitted_at":"2025-06-06T17:52:18Z","title":"Evolutionary Perspectives on the Evaluation of LLM-Based AI Agents: A Comprehensive Survey","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T06:00:17.909889Z"},"links":{"cited_paper":"/paper/2410.06992","citing_paper":"/paper/2506.11102"},"observation_digest":"sha256:63ad7db661700c9c80ebbf60b4fd37fe042d49869278389e24db1fed93f20e93","observation_id":"813acb66-9098-400d-ad9c-6e5b2a189a9b","resolution":{"observed_at":"2026-08-07T06:00:17.909889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06992","last_updated":"2024-10-10T13:13:09Z","snapshot_observed_at":"2026-08-12T22:27:08.380398Z","submitted_at":"2024-10-09T15:38:53Z","title":"SWE-Bench+: Enhanced Coding Benchmark for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06992","snapshot_observed_at":"2026-08-06T17:23:31.742334Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11059","last_updated":"2026-07-11T11:56:31Z","snapshot_observed_at":"2026-08-08T15:46:21.795392Z","submitted_at":"2025-07-15T07:52:33Z","title":"SWE-MERA: A Dynamic Benchmark for Agenticly Evaluating Large Language Models on Software Engineering Tasks","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T17:23:31.742334Z"},"links":{"cited_paper":"/paper/2410.06992","citing_paper":"/paper/2507.11059"},"observation_digest":"sha256:ae9a580db9e60d2277ccffa62a6a40411f7d9637041b6061fc103e963c5753a3","observation_id":"d597f088-f028-4633-961e-c630e8acdb65","resolution":{"observed_at":"2026-08-06T17:23:31.742334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06992","last_updated":"2024-10-10T13:13:09Z","snapshot_observed_at":"2026-08-12T22:27:08.380398Z","submitted_at":"2024-10-09T15:38:53Z","title":"SWE-Bench+: Enhanced Coding Benchmark for LLMs","version":2},"cited_work":{"arxiv_id":"2410.06992","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.06992","snapshot_observed_at":"2026-07-09T06:06:01.699658Z","title":"ArXiv, abs/2410.06992","venue":"cs.SE","work_id":"a0e2ddd0-ff8a-46d5-a2d8-234dae74cc22","year":2024},"citing_paper":{"arxiv_id":"2507.21046","last_updated":"2026-01-16T20:59:08Z","snapshot_observed_at":"2026-08-01T06:32:44.461162Z","submitted_at":"2025-07-28T17:59:05Z","title":"A Survey of Self-Evolving Agents: What, When, How, and Where to Evolve on the Path to Artificial Super Intelligence","version":4},"reference_index":108,"source":"arxiv_source","source_observed_at":"2026-05-14T22:23:14.621091Z"},"links":{"cited_paper":"/paper/2410.06992","citing_paper":"/paper/2507.21046"},"observation_digest":"sha256:ebcd3fa875af516509e1c16004045df8a061036001870fe2d7c5cb9223a26a8e","observation_id":"5fe3e2bd-be30-4584-8c04-edcb7807487d","resolution":{"observed_at":"2026-05-14T22:23:15.793324Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06992","last_updated":"2024-10-10T13:13:09Z","snapshot_observed_at":"2026-08-12T22:27:08.380398Z","submitted_at":"2024-10-09T15:38:53Z","title":"SWE-Bench+: Enhanced Coding Benchmark for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06992","snapshot_observed_at":"2026-08-05T18:33:01.591675Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.14511","last_updated":"2025-08-27T21:45:23Z","snapshot_observed_at":"2026-08-13T13:50:39.662899Z","submitted_at":"2025-08-20T08:03:00Z","title":"What You See Is What It Does: A Structural Pattern for Legible Software","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T18:33:01.591675Z"},"links":{"cited_paper":"/paper/2410.06992","citing_paper":"/paper/2508.14511"},"observation_digest":"sha256:e01733eed4e22781604d4a375dbf72a4865ca9927c114011324a85a469a85b1a","observation_id":"1c4d3d22-d861-4f52-a7f0-60a2169c301b","resolution":{"observed_at":"2026-08-05T18:33:01.591675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06992","last_updated":"2024-10-10T13:13:09Z","snapshot_observed_at":"2026-08-12T22:27:08.380398Z","submitted_at":"2024-10-09T15:38:53Z","title":"SWE-Bench+: Enhanced Coding Benchmark for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06992","snapshot_observed_at":"2026-08-04T23:57:05.740344Z","title":"2024.SWE-Bench+: Enhanced Coding Benchmark for LLMs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06216","last_updated":"2026-06-24T17:45:50Z","snapshot_observed_at":"2026-08-13T09:31:22.402669Z","submitted_at":"2025-09-07T21:40:10Z","title":"Agentic Software Engineering: Foundational Pillars and a Research Roadmap","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T23:57:05.740344Z"},"links":{"cited_paper":"/paper/2410.06992","citing_paper":"/paper/2509.06216"},"observation_digest":"sha256:39f7bd2bc8a8e9950894560935c7c8d37ee49746ed91a56bdd4b69a9cbd61b27","observation_id":"c44fd470-a130-4890-8f22-92769b81ba68","resolution":{"observed_at":"2026-08-04T23:57:05.740344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06992","last_updated":"2024-10-10T13:13:09Z","snapshot_observed_at":"2026-08-12T22:27:08.380398Z","submitted_at":"2024-10-09T15:38:53Z","title":"SWE-Bench+: Enhanced Coding Benchmark for LLMs","version":2},"cited_work":{"arxiv_id":"2410.06992","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.06992","snapshot_observed_at":"2026-07-09T06:06:01.699658Z","title":"ArXiv, abs/2410.06992","venue":"cs.SE","work_id":"a0e2ddd0-ff8a-46d5-a2d8-234dae74cc22","year":2024},"citing_paper":{"arxiv_id":"2509.16941","last_updated":"2025-11-14T22:00:03Z","snapshot_observed_at":"2026-08-10T12:32:55.999823Z","submitted_at":"2025-09-21T06:28:17Z","title":"SWE-Bench Pro: Can AI Agents Solve Long-Horizon Software Engineering Tasks?","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-12T13:48:53.691192Z"},"links":{"cited_paper":"/paper/2410.06992","citing_paper":"/paper/2509.16941"},"observation_digest":"sha256:6a22d4011ec5c052149df0aab8fa9a33d5d5d271bef2cdc674001cb80cad7d02","observation_id":"b58572c5-3108-493a-9244-811664d4d9a7","resolution":{"observed_at":"2026-05-12T13:48:53.720917Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06992","last_updated":"2024-10-10T13:13:09Z","snapshot_observed_at":"2026-08-12T22:27:08.380398Z","submitted_at":"2024-10-09T15:38:53Z","title":"SWE-Bench+: Enhanced Coding Benchmark for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06992","snapshot_observed_at":"2026-08-04T14:53:14.713072Z","title":"Swe-bench+: Enhanced coding benchmark for llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.22504","last_updated":"2026-05-28T15:39:50Z","snapshot_observed_at":"2026-08-10T18:33:15.104681Z","submitted_at":"2025-09-26T15:46:14Z","title":"Estimating the Empowerment of Language Model Agents","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-04T14:53:14.713072Z"},"links":{"cited_paper":"/paper/2410.06992","citing_paper":"/paper/2509.22504"},"observation_digest":"sha256:ba62f3422e5f653d7de6d4db94e75022be11876a373d90f143d704eaff4ed54f","observation_id":"3d751a8e-f0a8-45e3-9085-a24626676f65","resolution":{"observed_at":"2026-08-04T14:53:14.713072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06992","last_updated":"2024-10-10T13:13:09Z","snapshot_observed_at":"2026-08-12T22:27:08.380398Z","submitted_at":"2024-10-09T15:38:53Z","title":"SWE-Bench+: Enhanced Coding Benchmark for LLMs","version":2},"cited_work":{"arxiv_id":"2410.06992","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.06992","snapshot_observed_at":"2026-07-09T06:06:01.699658Z","title":"ArXiv, abs/2410.06992","venue":"cs.SE","work_id":"a0e2ddd0-ff8a-46d5-a2d8-234dae74cc22","year":2024},"citing_paper":{"arxiv_id":"2512.04329","last_updated":"2026-05-16T14:54:11Z","snapshot_observed_at":"2026-08-05T16:56:16.382896Z","submitted_at":"2025-12-03T23:28:30Z","title":"A Retrieval-Augmented Generation Approach to Extracting Algorithmic Logic from Neural Networks","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-21T17:51:20.393473Z"},"links":{"cited_paper":"/paper/2410.06992","citing_paper":"/paper/2512.04329"},"observation_digest":"sha256:45a223ebdea8b9ee0c3dc703ff9861dcffc5b363fb76d886f8ed0b9dc06f297a","observation_id":"4e515c7b-4519-4917-a171-49dd09df8e32","resolution":{"observed_at":"2026-05-21T17:54:18.588382Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06992","last_updated":"2024-10-10T13:13:09Z","snapshot_observed_at":"2026-08-12T22:27:08.380398Z","submitted_at":"2024-10-09T15:38:53Z","title":"SWE-Bench+: Enhanced Coding Benchmark for LLMs","version":2},"cited_work":{"arxiv_id":"2410.06992","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.06992","snapshot_observed_at":"2026-07-09T06:06:01.699658Z","title":"ArXiv, abs/2410.06992","venue":"cs.SE","work_id":"a0e2ddd0-ff8a-46d5-a2d8-234dae74cc22","year":2024},"citing_paper":{"arxiv_id":"2604.06111","last_updated":"2026-04-10T03:07:44Z","snapshot_observed_at":"2026-08-11T03:14:40.685759Z","submitted_at":"2026-04-07T17:21:28Z","title":"AgentCE-Bench: Agent Configurable Evaluation with Scalable Horizons and Controllable Difficulty under Lightweight Environments","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T19:07:46.077831Z"},"links":{"cited_paper":"/paper/2410.06992","citing_paper":"/paper/2604.06111"},"observation_digest":"sha256:554e16006b8f98f786cb7f0d2b8953c38c6f6afbdb1fd255da08630ed6cd545a","observation_id":"dd23f142-01f3-45c8-b6ae-3612b4efa103","resolution":{"observed_at":"2026-05-10T23:30:49.340961Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06992","last_updated":"2024-10-10T13:13:09Z","snapshot_observed_at":"2026-08-12T22:27:08.380398Z","submitted_at":"2024-10-09T15:38:53Z","title":"SWE-Bench+: Enhanced Coding Benchmark for LLMs","version":2},"cited_work":{"arxiv_id":"2410.06992","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.06992","snapshot_observed_at":"2026-07-09T06:06:01.699658Z","title":"ArXiv, abs/2410.06992","venue":"cs.SE","work_id":"a0e2ddd0-ff8a-46d5-a2d8-234dae74cc22","year":2024},"citing_paper":{"arxiv_id":"2604.06861","last_updated":"2026-04-08T09:22:30Z","snapshot_observed_at":"2026-08-11T13:39:28.051083Z","submitted_at":"2026-04-08T09:22:30Z","title":"REAgent: Requirement-Driven LLM Agents for Software Issue Resolution","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T17:56:32.201591Z"},"links":{"cited_paper":"/paper/2410.06992","citing_paper":"/paper/2604.06861"},"observation_digest":"sha256:fd7e3e04811e3663716c367a59d772c93d14563ee2233604f6718288784ed673","observation_id":"78123d6e-1e37-40cf-883e-f4213a472ff7","resolution":{"observed_at":"2026-05-11T05:51:00.253944Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06992","last_updated":"2024-10-10T13:13:09Z","snapshot_observed_at":"2026-08-12T22:27:08.380398Z","submitted_at":"2024-10-09T15:38:53Z","title":"SWE-Bench+: Enhanced Coding Benchmark for LLMs","version":2},"cited_work":{"arxiv_id":"2410.06992","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.06992","snapshot_observed_at":"2026-07-09T06:06:01.699658Z","title":"ArXiv, abs/2410.06992","venue":"cs.SE","work_id":"a0e2ddd0-ff8a-46d5-a2d8-234dae74cc22","year":2024},"citing_paper":{"arxiv_id":"2604.19741","last_updated":"2026-06-03T18:09:47Z","snapshot_observed_at":"2026-08-12T19:41:37.821685Z","submitted_at":"2026-04-21T17:59:03Z","title":"CityRAG: Stepping Into a City via Spatially-Grounded Video Generation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-05T07:19:01.989427Z"},"links":{"cited_paper":"/paper/2410.06992","citing_paper":"/paper/2604.19741"},"observation_digest":"sha256:1aa219bd4e59c9822d57d7cac52f1a9d7bc4f1b5b7d90205e928049e980419d7","observation_id":"9d788d73-1faf-4d00-a682-5796b9fbe2a3","resolution":{"observed_at":"2026-07-05T07:20:46.367552Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06992","last_updated":"2024-10-10T13:13:09Z","snapshot_observed_at":"2026-08-12T22:27:08.380398Z","submitted_at":"2024-10-09T15:38:53Z","title":"SWE-Bench+: Enhanced Coding Benchmark for LLMs","version":2},"cited_work":{"arxiv_id":"2410.06992","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.06992","snapshot_observed_at":"2026-07-09T06:06:01.699658Z","title":"ArXiv, abs/2410.06992","venue":"cs.SE","work_id":"a0e2ddd0-ff8a-46d5-a2d8-234dae74cc22","year":2024},"citing_paper":{"arxiv_id":"2604.19742","last_updated":"2026-04-21T17:59:16Z","snapshot_observed_at":"2026-08-14T01:43:38.253182Z","submitted_at":"2026-04-21T17:59:16Z","title":"PlayCoder: Making LLM-Generated GUI Code Playable","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T02:02:01.395176Z"},"links":{"cited_paper":"/paper/2410.06992","citing_paper":"/paper/2604.19742"},"observation_digest":"sha256:1b8d51fc6db1b158184f1daeca27c17da233279a188604a62709d5dbe6d34fc7","observation_id":"8644411e-088a-42ff-8e80-a56acb2fa379","resolution":{"observed_at":"2026-05-11T13:16:18.332469Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06992","last_updated":"2024-10-10T13:13:09Z","snapshot_observed_at":"2026-08-12T22:27:08.380398Z","submitted_at":"2024-10-09T15:38:53Z","title":"SWE-Bench+: Enhanced Coding Benchmark for LLMs","version":2},"cited_work":{"arxiv_id":"2410.06992","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.06992","snapshot_observed_at":"2026-07-09T06:06:01.699658Z","title":"ArXiv, abs/2410.06992","venue":"cs.SE","work_id":"a0e2ddd0-ff8a-46d5-a2d8-234dae74cc22","year":2024},"citing_paper":{"arxiv_id":"2605.02244","last_updated":"2026-05-04T05:37:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T05:37:36Z","title":"The Conversations Beneath the Code: Triadic Data for Long-Horizon Software Engineering Agents","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-08T18:30:21.856024Z"},"links":{"cited_paper":"/paper/2410.06992","citing_paper":"/paper/2605.02244"},"observation_digest":"sha256:5978bebbf604c6090a7aaa04e9bc6115515531dd58b900be23303e01686f33bf","observation_id":"514c8e86-c50e-4e64-8c78-2c2856b3ce60","resolution":{"observed_at":"2026-05-09T06:25:39.786230Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06992","last_updated":"2024-10-10T13:13:09Z","snapshot_observed_at":"2026-08-12T22:27:08.380398Z","submitted_at":"2024-10-09T15:38:53Z","title":"SWE-Bench+: Enhanced Coding Benchmark for LLMs","version":2},"cited_work":{"arxiv_id":"2410.06992","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.06992","snapshot_observed_at":"2026-07-09T06:06:01.699658Z","title":"ArXiv, abs/2410.06992","venue":"cs.SE","work_id":"a0e2ddd0-ff8a-46d5-a2d8-234dae74cc22","year":2024},"citing_paper":{"arxiv_id":"2605.07769","last_updated":"2026-05-08T14:10:00Z","snapshot_observed_at":"2026-08-11T16:32:21.186802Z","submitted_at":"2026-05-08T14:10:00Z","title":"Coding Agents Don't Know When to Act","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-11T02:43:21.911437Z"},"links":{"cited_paper":"/paper/2410.06992","citing_paper":"/paper/2605.07769"},"observation_digest":"sha256:220a63e5bcb656f1861d3e6f3e3f421f0c9c7d5caac079cb3c27604e01997e61","observation_id":"b3ec8b0d-554a-4710-89d4-434401d9793e","resolution":{"observed_at":"2026-05-11T02:45:58.074555Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06992","last_updated":"2024-10-10T13:13:09Z","snapshot_observed_at":"2026-08-12T22:27:08.380398Z","submitted_at":"2024-10-09T15:38:53Z","title":"SWE-Bench+: Enhanced Coding Benchmark for LLMs","version":2},"cited_work":{"arxiv_id":"2410.06992","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.06992","snapshot_observed_at":"2026-07-09T06:06:01.699658Z","title":"ArXiv, abs/2410.06992","venue":"cs.SE","work_id":"a0e2ddd0-ff8a-46d5-a2d8-234dae74cc22","year":2024},"citing_paper":{"arxiv_id":"2605.21996","last_updated":"2026-05-21T04:54:55Z","snapshot_observed_at":"2026-07-06T23:32:25.286443Z","submitted_at":"2026-05-21T04:54:55Z","title":"From Patches to Trajectories: Privileged Process Supervision for Software-Engineering Agents","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-22T05:13:26.057531Z"},"links":{"cited_paper":"/paper/2410.06992","citing_paper":"/paper/2605.21996"},"observation_digest":"sha256:5c1b27b29aba73acd05a04aa6d1ad8a0a7c390532455c3f9367446f901d5e688","observation_id":"32d1af8b-1f24-4007-a172-c56beb2cce83","resolution":{"observed_at":"2026-05-22T05:14:37.590109Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06992","last_updated":"2024-10-10T13:13:09Z","snapshot_observed_at":"2026-08-12T22:27:08.380398Z","submitted_at":"2024-10-09T15:38:53Z","title":"SWE-Bench+: Enhanced Coding Benchmark for LLMs","version":2},"cited_work":{"arxiv_id":"2410.06992","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.06992","snapshot_observed_at":"2026-07-09T06:06:01.699658Z","title":"ArXiv, abs/2410.06992","venue":"cs.SE","work_id":"a0e2ddd0-ff8a-46d5-a2d8-234dae74cc22","year":2024},"citing_paper":{"arxiv_id":"2605.26321","last_updated":"2026-05-25T20:44:17Z","snapshot_observed_at":"2026-07-06T23:36:11.031436Z","submitted_at":"2026-05-25T20:44:17Z","title":"Anchor: Mitigating Artifact Drift in Agent Benchmark Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-29T21:29:57.626069Z"},"links":{"cited_paper":"/paper/2410.06992","citing_paper":"/paper/2605.26321"},"observation_digest":"sha256:9c6386b4183c301c2d2a738f133ffa5537259dc2b0ea2a05fd8bb15649ae9689","observation_id":"91c5ad04-f5b0-404d-811d-91d711ec4459","resolution":{"observed_at":"2026-06-29T21:33:59.138712Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06992","last_updated":"2024-10-10T13:13:09Z","snapshot_observed_at":"2026-08-12T22:27:08.380398Z","submitted_at":"2024-10-09T15:38:53Z","title":"SWE-Bench+: Enhanced Coding Benchmark for LLMs","version":2},"cited_work":{"arxiv_id":"2410.06992","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.06992","snapshot_observed_at":"2026-07-09T06:06:01.699658Z","title":"ArXiv, abs/2410.06992","venue":"cs.SE","work_id":"a0e2ddd0-ff8a-46d5-a2d8-234dae74cc22","year":2024},"citing_paper":{"arxiv_id":"2605.29277","last_updated":"2026-05-28T02:52:58Z","snapshot_observed_at":"2026-08-12T13:42:11.162623Z","submitted_at":"2026-05-28T02:52:58Z","title":"Code-QA-Bench: Separating Code Reasoning from Documentation Memorization in Repository-Level QA","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-29T07:00:07.102425Z"},"links":{"cited_paper":"/paper/2410.06992","citing_paper":"/paper/2605.29277"},"observation_digest":"sha256:fdb2af2bcb0575411b0a8b4b362a7fa4d291bccb61d7eaf0e4485a22c7ac36f3","observation_id":"c5f9e042-b8c3-45b1-aea9-4fe307b18575","resolution":{"observed_at":"2026-06-29T07:03:12.916559Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06992","last_updated":"2024-10-10T13:13:09Z","snapshot_observed_at":"2026-08-12T22:27:08.380398Z","submitted_at":"2024-10-09T15:38:53Z","title":"SWE-Bench+: Enhanced Coding Benchmark for LLMs","version":2},"cited_work":{"arxiv_id":"2410.06992","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.06992","snapshot_observed_at":"2026-07-09T06:06:01.699658Z","title":"ArXiv, abs/2410.06992","venue":"cs.SE","work_id":"a0e2ddd0-ff8a-46d5-a2d8-234dae74cc22","year":2024},"citing_paper":{"arxiv_id":"2606.00750","last_updated":"2026-05-30T14:34:02Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:34:02Z","title":"I-WebGenBench : Evaluating Interactivity in LLM-Generated Scientific Web Applications","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-28T18:53:18.645984Z"},"links":{"cited_paper":"/paper/2410.06992","citing_paper":"/paper/2606.00750"},"observation_digest":"sha256:87a7bf0e00ed03bc1df8f4854e9904238361339c9d3fec9ea8149efdd5cc062f","observation_id":"5013e746-5aff-4c80-a489-d021058eac91","resolution":{"observed_at":"2026-06-28T19:42:36.211391Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06992","last_updated":"2024-10-10T13:13:09Z","snapshot_observed_at":"2026-08-12T22:27:08.380398Z","submitted_at":"2024-10-09T15:38:53Z","title":"SWE-Bench+: Enhanced Coding Benchmark for LLMs","version":2},"cited_work":{"arxiv_id":"2410.06992","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.06992","snapshot_observed_at":"2026-07-09T06:06:01.699658Z","title":"ArXiv, abs/2410.06992","venue":"cs.SE","work_id":"a0e2ddd0-ff8a-46d5-a2d8-234dae74cc22","year":2024},"citing_paper":{"arxiv_id":"2606.05570","last_updated":"2026-06-04T01:42:40Z","snapshot_observed_at":"2026-08-02T22:19:59.617747Z","submitted_at":"2026-06-04T01:42:40Z","title":"TensorBench: Benchmarking Coding Agents on a Compiler-Based Tensor Framework","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-28T01:55:59.002171Z"},"links":{"cited_paper":"/paper/2410.06992","citing_paper":"/paper/2606.05570"},"observation_digest":"sha256:e5499b25332ca6db50433177716437ef638f5fdf341544e5fa9254020331fd83","observation_id":"bcfeee33-2178-4232-aa02-7999abfd4782","resolution":{"observed_at":"2026-07-02T12:46:56.493122Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06992","last_updated":"2024-10-10T13:13:09Z","snapshot_observed_at":"2026-08-12T22:27:08.380398Z","submitted_at":"2024-10-09T15:38:53Z","title":"SWE-Bench+: Enhanced Coding Benchmark for LLMs","version":2},"cited_work":{"arxiv_id":"2410.06992","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.06992","snapshot_observed_at":"2026-07-09T06:06:01.699658Z","title":"ArXiv, abs/2410.06992","venue":"cs.SE","work_id":"a0e2ddd0-ff8a-46d5-a2d8-234dae74cc22","year":2024},"citing_paper":{"arxiv_id":"2606.05770","last_updated":"2026-06-04T06:53:45Z","snapshot_observed_at":"2026-08-14T09:58:06.259862Z","submitted_at":"2026-06-04T06:53:45Z","title":"Human Oversight and Overload: Two Hidden and Costly Burdens of AI-Assisted Software Engineering","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-28T00:32:16.740994Z"},"links":{"cited_paper":"/paper/2410.06992","citing_paper":"/paper/2606.05770"},"observation_digest":"sha256:597d36816872dca534f5bade4aa498cd32e1fe35b38d835d5a20d672170dc6a8","observation_id":"74a6e7ec-23b4-46e1-86ea-3b71d5864453","resolution":{"observed_at":"2026-07-02T14:17:03.537753Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06992","last_updated":"2024-10-10T13:13:09Z","snapshot_observed_at":"2026-08-12T22:27:08.380398Z","submitted_at":"2024-10-09T15:38:53Z","title":"SWE-Bench+: Enhanced Coding Benchmark for LLMs","version":2},"cited_work":{"arxiv_id":"2410.06992","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.06992","snapshot_observed_at":"2026-07-09T06:06:01.699658Z","title":"ArXiv, abs/2410.06992","venue":"cs.SE","work_id":"a0e2ddd0-ff8a-46d5-a2d8-234dae74cc22","year":2024},"citing_paper":{"arxiv_id":"2606.17799","last_updated":"2026-07-18T22:14:13Z","snapshot_observed_at":"2026-08-02T11:05:59.500924Z","submitted_at":"2026-06-16T11:21:01Z","title":"Position: Coding Benchmarks Are Misaligned with Agentic Software Engineering","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-26T23:48:58.497927Z"},"links":{"cited_paper":"/paper/2410.06992","citing_paper":"/paper/2606.17799"},"observation_digest":"sha256:54013f7a0f8552e969296c0ea13e92892bf3d794ecef009bbd5732a2d4e94438","observation_id":"96715c5b-8349-4eba-9f9d-686873e19d27","resolution":{"observed_at":"2026-07-03T22:08:58.918137Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06992","last_updated":"2024-10-10T13:13:09Z","snapshot_observed_at":"2026-08-12T22:27:08.380398Z","submitted_at":"2024-10-09T15:38:53Z","title":"SWE-Bench+: Enhanced Coding Benchmark for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06992","snapshot_observed_at":"2026-08-02T11:05:59.944027Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.17799","last_updated":"2026-07-18T22:14:13Z","snapshot_observed_at":"2026-08-02T11:05:59.500924Z","submitted_at":"2026-06-16T11:21:01Z","title":"Position: Coding Benchmarks Are Misaligned with Agentic Software Engineering","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T11:05:59.944027Z"},"links":{"cited_paper":"/paper/2410.06992","citing_paper":"/paper/2606.17799"},"observation_digest":"sha256:29918bc202e522cfd7edfd90c923789530510653f07dd1cab05bfe160a72a74d","observation_id":"c8044ef7-40fa-4f3b-84f6-8e453a2a5e20","resolution":{"observed_at":"2026-08-02T11:05:59.944027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06992","last_updated":"2024-10-10T13:13:09Z","snapshot_observed_at":"2026-08-12T22:27:08.380398Z","submitted_at":"2024-10-09T15:38:53Z","title":"SWE-Bench+: Enhanced Coding Benchmark for LLMs","version":2},"cited_work":{"arxiv_id":"2410.06992","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.06992","snapshot_observed_at":"2026-07-09T06:06:01.699658Z","title":"ArXiv, abs/2410.06992","venue":"cs.SE","work_id":"a0e2ddd0-ff8a-46d5-a2d8-234dae74cc22","year":2024},"citing_paper":{"arxiv_id":"2606.18284","last_updated":"2026-06-10T02:04:29Z","snapshot_observed_at":"2026-08-14T01:56:24.853455Z","submitted_at":"2026-06-10T02:04:29Z","title":"Breaking the Solver Bottleneck: Training Task Generators at the Learnable Frontier","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-06-27T10:36:09.211639Z"},"links":{"cited_paper":"/paper/2410.06992","citing_paper":"/paper/2606.18284"},"observation_digest":"sha256:0a90553e40ab7d2292a4811eb2ce3a56acbe408752641445888538276439c80e","observation_id":"e17a204b-9cf9-4428-a277-273c667f27df","resolution":{"observed_at":"2026-07-03T08:57:48.243351Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06992","last_updated":"2024-10-10T13:13:09Z","snapshot_observed_at":"2026-08-12T22:27:08.380398Z","submitted_at":"2024-10-09T15:38:53Z","title":"SWE-Bench+: Enhanced Coding Benchmark for LLMs","version":2},"cited_work":{"arxiv_id":"2410.06992","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.06992","snapshot_observed_at":"2026-07-09T06:06:01.699658Z","title":"ArXiv, abs/2410.06992","venue":"cs.SE","work_id":"a0e2ddd0-ff8a-46d5-a2d8-234dae74cc22","year":2024},"citing_paper":{"arxiv_id":"2606.22417","last_updated":"2026-06-21T10:10:51Z","snapshot_observed_at":"2026-08-12T11:35:23.836021Z","submitted_at":"2026-06-21T10:10:51Z","title":"Code Isn't Memory: A Structural Codebase Index Inside a Coding Agent","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-26T10:59:52.756992Z"},"links":{"cited_paper":"/paper/2410.06992","citing_paper":"/paper/2606.22417"},"observation_digest":"sha256:4916efc72718a2d3760ce5b25a18001a6e265c31a4813dbcf805c62099e76284","observation_id":"97eb9eae-2037-4c27-a592-2107b09e0fb7","resolution":{"observed_at":"2026-07-04T08:49:41.772450Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06992","last_updated":"2024-10-10T13:13:09Z","snapshot_observed_at":"2026-08-12T22:27:08.380398Z","submitted_at":"2024-10-09T15:38:53Z","title":"SWE-Bench+: Enhanced Coding Benchmark for LLMs","version":2},"cited_work":{"arxiv_id":"2410.06992","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.06992","snapshot_observed_at":"2026-07-09T06:06:01.699658Z","title":"ArXiv, abs/2410.06992","venue":"cs.SE","work_id":"a0e2ddd0-ff8a-46d5-a2d8-234dae74cc22","year":2024},"citing_paper":{"arxiv_id":"2606.25973","last_updated":"2026-06-24T15:45:38Z","snapshot_observed_at":"2026-08-07T03:45:14.020128Z","submitted_at":"2026-06-24T15:45:38Z","title":"Helpful or Harmful? Evaluating LLM-Assisted Vulnerability Patching via a Human Study","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-25T19:02:45.109478Z"},"links":{"cited_paper":"/paper/2410.06992","citing_paper":"/paper/2606.25973"},"observation_digest":"sha256:3ea5fcbaf8b327a21d04766af9cf1cb0ebae320d2afe3704c3d4d41cc8154416","observation_id":"d34adb41-8833-431e-8aca-e387f96dc721","resolution":{"observed_at":"2026-07-04T21:10:09.273861Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06992","last_updated":"2024-10-10T13:13:09Z","snapshot_observed_at":"2026-08-12T22:27:08.380398Z","submitted_at":"2024-10-09T15:38:53Z","title":"SWE-Bench+: Enhanced Coding Benchmark for LLMs","version":2},"cited_work":{"arxiv_id":"2410.06992","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.06992","snapshot_observed_at":"2026-07-09T06:06:01.699658Z","title":"ArXiv, abs/2410.06992","venue":"cs.SE","work_id":"a0e2ddd0-ff8a-46d5-a2d8-234dae74cc22","year":2024},"citing_paper":{"arxiv_id":"2607.00053","last_updated":"2026-06-30T01:46:26Z","snapshot_observed_at":"2026-07-07T00:05:41.920778Z","submitted_at":"2026-06-30T01:46:26Z","title":"SWE-Router: Routing in Multi-turn Agentic Software Engineering Tasks","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-07-02T18:19:43.146102Z"},"links":{"cited_paper":"/paper/2410.06992","citing_paper":"/paper/2607.00053"},"observation_digest":"sha256:6bd0f0fa56c9f007b80ad88f80c6781644aa1ea1d20c8331203452a13dc81b6f","observation_id":"21d2878d-09f4-4eec-995d-416e3da6ae80","resolution":{"observed_at":"2026-07-02T18:37:16.530676Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06992","last_updated":"2024-10-10T13:13:09Z","snapshot_observed_at":"2026-08-12T22:27:08.380398Z","submitted_at":"2024-10-09T15:38:53Z","title":"SWE-Bench+: Enhanced Coding Benchmark for LLMs","version":2},"cited_work":{"arxiv_id":"2410.06992","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.06992","snapshot_observed_at":"2026-07-09T06:06:01.699658Z","title":"ArXiv, abs/2410.06992","venue":"cs.SE","work_id":"a0e2ddd0-ff8a-46d5-a2d8-234dae74cc22","year":2024},"citing_paper":{"arxiv_id":"2607.06411","last_updated":"2026-07-19T18:49:59Z","snapshot_observed_at":"2026-08-12T02:44:21.439415Z","submitted_at":"2026-07-07T15:41:22Z","title":"RuBench: A Repository-Level Agentic Coding Benchmark with Natively Authored Russian Task Specifications","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-08T06:55:40.830922Z"},"links":{"cited_paper":"/paper/2410.06992","citing_paper":"/paper/2607.06411"},"observation_digest":"sha256:6c633cc422b28b38fc7ec4f05976aaf63194f25245c4acf9adeda8f7e2428f30","observation_id":"a818805b-ade7-4898-bed3-a26264c355fc","resolution":{"observed_at":"2026-07-08T07:04:44.545510Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06992","last_updated":"2024-10-10T13:13:09Z","snapshot_observed_at":"2026-08-12T22:27:08.380398Z","submitted_at":"2024-10-09T15:38:53Z","title":"SWE-Bench+: Enhanced Coding Benchmark for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06992","snapshot_observed_at":"2026-08-02T08:21:49.775844Z","title":"Aleithan, H","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.06411","last_updated":"2026-07-19T18:49:59Z","snapshot_observed_at":"2026-08-12T02:44:21.439415Z","submitted_at":"2026-07-07T15:41:22Z","title":"RuBench: A Repository-Level Agentic Coding Benchmark with Natively Authored Russian Task Specifications","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T08:21:49.775844Z"},"links":{"cited_paper":"/paper/2410.06992","citing_paper":"/paper/2607.06411"},"observation_digest":"sha256:12fec37e34e98163f6ccb9bb76d3fbf3a69e4a479993cc16749c7a7b69a57886","observation_id":"7f097b81-7b4e-4618-9fa7-f37081d6ea79","resolution":{"observed_at":"2026-08-02T08:21:49.775844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06992","last_updated":"2024-10-10T13:13:09Z","snapshot_observed_at":"2026-08-12T22:27:08.380398Z","submitted_at":"2024-10-09T15:38:53Z","title":"SWE-Bench+: Enhanced Coding Benchmark for LLMs","version":2},"cited_work":{"arxiv_id":"2410.06992","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.06992","snapshot_observed_at":"2026-07-09T06:06:01.699658Z","title":"ArXiv, abs/2410.06992","venue":"cs.SE","work_id":"a0e2ddd0-ff8a-46d5-a2d8-234dae74cc22","year":2024},"citing_paper":{"arxiv_id":"2607.07593","last_updated":"2026-07-08T16:13:15Z","snapshot_observed_at":"2026-08-12T15:34:24.300540Z","submitted_at":"2026-07-08T16:13:15Z","title":"What Makes a Good Bug Report for an AI Agent?","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-09T05:57:49.053868Z"},"links":{"cited_paper":"/paper/2410.06992","citing_paper":"/paper/2607.07593"},"observation_digest":"sha256:edf3f5b6ee828ca24e3c87998433c0356faf5b5575315771e1741d0d87d69493","observation_id":"6ac850aa-93ec-4f35-af31-facf3bda70a1","resolution":{"observed_at":"2026-07-09T06:06:01.701427Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06992","last_updated":"2024-10-10T13:13:09Z","snapshot_observed_at":"2026-08-12T22:27:08.380398Z","submitted_at":"2024-10-09T15:38:53Z","title":"SWE-Bench+: Enhanced Coding Benchmark for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06992","snapshot_observed_at":"2026-08-02T03:01:40.820412Z","title":"Shuai Bai, Keqin Chen, Xuejing Liu, Jialin Wang, Wen- bin Ge, Sibo Song, Kai Dang, Peng Wang, Shijie Wang, Jun Tang, and 1 others","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14049","last_updated":"2026-07-15T17:16:43Z","snapshot_observed_at":"2026-08-14T02:17:03.626179Z","submitted_at":"2026-07-15T17:16:43Z","title":"Deep Interaction: An Efficient Human-AI Interaction Method for Large Reasoning Models","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-02T03:01:40.820412Z"},"links":{"cited_paper":"/paper/2410.06992","citing_paper":"/paper/2607.14049"},"observation_digest":"sha256:927b6a3a77d8b5be9442e1f40676b45a3ce51b8f10f84289600c38e1f171aa6c","observation_id":"b0533e7d-7473-4b5e-bacb-f0655eb0f325","resolution":{"observed_at":"2026-08-02T03:01:40.820412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06992","last_updated":"2024-10-10T13:13:09Z","snapshot_observed_at":"2026-08-12T22:27:08.380398Z","submitted_at":"2024-10-09T15:38:53Z","title":"SWE-Bench+: Enhanced Coding Benchmark for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06992","snapshot_observed_at":"2026-07-31T03:01:03.575538Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28587","last_updated":"2026-08-04T09:26:35Z","snapshot_observed_at":"2026-08-14T01:35:56.016741Z","submitted_at":"2026-07-30T17:42:44Z","title":"PAIChecker: Uncovering and Checking PR-Issue Misalignment in SWE-Bench-Like Benchmarks","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-31T03:01:03.575538Z"},"links":{"cited_paper":"/paper/2410.06992","citing_paper":"/paper/2607.28587"},"observation_digest":"sha256:5afc68f85f7c67d1c3fe1d6ec828709a40ed4077912416a4f59cb0e388035052","observation_id":"9ad5f78a-feae-458e-8159-6525e23e059e","resolution":{"observed_at":"2026-07-31T03:01:03.575538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06992","last_updated":"2024-10-10T13:13:09Z","snapshot_observed_at":"2026-08-12T22:27:08.380398Z","submitted_at":"2024-10-09T15:38:53Z","title":"SWE-Bench+: Enhanced Coding Benchmark for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06992","snapshot_observed_at":"2026-08-05T04:24:46.006089Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28587","last_updated":"2026-08-04T09:26:35Z","snapshot_observed_at":"2026-08-14T01:35:56.016741Z","submitted_at":"2026-07-30T17:42:44Z","title":"PAIChecker: Uncovering and Checking PR-Issue Misalignment in SWE-Bench-Like Benchmarks","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T04:24:46.006089Z"},"links":{"cited_paper":"/paper/2410.06992","citing_paper":"/paper/2607.28587"},"observation_digest":"sha256:a4b766829643225c59b6a960326231a2c20d712c7d1daf8f0c8950d01735bdaf","observation_id":"4d0f7d26-67ee-4a82-911d-41e3cf95e93a","resolution":{"observed_at":"2026-08-05T04:24:46.006089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06992","last_updated":"2024-10-10T13:13:09Z","snapshot_observed_at":"2026-08-12T22:27:08.380398Z","submitted_at":"2024-10-09T15:38:53Z","title":"SWE-Bench+: Enhanced Coding Benchmark for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06992","snapshot_observed_at":"2026-08-06T19:02:40.376652Z","title":"arXiv preprint arXiv:2410.06992 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04682","last_updated":"2026-08-05T10:50:01Z","snapshot_observed_at":"2026-08-14T01:07:28.578487Z","submitted_at":"2026-08-05T10:50:01Z","title":"Active-SWE: Benchmarking Coding Agents for Proactive Bug Fixing without Issue Reports","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T19:02:40.376652Z"},"links":{"cited_paper":"/paper/2410.06992","citing_paper":"/paper/2608.04682"},"observation_digest":"sha256:c167a48b69afb0d3eb03c4d5b66a53b9265b19401d61c342b10a79b0b243d215","observation_id":"64ba4e39-b21a-4b0a-9c41-5cddd61a9a18","resolution":{"observed_at":"2026-08-06T19:02:40.376652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06992","last_updated":"2024-10-10T13:13:09Z","snapshot_observed_at":"2026-08-12T22:27:08.380398Z","submitted_at":"2024-10-09T15:38:53Z","title":"SWE-Bench+: Enhanced Coding Benchmark for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06992","snapshot_observed_at":"2026-08-10T23:01:35.771043Z","title":"SWE-bench+: Enhanced coding benchmark for LLMs, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06663","last_updated":"2026-08-07T00:19:48Z","snapshot_observed_at":"2026-08-14T07:59:30.675858Z","submitted_at":"2026-08-07T00:19:48Z","title":"The Horizon Gap: Planning, Memory, Execution, Training, and Evaluation for Long-Horizon LLM Agents","version":1},"reference_index":103,"source":"pdf_text","source_observed_at":"2026-08-10T23:01:35.771043Z"},"links":{"cited_paper":"/paper/2410.06992","citing_paper":"/paper/2608.06663"},"observation_digest":"sha256:9a1682ba2e2912412dd396ea90aee129e7823d7ccdaec552e2e12d36efe655a7","observation_id":"b4660dad-0725-4a6e-ae3e-a9009c2266ea","resolution":{"observed_at":"2026-08-10T23:01:35.771043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06992","last_updated":"2024-10-10T13:13:09Z","snapshot_observed_at":"2026-08-12T22:27:08.380398Z","submitted_at":"2024-10-09T15:38:53Z","title":"SWE-Bench+: Enhanced Coding Benchmark for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06992","snapshot_observed_at":"2026-08-14T04:39:14.638892Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08413","last_updated":"2026-08-09T02:08:34Z","snapshot_observed_at":"2026-08-14T04:33:55.544807Z","submitted_at":"2026-08-09T02:08:34Z","title":"Tangent: An Empirical Study of Testing Practices for LLM-Based Agent Applications","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-14T04:39:14.638892Z"},"links":{"cited_paper":"/paper/2410.06992","citing_paper":"/paper/2608.08413"},"observation_digest":"sha256:015eb6c378a67ecf336e46a0e8c7a5b2aecb3218cbd97b58f478f6ddb61f35ca","observation_id":"220ce96b-cc93-4b25-b1a9-999fa60dbb0f","resolution":{"observed_at":"2026-08-14T04:39:14.638892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2410.06992/citation-record","integrity":"/paper/2410.06992/integrity","json":"/paper/2410.06992/citation-record.json","paper":"/paper/2410.06992"},"outbound":[],"paper":{"arxiv_id":"2410.06992","last_updated":"2024-10-10T13:13:09Z","latest_version":2,"primary_category":"cs.SE","snapshot_observed_at":"2026-08-12T22:27:08.380398Z","submitted_at":"2024-10-09T15:38:53Z","title":"SWE-Bench+: Enhanced Coding Benchmark for LLMs"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 41 inbound Pith citation observations for arXiv:2410.06992."}