{"as_of":"2026-08-15T01:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4bbd9e97aeaa5a577d1c5cfbef79184f72aeed01ba16569896f4586b08666795","coverage":[{"denominator":67,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":67,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T10:33:05.202398Z","state":"measured"},{"denominator":67,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":67,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.09802/citation-record","integrity":"/paper/2608.09802/integrity","json":"/paper/2608.09802/citation-record.json","paper":"/paper/2608.09802"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:33:04.983947Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09802","last_updated":"2026-08-10T16:23:19Z","snapshot_observed_at":"2026-08-14T15:39:09.388241Z","submitted_at":"2026-08-10T16:23:19Z","title":"SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T10:33:04.983947Z"},"links":{"citing_paper":"/paper/2608.09802"},"observation_digest":"sha256:7bfaa477592979b945b521df990625b117b4dc8b4b40929d42c30d849c1fc09f","observation_id":"0671fe7f-6128-41ee-a384-16e3157ea835","resolution":{"observed_at":"2026-08-11T10:33:04.983947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-11T10:33:04.987588Z","title":"arXiv preprint arXiv:2107.03374 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09802","last_updated":"2026-08-10T16:23:19Z","snapshot_observed_at":"2026-08-14T15:39:09.388241Z","submitted_at":"2026-08-10T16:23:19Z","title":"SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T10:33:04.987588Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2608.09802"},"observation_digest":"sha256:cbc9a6ae88da7a853a6604f80e5fd123a9404be64008791b72e4e5a552aff321","observation_id":"ba4065f9-2d11-4e8b-b181-cbb4471e3da7","resolution":{"observed_at":"2026-08-11T10:33:04.987588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.09938","last_updated":"2021-11-08T21:16:44Z","snapshot_observed_at":"2026-08-14T15:19:05.440904Z","submitted_at":"2021-05-20T17:58:42Z","title":"Measuring Coding Challenge Competence With APPS","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.09938","snapshot_observed_at":"2026-08-11T10:33:04.991376Z","title":"arXiv preprint arXiv:2105.09938 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09802","last_updated":"2026-08-10T16:23:19Z","snapshot_observed_at":"2026-08-14T15:39:09.388241Z","submitted_at":"2026-08-10T16:23:19Z","title":"SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T10:33:04.991376Z"},"links":{"cited_paper":"/paper/2105.09938","citing_paper":"/paper/2608.09802"},"observation_digest":"sha256:28aca6ee1acd29172ea84182a14173a903456e2353352d8f786c413cae4764fe","observation_id":"d8b8dc27-fd28-41e8-8f99-2d590b709fe5","resolution":{"observed_at":"2026-08-11T10:33:04.991376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-02T19:23:53.535075Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-11T10:33:04.994874Z","title":"arXiv preprint arXiv:2108.07732 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09802","last_updated":"2026-08-10T16:23:19Z","snapshot_observed_at":"2026-08-14T15:39:09.388241Z","submitted_at":"2026-08-10T16:23:19Z","title":"SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T10:33:04.994874Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2608.09802"},"observation_digest":"sha256:4a5458d45121cc0d1683a6a4c5ce32364958ac7a13186c0aa639c0b1092e0b14","observation_id":"7f6dfb29-f4cd-485a-afc5-f8a68a7cbc57","resolution":{"observed_at":"2026-08-11T10:33:04.994874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07974","last_updated":"2024-06-06T17:41:21Z","snapshot_observed_at":"2026-08-13T09:04:30.125777Z","submitted_at":"2024-03-12T17:58:04Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07974","snapshot_observed_at":"2026-08-11T10:33:04.998387Z","title":"arXiv preprint arXiv:2403.07974 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09802","last_updated":"2026-08-10T16:23:19Z","snapshot_observed_at":"2026-08-14T15:39:09.388241Z","submitted_at":"2026-08-10T16:23:19Z","title":"SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T10:33:04.998387Z"},"links":{"cited_paper":"/paper/2403.07974","citing_paper":"/paper/2608.09802"},"observation_digest":"sha256:258eed7d8bcd6fb7e3dd3c1b4eff813a40d63f7101779a33ca951cfd9cc9a065","observation_id":"1b7e1822-6621-44a2-aef2-1dee6c9af36b","resolution":{"observed_at":"2026-08-11T10:33:04.998387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:33:05.002065Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09802","last_updated":"2026-08-10T16:23:19Z","snapshot_observed_at":"2026-08-14T15:39:09.388241Z","submitted_at":"2026-08-10T16:23:19Z","title":"SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T10:33:05.002065Z"},"links":{"citing_paper":"/paper/2608.09802"},"observation_digest":"sha256:45b6f9ce409b0968222229b669f5aec22b0563bc4e999daeff3237286ae4f638","observation_id":"ba8f3c37-19fd-4e78-98f1-23491d8a0227","resolution":{"observed_at":"2026-08-11T10:33:05.002065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03859","last_updated":"2024-10-04T18:48:58Z","snapshot_observed_at":"2026-08-12T22:30:27.761243Z","submitted_at":"2024-10-04T18:48:58Z","title":"SWE-bench Multimodal: Do AI Systems Generalize to Visual Software Domains?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03859","snapshot_observed_at":"2026-08-11T10:33:05.005760Z","title":"arXiv preprint arXiv:2410.03859 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09802","last_updated":"2026-08-10T16:23:19Z","snapshot_observed_at":"2026-08-14T15:39:09.388241Z","submitted_at":"2026-08-10T16:23:19Z","title":"SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T10:33:05.005760Z"},"links":{"cited_paper":"/paper/2410.03859","citing_paper":"/paper/2608.09802"},"observation_digest":"sha256:b166ddc0b32cd5e9f5f3dca93182e104fcd7c9637d8edb872c01293f43a978be","observation_id":"da65c2c5-ff8e-4cb8-8987-d510c8d416a4","resolution":{"observed_at":"2026-08-11T10:33:05.005760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.16941","last_updated":"2025-11-14T22:00:03Z","snapshot_observed_at":"2026-08-10T12:32:55.999823Z","submitted_at":"2025-09-21T06:28:17Z","title":"SWE-Bench Pro: Can AI Agents Solve Long-Horizon Software Engineering Tasks?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.16941","snapshot_observed_at":"2026-08-11T10:33:05.009583Z","title":"arXiv preprint arXiv:2509.16941 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09802","last_updated":"2026-08-10T16:23:19Z","snapshot_observed_at":"2026-08-14T15:39:09.388241Z","submitted_at":"2026-08-10T16:23:19Z","title":"SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T10:33:05.009583Z"},"links":{"cited_paper":"/paper/2509.16941","citing_paper":"/paper/2608.09802"},"observation_digest":"sha256:a6ef75d89139bb9902d36e1d1e92f9edb394ab8b59e4f924b05ca638512c8fd2","observation_id":"984a445d-8033-4f82-ba73-4789abb31792","resolution":{"observed_at":"2026-08-11T10:33:05.009583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.18470","last_updated":"2026-04-04T09:52:04Z","snapshot_observed_at":"2026-07-30T13:30:43.108201Z","submitted_at":"2025-12-20T19:08:15Z","title":"SWE-EVO: Benchmarking Coding Agents in Long-Horizon Software Evolution Scenarios","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.18470","snapshot_observed_at":"2026-08-11T10:33:05.013212Z","title":"arXiv preprint arXiv:2512.18470 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09802","last_updated":"2026-08-10T16:23:19Z","snapshot_observed_at":"2026-08-14T15:39:09.388241Z","submitted_at":"2026-08-10T16:23:19Z","title":"SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T10:33:05.013212Z"},"links":{"cited_paper":"/paper/2512.18470","citing_paper":"/paper/2608.09802"},"observation_digest":"sha256:336327e6dcf79711809671314ce04aab7cb5b131fa2a99da6443c130d3ec2357","observation_id":"e61cd33a-7aa9-438d-9865-eb2f6cb247b9","resolution":{"observed_at":"2026-08-11T10:33:05.013212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:33:05.016766Z","title":"arXiv preprint arXiv:2505.20411 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09802","last_updated":"2026-08-10T16:23:19Z","snapshot_observed_at":"2026-08-14T15:39:09.388241Z","submitted_at":"2026-08-10T16:23:19Z","title":"SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T10:33:05.016766Z"},"links":{"citing_paper":"/paper/2608.09802"},"observation_digest":"sha256:715517128934c28af064b157a46fabfe9031072417548ec53f30b6b2f6d86dad","observation_id":"c50d99b2-2016-4d90-9ff2-20ba87f1c09d","resolution":{"observed_at":"2026-08-11T10:33:05.016766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:33:06.269251Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":"87741cf6-e246-414b-a13d-a4984d3ec3a6","year":null},"citing_paper":{"arxiv_id":"2608.09802","last_updated":"2026-08-10T16:23:19Z","snapshot_observed_at":"2026-08-14T15:39:09.388241Z","submitted_at":"2026-08-10T16:23:19Z","title":"SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T10:33:05.019960Z"},"links":{"citing_paper":"/paper/2608.09802"},"observation_digest":"sha256:a5e0c3a32733df365ef4f82d9335e8875bf9d4d1abfd7c8c3855ae9d8e71e4eb","observation_id":"c0d96752-88ba-4c31-8c76-00e5ddae7d3e","resolution":{"observed_at":"2026-08-11T10:33:06.272400Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:33:06.259664Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":"be385c26-d2aa-4b5d-a787-55705f4d48de","year":null},"citing_paper":{"arxiv_id":"2608.09802","last_updated":"2026-08-10T16:23:19Z","snapshot_observed_at":"2026-08-14T15:39:09.388241Z","submitted_at":"2026-08-10T16:23:19Z","title":"SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T10:33:05.023134Z"},"links":{"citing_paper":"/paper/2608.09802"},"observation_digest":"sha256:361f312f7c714e0fb58922f31a3155bcf72980393c068e6c7aacab2d1782cfa8","observation_id":"42608fbb-d9c5-4640-92ea-c7c511186ed0","resolution":{"observed_at":"2026-08-11T10:33:06.262675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:33:05.026501Z","title":"arXiv preprint arXiv:2506.10954 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09802","last_updated":"2026-08-10T16:23:19Z","snapshot_observed_at":"2026-08-14T15:39:09.388241Z","submitted_at":"2026-08-10T16:23:19Z","title":"SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T10:33:05.026501Z"},"links":{"citing_paper":"/paper/2608.09802"},"observation_digest":"sha256:d5a22740fdb0650c12f9a0df103e524d471447430518a73e704f2911bf5d99b8","observation_id":"979c20a9-a755-42df-b7f3-8fced91b6e1c","resolution":{"observed_at":"2026-08-11T10:33:05.026501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:33:06.249540Z","title":"Findings of the Association for Computational Linguistics: ACL 2026 , pages=","venue":null,"work_id":"ceaae0d5-d7a5-4e8b-a27a-79707845c010","year":2026},"citing_paper":{"arxiv_id":"2608.09802","last_updated":"2026-08-10T16:23:19Z","snapshot_observed_at":"2026-08-14T15:39:09.388241Z","submitted_at":"2026-08-10T16:23:19Z","title":"SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T10:33:05.029600Z"},"links":{"citing_paper":"/paper/2608.09802"},"observation_digest":"sha256:67697ad2f357262cafeee8d231073ee728f18406378f2666e80e6d11fc745a29","observation_id":"621873e8-03d4-4472-893d-c4d838f58423","resolution":{"observed_at":"2026-08-11T10:33:06.253300Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.11868","last_updated":"2026-01-17T01:29:30Z","snapshot_observed_at":"2026-07-06T22:41:58.373427Z","submitted_at":"2026-01-17T01:29:30Z","title":"Terminal-Bench: Benchmarking Agents on Hard, Realistic Tasks in Command Line Interfaces","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.11868","snapshot_observed_at":"2026-08-11T10:33:05.032815Z","title":"arXiv preprint arXiv:2601.11868 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09802","last_updated":"2026-08-10T16:23:19Z","snapshot_observed_at":"2026-08-14T15:39:09.388241Z","submitted_at":"2026-08-10T16:23:19Z","title":"SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T10:33:05.032815Z"},"links":{"cited_paper":"/paper/2601.11868","citing_paper":"/paper/2608.09802"},"observation_digest":"sha256:d541ebca51d2a300945b5e44f6b31168388d341ef30ce8d20b7d88eb8afdf2af","observation_id":"4d37490d-44e5-4d0e-aa94-90a9af43c851","resolution":{"observed_at":"2026-08-11T10:33:05.032815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07832","last_updated":"2025-03-10T20:23:24Z","snapshot_observed_at":"2026-08-09T09:23:38.032509Z","submitted_at":"2025-03-10T20:23:24Z","title":"RefactorBench: Evaluating Stateful Reasoning in Language Agents Through Code","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07832","snapshot_observed_at":"2026-08-11T10:33:05.036133Z","title":"arXiv preprint arXiv:2503.07832 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09802","last_updated":"2026-08-10T16:23:19Z","snapshot_observed_at":"2026-08-14T15:39:09.388241Z","submitted_at":"2026-08-10T16:23:19Z","title":"SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T10:33:05.036133Z"},"links":{"cited_paper":"/paper/2503.07832","citing_paper":"/paper/2608.09802"},"observation_digest":"sha256:1b46ac72e6c1aff2a984544ed72411c1b8f69ab1ee296d4373def78219cee95c","observation_id":"d4aaed29-35da-48fc-be1e-9e68ab3a9048","resolution":{"observed_at":"2026-08-11T10:33:05.036133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:33:05.039582Z","title":"arXiv preprint arXiv:2602.03712 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09802","last_updated":"2026-08-10T16:23:19Z","snapshot_observed_at":"2026-08-14T15:39:09.388241Z","submitted_at":"2026-08-10T16:23:19Z","title":"SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T10:33:05.039582Z"},"links":{"citing_paper":"/paper/2608.09802"},"observation_digest":"sha256:25e4640bb6c1a60cb78f086954762c75c0c60b640e4b678bde53c8da9a6e82ff","observation_id":"d6a52527-4614-416a-8710-bcebae9d8cc6","resolution":{"observed_at":"2026-08-11T10:33:05.039582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:33:05.042611Z","title":"arXiv preprint arXiv:2511.04824 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09802","last_updated":"2026-08-10T16:23:19Z","snapshot_observed_at":"2026-08-14T15:39:09.388241Z","submitted_at":"2026-08-10T16:23:19Z","title":"SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T10:33:05.042611Z"},"links":{"citing_paper":"/paper/2608.09802"},"observation_digest":"sha256:0caa73bbaf12f526e7726a105d4f188c5169482490d909d8086fc4a54a7c7897","observation_id":"25e89b9f-932b-4eac-8061-950416898b20","resolution":{"observed_at":"2026-08-11T10:33:05.042611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:33:06.239254Z","title":"IEEE Transactions on Software Engineering , volume=","venue":null,"work_id":"6eaa0fc9-04f7-4304-88ac-ed2feb50ecd4","year":2025},"citing_paper":{"arxiv_id":"2608.09802","last_updated":"2026-08-10T16:23:19Z","snapshot_observed_at":"2026-08-14T15:39:09.388241Z","submitted_at":"2026-08-10T16:23:19Z","title":"SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-11T10:33:05.045569Z"},"links":{"citing_paper":"/paper/2608.09802"},"observation_digest":"sha256:7d32cfff61a6e22d7e295dc89b36535aca631706203d55cc972817f617640c36","observation_id":"ad755029-fadb-4876-9b01-0b3fe4063600","resolution":{"observed_at":"2026-08-11T10:33:06.242884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:33:06.228495Z","title":"IEEE Transactions on Software Engineering , year=","venue":null,"work_id":"70eedcc3-1ebc-4e40-becc-28fa1a7d8dc2","year":null},"citing_paper":{"arxiv_id":"2608.09802","last_updated":"2026-08-10T16:23:19Z","snapshot_observed_at":"2026-08-14T15:39:09.388241Z","submitted_at":"2026-08-10T16:23:19Z","title":"SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T10:33:05.048552Z"},"links":{"citing_paper":"/paper/2608.09802"},"observation_digest":"sha256:f81205080e0828f6bb7ef99eee9c6506e909c2fc2c0d2fbec41000759ce2bfc0","observation_id":"8cb2ddda-2b35-443f-a163-d793dba49ea9","resolution":{"observed_at":"2026-08-11T10:33:06.232370Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:33:05.051716Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09802","last_updated":"2026-08-10T16:23:19Z","snapshot_observed_at":"2026-08-14T15:39:09.388241Z","submitted_at":"2026-08-10T16:23:19Z","title":"SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T10:33:05.051716Z"},"links":{"citing_paper":"/paper/2608.09802"},"observation_digest":"sha256:3447a289d8439aac85d1312062053f203d6f01498aff703b10feb535b16c7f40","observation_id":"40df2ad2-d5a7-4e39-996e-e87e448198d1","resolution":{"observed_at":"2026-08-11T10:33:05.051716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04132","last_updated":"2024-03-07T01:22:38Z","snapshot_observed_at":"2026-08-02T17:55:33.750637Z","submitted_at":"2024-03-07T01:22:38Z","title":"Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04132","snapshot_observed_at":"2026-08-11T10:33:05.054754Z","title":"arXiv preprint arXiv:2403.04132 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09802","last_updated":"2026-08-10T16:23:19Z","snapshot_observed_at":"2026-08-14T15:39:09.388241Z","submitted_at":"2026-08-10T16:23:19Z","title":"SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T10:33:05.054754Z"},"links":{"cited_paper":"/paper/2403.04132","citing_paper":"/paper/2608.09802"},"observation_digest":"sha256:1b41dd3a1bc67167a8c4b2a1aa3335696d07cd0d6fd6e17e6bdad43d72599482","observation_id":"01a76607-3310-4624-8f98-49138acca355","resolution":{"observed_at":"2026-08-11T10:33:05.054754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12784","last_updated":"2025-04-05T00:07:35Z","snapshot_observed_at":"2026-07-31T04:18:41.491400Z","submitted_at":"2024-10-16T17:58:19Z","title":"JudgeBench: A Benchmark for Evaluating LLM-based Judges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12784","snapshot_observed_at":"2026-08-11T10:33:05.058082Z","title":"arXiv preprint arXiv:2410.12784 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09802","last_updated":"2026-08-10T16:23:19Z","snapshot_observed_at":"2026-08-14T15:39:09.388241Z","submitted_at":"2026-08-10T16:23:19Z","title":"SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T10:33:05.058082Z"},"links":{"cited_paper":"/paper/2410.12784","citing_paper":"/paper/2608.09802"},"observation_digest":"sha256:cd0ca1792df814d0beb3c7e0923caea28da25dd7116988c47d0d51477eac9216","observation_id":"02f6759b-a952-4f8f-ba1f-98ad898b5125","resolution":{"observed_at":"2026-08-11T10:33:05.058082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16614","last_updated":"2025-02-23T15:36:43Z","snapshot_observed_at":"2026-08-10T20:16:41.516189Z","submitted_at":"2025-02-23T15:36:43Z","title":"CodeCriticBench: A Holistic Code Critique Benchmark for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.16614","snapshot_observed_at":"2026-08-11T10:33:05.061353Z","title":"arXiv preprint arXiv:2502.16614 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09802","last_updated":"2026-08-10T16:23:19Z","snapshot_observed_at":"2026-08-14T15:39:09.388241Z","submitted_at":"2026-08-10T16:23:19Z","title":"SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-11T10:33:05.061353Z"},"links":{"cited_paper":"/paper/2502.16614","citing_paper":"/paper/2608.09802"},"observation_digest":"sha256:3f5d092421a95c1edc018d3402fcc6b8977a379e59cecd4cd31f70f05752ad1b","observation_id":"ece6602b-a382-473c-8e8a-48fcc6dc7e16","resolution":{"observed_at":"2026-08-11T10:33:05.061353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:33:06.212520Z","title":"Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=","venue":null,"work_id":"0637b82f-b729-40fd-9459-6b608e9c3c1a","year":null},"citing_paper":{"arxiv_id":"2608.09802","last_updated":"2026-08-10T16:23:19Z","snapshot_observed_at":"2026-08-14T15:39:09.388241Z","submitted_at":"2026-08-10T16:23:19Z","title":"SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T10:33:05.065007Z"},"links":{"citing_paper":"/paper/2608.09802"},"observation_digest":"sha256:568bbd410d04e741283bd1e557b7f9ef57ea4f7abfaecf830928e1205519e945","observation_id":"2a255c00-b754-4ee2-8dce-90c2a3be19dd","resolution":{"observed_at":"2026-08-11T10:33:06.215860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:33:06.202012Z","title":"Proceedings of the 31st International Conference on Computational Linguistics , pages=","venue":null,"work_id":"e8229a34-fde1-4642-a2a0-1642de9be827","year":null},"citing_paper":{"arxiv_id":"2608.09802","last_updated":"2026-08-10T16:23:19Z","snapshot_observed_at":"2026-08-14T15:39:09.388241Z","submitted_at":"2026-08-10T16:23:19Z","title":"SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-11T10:33:05.067844Z"},"links":{"citing_paper":"/paper/2608.09802"},"observation_digest":"sha256:153563dec0a62718daedd5a20e61d382d2cf50610ad4896ee4bea806759a0485","observation_id":"db050c1e-b44e-40e8-8c10-cd973fec65ee","resolution":{"observed_at":"2026-08-11T10:33:06.205727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:33:05.070967Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09802","last_updated":"2026-08-10T16:23:19Z","snapshot_observed_at":"2026-08-14T15:39:09.388241Z","submitted_at":"2026-08-10T16:23:19Z","title":"SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-11T10:33:05.070967Z"},"links":{"citing_paper":"/paper/2608.09802"},"observation_digest":"sha256:0acd8506d012e27fbefdd41ccfc07046835e67925808f15ebeac9732632d854b","observation_id":"5318006a-30e2-46d7-993f-25f879d27782","resolution":{"observed_at":"2026-08-11T10:33:05.070967Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:33:06.187868Z","title":"2025 , howpublished =","venue":null,"work_id":"05aabb63-b5f7-49ae-a798-ad4ee609786e","year":2025},"citing_paper":{"arxiv_id":"2608.09802","last_updated":"2026-08-10T16:23:19Z","snapshot_observed_at":"2026-08-14T15:39:09.388241Z","submitted_at":"2026-08-10T16:23:19Z","title":"SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-11T10:33:05.074298Z"},"links":{"citing_paper":"/paper/2608.09802"},"observation_digest":"sha256:16d7c8569ebb2094d0463a81b94cf41724aeff9cad2f4734a431fde24a8913e8","observation_id":"443b405a-d8e2-45b9-a100-ab8637ec457f","resolution":{"observed_at":"2026-08-11T10:33:06.190967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:33:06.178443Z","title":"2026 , howpublished =","venue":null,"work_id":"7dafc36b-6415-42ca-971c-c7cc106b4c9a","year":2026},"citing_paper":{"arxiv_id":"2608.09802","last_updated":"2026-08-10T16:23:19Z","snapshot_observed_at":"2026-08-14T15:39:09.388241Z","submitted_at":"2026-08-10T16:23:19Z","title":"SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-11T10:33:05.077625Z"},"links":{"citing_paper":"/paper/2608.09802"},"observation_digest":"sha256:3cd68bbf22e631b44e46a307bea4526d9cc1717db96cb0a527e4024dab025044","observation_id":"dfec91d2-8b0a-408f-bc2c-059ff393977d","resolution":{"observed_at":"2026-08-11T10:33:06.181601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:33:06.168930Z","title":"How We Compare Model Quality at","venue":null,"work_id":"922ce518-5556-4b88-a6a3-078f5c3a93c7","year":null},"citing_paper":{"arxiv_id":"2608.09802","last_updated":"2026-08-10T16:23:19Z","snapshot_observed_at":"2026-08-14T15:39:09.388241Z","submitted_at":"2026-08-10T16:23:19Z","title":"SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-11T10:33:05.080506Z"},"links":{"citing_paper":"/paper/2608.09802"},"observation_digest":"sha256:51547b1f70d1e2bca475e83083df2804b8b6c4f4b2d8d97c6362709843ecaa2e","observation_id":"72f292ff-db2f-4c91-89c1-74bc5d4d15f1","resolution":{"observed_at":"2026-08-11T10:33:06.172541Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14499","last_updated":"2026-07-10T21:48:09Z","snapshot_observed_at":"2026-08-07T16:54:09.525403Z","submitted_at":"2025-03-18T17:59:31Z","title":"Measuring AI Ability to Complete Long Software Tasks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14499","snapshot_observed_at":"2026-08-11T10:33:05.083332Z","title":"arXiv preprint arXiv:2503.14499 , volume=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09802","last_updated":"2026-08-10T16:23:19Z","snapshot_observed_at":"2026-08-14T15:39:09.388241Z","submitted_at":"2026-08-10T16:23:19Z","title":"SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-11T10:33:05.083332Z"},"links":{"cited_paper":"/paper/2503.14499","citing_paper":"/paper/2608.09802"},"observation_digest":"sha256:8b226ca015fbf8deb8c0996bcdcc141c28c70a83f1b8aa03ac020a67ddc6e698","observation_id":"b186b56c-43b8-455a-a9c2-40ec02736268","resolution":{"observed_at":"2026-08-11T10:33:05.083332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:33:05.086937Z","title":"Findings of the Association for Computational Linguistics: ACL 2026 , pages=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09802","last_updated":"2026-08-10T16:23:19Z","snapshot_observed_at":"2026-08-14T15:39:09.388241Z","submitted_at":"2026-08-10T16:23:19Z","title":"SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-11T10:33:05.086937Z"},"links":{"citing_paper":"/paper/2608.09802"},"observation_digest":"sha256:56c9a3f620536b33e3798e199e2e362c89d740d92950d8b33cf012fc38a2c90a","observation_id":"e4842b13-56af-4084-b7e1-253247be46b4","resolution":{"observed_at":"2026-08-11T10:33:05.086937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.00729","last_updated":"2026-02-28T16:25:04Z","snapshot_observed_at":"2026-08-14T11:50:51.747505Z","submitted_at":"2026-02-28T16:25:04Z","title":"Qwen3-Coder-Next Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.00729","snapshot_observed_at":"2026-08-11T10:33:05.090287Z","title":"arXiv preprint arXiv:2603.00729 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09802","last_updated":"2026-08-10T16:23:19Z","snapshot_observed_at":"2026-08-14T15:39:09.388241Z","submitted_at":"2026-08-10T16:23:19Z","title":"SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-11T10:33:05.090287Z"},"links":{"cited_paper":"/paper/2603.00729","citing_paper":"/paper/2608.09802"},"observation_digest":"sha256:374f5fb3f82d1053a753d13002ec1503961a517c87d0737a1523b2e1ecd3fd80","observation_id":"8a5184c6-c769-47c3-9a81-73ee291514b3","resolution":{"observed_at":"2026-08-11T10:33:05.090287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11931","last_updated":"2024-06-17T13:51:35Z","snapshot_observed_at":"2026-08-14T04:42:19.578053Z","submitted_at":"2024-06-17T13:51:35Z","title":"DeepSeek-Coder-V2: Breaking the Barrier of Closed-Source Models in Code Intelligence","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11931","snapshot_observed_at":"2026-08-11T10:33:05.093659Z","title":"arXiv preprint arXiv:2406.11931 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09802","last_updated":"2026-08-10T16:23:19Z","snapshot_observed_at":"2026-08-14T15:39:09.388241Z","submitted_at":"2026-08-10T16:23:19Z","title":"SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-11T10:33:05.093659Z"},"links":{"cited_paper":"/paper/2406.11931","citing_paper":"/paper/2608.09802"},"observation_digest":"sha256:cd9ec3c6dada3496c423c58f1bce06202c6b5fb1cbb881aefbd19606c6726813","observation_id":"731ffd53-be13-4f03-a94d-8e327639f055","resolution":{"observed_at":"2026-08-11T10:33:05.093659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.15763","last_updated":"2026-02-24T10:44:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-17T17:50:56Z","title":"GLM-5: from Vibe Coding to Agentic Engineering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.15763","snapshot_observed_at":"2026-08-11T10:33:05.097132Z","title":"arXiv preprint arXiv:2602.15763 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09802","last_updated":"2026-08-10T16:23:19Z","snapshot_observed_at":"2026-08-14T15:39:09.388241Z","submitted_at":"2026-08-10T16:23:19Z","title":"SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-11T10:33:05.097132Z"},"links":{"cited_paper":"/paper/2602.15763","citing_paper":"/paper/2608.09802"},"observation_digest":"sha256:6c34bb211b0e186e2de5df7adc5269c8da3ad664caedd4818ffb49f657d3a519","observation_id":"8230e813-5a2d-47ef-ae72-f0b568d5a1dd","resolution":{"observed_at":"2026-08-11T10:33:05.097132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20534","last_updated":"2026-02-03T04:57:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-28T05:35:43Z","title":"Kimi K2: Open Agentic Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.20534","snapshot_observed_at":"2026-08-11T10:33:05.100868Z","title":"arXiv preprint arXiv:2507.20534 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09802","last_updated":"2026-08-10T16:23:19Z","snapshot_observed_at":"2026-08-14T15:39:09.388241Z","submitted_at":"2026-08-10T16:23:19Z","title":"SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-11T10:33:05.100868Z"},"links":{"cited_paper":"/paper/2507.20534","citing_paper":"/paper/2608.09802"},"observation_digest":"sha256:0f9f7343ed4024c2692ba75cf1c4db0ea8082d7c3ee5077894d451c829667b56","observation_id":"6c5135ea-a973-4a49-8c48-c8e5152a42b1","resolution":{"observed_at":"2026-08-11T10:33:05.100868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.03267","last_updated":"2026-05-01T23:55:43Z","snapshot_observed_at":"2026-08-15T00:17:32.875866Z","submitted_at":"2025-12-19T07:05:38Z","title":"OpenAI GPT-5 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.03267","snapshot_observed_at":"2026-08-11T10:33:05.104283Z","title":"arXiv preprint arXiv:2601.03267 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09802","last_updated":"2026-08-10T16:23:19Z","snapshot_observed_at":"2026-08-14T15:39:09.388241Z","submitted_at":"2026-08-10T16:23:19Z","title":"SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-11T10:33:05.104283Z"},"links":{"cited_paper":"/paper/2601.03267","citing_paper":"/paper/2608.09802"},"observation_digest":"sha256:19a0664eabcc057cf3861c273e502f0f9f40cc92ea5b56cc122e2b607c008fb9","observation_id":"406a1acd-ab51-467a-afd4-b8e6e7699bd8","resolution":{"observed_at":"2026-08-11T10:33:05.104283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:33:06.153321Z","title":"2025 , howpublished =","venue":null,"work_id":"28c92bd4-6bb0-4196-a187-4e1fa5c2bcaf","year":2025},"citing_paper":{"arxiv_id":"2608.09802","last_updated":"2026-08-10T16:23:19Z","snapshot_observed_at":"2026-08-14T15:39:09.388241Z","submitted_at":"2026-08-10T16:23:19Z","title":"SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-11T10:33:05.108179Z"},"links":{"citing_paper":"/paper/2608.09802"},"observation_digest":"sha256:47a40fa7b5499e26f32159483acdfabef8fb55c18400b2325a9151ccb73ad5c5","observation_id":"1748a498-1845-4bda-a114-f5f25eecee9a","resolution":{"observed_at":"2026-08-11T10:33:06.156322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:33:05.111771Z","title":"2026 , howpublished =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09802","last_updated":"2026-08-10T16:23:19Z","snapshot_observed_at":"2026-08-14T15:39:09.388241Z","submitted_at":"2026-08-10T16:23:19Z","title":"SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-11T10:33:05.111771Z"},"links":{"citing_paper":"/paper/2608.09802"},"observation_digest":"sha256:a8680a87f8b42ccee92aaf2405eb8778c5fc07568cab46fcd10296a7865c1722","observation_id":"34c565ed-c927-413d-9fc7-8565157b2451","resolution":{"observed_at":"2026-08-11T10:33:05.111771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.02276","last_updated":"2026-02-02T16:17:38Z","snapshot_observed_at":"2026-08-12T00:25:39.214406Z","submitted_at":"2026-02-02T16:17:38Z","title":"Kimi K2.5: Visual Agentic Intelligence","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.02276","snapshot_observed_at":"2026-08-11T10:33:05.114887Z","title":"5: Visual Agentic Intelligence , author=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09802","last_updated":"2026-08-10T16:23:19Z","snapshot_observed_at":"2026-08-14T15:39:09.388241Z","submitted_at":"2026-08-10T16:23:19Z","title":"SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-11T10:33:05.114887Z"},"links":{"cited_paper":"/paper/2602.02276","citing_paper":"/paper/2608.09802"},"observation_digest":"sha256:d91c2865a460614586e43e1e6417390a9eafcaaf10a4105216b4bc00fb33ea78","observation_id":"459d61d5-ea68-421a-9083-f6c51ca8b05d","resolution":{"observed_at":"2026-08-11T10:33:05.114887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:33:05.118894Z","title":"The Thirty-eighth Annual Conference on Neural Information Processing Systems , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09802","last_updated":"2026-08-10T16:23:19Z","snapshot_observed_at":"2026-08-14T15:39:09.388241Z","submitted_at":"2026-08-10T16:23:19Z","title":"SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-11T10:33:05.118894Z"},"links":{"citing_paper":"/paper/2608.09802"},"observation_digest":"sha256:4af543ea99f0c32a6b647a8a09b01a4195f2d6acfa3983aa9c25619752769323","observation_id":"de7e9c81-7baa-48c6-8698-31fe1f9475c3","resolution":{"observed_at":"2026-08-11T10:33:05.118894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:33:05.122258Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09802","last_updated":"2026-08-10T16:23:19Z","snapshot_observed_at":"2026-08-14T15:39:09.388241Z","submitted_at":"2026-08-10T16:23:19Z","title":"SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-11T10:33:05.122258Z"},"links":{"citing_paper":"/paper/2608.09802"},"observation_digest":"sha256:878f929fa452ea85b613faddbd2cdec598b7091a4a826dc29a751e334dce9eef","observation_id":"9bb98ca7-5641-4c58-8757-34fb9cbf61fc","resolution":{"observed_at":"2026-08-11T10:33:05.122258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01489","last_updated":"2024-10-29T17:29:27Z","snapshot_observed_at":"2026-08-10T19:28:41.964638Z","submitted_at":"2024-07-01T17:24:45Z","title":"Agentless: Demystifying LLM-based Software Engineering Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01489","snapshot_observed_at":"2026-08-11T10:33:05.125611Z","title":"arXiv preprint arXiv:2407.01489 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09802","last_updated":"2026-08-10T16:23:19Z","snapshot_observed_at":"2026-08-14T15:39:09.388241Z","submitted_at":"2026-08-10T16:23:19Z","title":"SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-11T10:33:05.125611Z"},"links":{"cited_paper":"/paper/2407.01489","citing_paper":"/paper/2608.09802"},"observation_digest":"sha256:4dbb7cbffd748f60ef597fef325f85dc51e8fe1ae89133f9f3b6dd2616d90f15","observation_id":"ffdf1e1a-ef57-4b7b-b636-7aeff17513f7","resolution":{"observed_at":"2026-08-11T10:33:05.125611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:33:06.128628Z","title":"Forty-third International Conference on Machine Learning , year=","venue":null,"work_id":"264cbce0-0d0e-4446-b0c4-cc8992725738","year":null},"citing_paper":{"arxiv_id":"2608.09802","last_updated":"2026-08-10T16:23:19Z","snapshot_observed_at":"2026-08-14T15:39:09.388241Z","submitted_at":"2026-08-10T16:23:19Z","title":"SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-11T10:33:05.129227Z"},"links":{"citing_paper":"/paper/2608.09802"},"observation_digest":"sha256:cad1b0381697a8ef5d0427825eb0530c2db682973c3b11e09f3f875fcedb64ef","observation_id":"8cc28ad2-853d-46d2-bbfd-95ee42cf3fb0","resolution":{"observed_at":"2026-08-11T10:33:06.131821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:33:06.118358Z","title":"ACM Transactions on Software Engineering and Methodology , year=","venue":null,"work_id":"3e895a17-e306-45f1-8bcc-b3cd99708c75","year":null},"citing_paper":{"arxiv_id":"2608.09802","last_updated":"2026-08-10T16:23:19Z","snapshot_observed_at":"2026-08-14T15:39:09.388241Z","submitted_at":"2026-08-10T16:23:19Z","title":"SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-11T10:33:05.132829Z"},"links":{"citing_paper":"/paper/2608.09802"},"observation_digest":"sha256:0bb963818e6d594a3202a4e0e64df6010108ceeb579823c440382615ca0d1f24","observation_id":"fedb4a3e-bb25-4824-bec6-3ab8f9c0ed4f","resolution":{"observed_at":"2026-08-11T10:33:06.121704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:33:05.136319Z","title":"arXiv preprint arXiv:2511.21788 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09802","last_updated":"2026-08-10T16:23:19Z","snapshot_observed_at":"2026-08-14T15:39:09.388241Z","submitted_at":"2026-08-10T16:23:19Z","title":"SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-11T10:33:05.136319Z"},"links":{"citing_paper":"/paper/2608.09802"},"observation_digest":"sha256:0f8e95d7284de71f57651684dd25dcfdc0ad8bf977fecc80df1861714b8d5d59","observation_id":"911cf3f4-d1a3-43e4-b5bb-1a855598c1dd","resolution":{"observed_at":"2026-08-11T10:33:05.136319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:33:06.107323Z","title":"IEEE Transactions on Software Engineering , volume=","venue":null,"work_id":"0476416f-94d2-4807-979b-daa7dfec0920","year":2020},"citing_paper":{"arxiv_id":"2608.09802","last_updated":"2026-08-10T16:23:19Z","snapshot_observed_at":"2026-08-14T15:39:09.388241Z","submitted_at":"2026-08-10T16:23:19Z","title":"SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-11T10:33:05.139162Z"},"links":{"citing_paper":"/paper/2608.09802"},"observation_digest":"sha256:215483e039c4613bde1e695910f7008444cfba89fd5e3400d975d5d1bb94151d","observation_id":"50db8eec-8615-47d7-b8b2-ac6cf7d6aab1","resolution":{"observed_at":"2026-08-11T10:33:06.111818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08703","last_updated":"2025-04-23T20:22:37Z","snapshot_observed_at":"2026-08-14T11:06:32.676044Z","submitted_at":"2025-04-11T17:08:02Z","title":"SWE-PolyBench: A multi-language benchmark for repository level evaluation of coding agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08703","snapshot_observed_at":"2026-08-11T10:33:05.142802Z","title":"arXiv preprint arXiv:2504.08703 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09802","last_updated":"2026-08-10T16:23:19Z","snapshot_observed_at":"2026-08-14T15:39:09.388241Z","submitted_at":"2026-08-10T16:23:19Z","title":"SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-11T10:33:05.142802Z"},"links":{"cited_paper":"/paper/2504.08703","citing_paper":"/paper/2608.09802"},"observation_digest":"sha256:ca4802f9be3e2b411ebfaf404922393800a4745e191c924743da3578a54eb68f","observation_id":"a70a37d2-dabb-4c9b-9b66-d9a51647561f","resolution":{"observed_at":"2026-08-11T10:33:05.142802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:33:05.146584Z","title":"arXiv preprint arXiv:2508.05988 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09802","last_updated":"2026-08-10T16:23:19Z","snapshot_observed_at":"2026-08-14T15:39:09.388241Z","submitted_at":"2026-08-10T16:23:19Z","title":"SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-11T10:33:05.146584Z"},"links":{"citing_paper":"/paper/2608.09802"},"observation_digest":"sha256:062b39b98f8938b2a5f43f0056c75f856c0925a9ee1cf6afd99d999776ffe4c2","observation_id":"0133102d-002d-46d6-8134-d2c2cc1674d9","resolution":{"observed_at":"2026-08-11T10:33:05.146584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:33:06.096784Z","title":"Proceedings of the ACM on Software Engineering , volume=","venue":null,"work_id":"1be46d04-fff6-428a-8ea4-739b550fcc62","year":2026},"citing_paper":{"arxiv_id":"2608.09802","last_updated":"2026-08-10T16:23:19Z","snapshot_observed_at":"2026-08-14T15:39:09.388241Z","submitted_at":"2026-08-10T16:23:19Z","title":"SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-11T10:33:05.149726Z"},"links":{"citing_paper":"/paper/2608.09802"},"observation_digest":"sha256:35d1cad6302cbb1310d01b73d9f1130eb0c67db9799c6ff45c894d78d7657ab1","observation_id":"6956c2d6-5a6d-47dc-9e2d-c31fc1b6cabf","resolution":{"observed_at":"2026-08-11T10:33:06.100412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.05110","last_updated":"2026-04-28T12:22:24Z","snapshot_observed_at":"2026-08-13T12:56:21.379232Z","submitted_at":"2026-01-08T16:58:07Z","title":"GlimpRouter: Efficient Collaborative Inference by Glimpsing One Token of Thoughts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.05110","snapshot_observed_at":"2026-08-11T10:33:05.153067Z","title":"arXiv preprint arXiv:2601.05110 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09802","last_updated":"2026-08-10T16:23:19Z","snapshot_observed_at":"2026-08-14T15:39:09.388241Z","submitted_at":"2026-08-10T16:23:19Z","title":"SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-11T10:33:05.153067Z"},"links":{"cited_paper":"/paper/2601.05110","citing_paper":"/paper/2608.09802"},"observation_digest":"sha256:560289864f2ea6cbc91880f17d1ce1640c73bea7d3f6df2a3a8aced229b45da1","observation_id":"86c062fe-b170-47c3-816b-b40cb2bcd596","resolution":{"observed_at":"2026-08-11T10:33:05.153067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.28436","last_updated":"2026-06-26T06:14:55Z","snapshot_observed_at":"2026-08-14T23:46:25.330628Z","submitted_at":"2026-06-26T06:14:55Z","title":"Dockerless: Environment-Free Program Verifier for Coding Agents","version":1},"cited_work":{"arxiv_id":"2606.28436","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.28436","snapshot_observed_at":"2026-08-11T10:33:05.453749Z","title":"Dockerless: Environment-Free Program Verifier for Coding Agents","venue":"cs.SE","work_id":"27211c7e-4ad8-4e90-b82e-c53a2fd0dab6","year":2026},"citing_paper":{"arxiv_id":"2608.09802","last_updated":"2026-08-10T16:23:19Z","snapshot_observed_at":"2026-08-14T15:39:09.388241Z","submitted_at":"2026-08-10T16:23:19Z","title":"SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-11T10:33:05.156297Z"},"links":{"cited_paper":"/paper/2606.28436","citing_paper":"/paper/2608.09802"},"observation_digest":"sha256:48ac71a266ab865ff3c6f1a9b8735db0eb8eada2b8519caa63c0d9266a78eca3","observation_id":"1a80bc5a-a564-4cac-917f-6b6d4ffe40bd","resolution":{"observed_at":"2026-08-11T10:33:05.459249Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.28434","last_updated":"2026-06-26T04:55:24Z","snapshot_observed_at":"2026-08-13T19:49:58.096295Z","submitted_at":"2026-06-26T04:55:24Z","title":"SWE-MeM: Learning Adaptive Memory Management for Long-Horizon Coding Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.28434","snapshot_observed_at":"2026-08-11T10:33:05.159719Z","title":"arXiv preprint arXiv:2606.28434 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09802","last_updated":"2026-08-10T16:23:19Z","snapshot_observed_at":"2026-08-14T15:39:09.388241Z","submitted_at":"2026-08-10T16:23:19Z","title":"SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-11T10:33:05.159719Z"},"links":{"cited_paper":"/paper/2606.28434","citing_paper":"/paper/2608.09802"},"observation_digest":"sha256:990f777a469e5d2b8c8e88741aae1d7330313b7c000414d200383468b86006d0","observation_id":"b3298fe7-8a0e-4ee9-b842-f1631abf9daa","resolution":{"observed_at":"2026-08-11T10:33:05.159719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:33:06.086522Z","title":"2026 56th Annual IEEE International Conference on Dependable Systems and Networks (DSN) , pages=","venue":null,"work_id":"6128beed-d093-4233-9ec3-d01475b21de4","year":2026},"citing_paper":{"arxiv_id":"2608.09802","last_updated":"2026-08-10T16:23:19Z","snapshot_observed_at":"2026-08-14T15:39:09.388241Z","submitted_at":"2026-08-10T16:23:19Z","title":"SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-11T10:33:05.162960Z"},"links":{"citing_paper":"/paper/2608.09802"},"observation_digest":"sha256:0d017d28ce2583208e3aee67f6499c11d802cbaff263161eac6731421a755a49","observation_id":"b7a9525b-0127-4587-8ccf-24c3de93cbc0","resolution":{"observed_at":"2026-08-11T10:33:06.089954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:33:06.076110Z","title":", author=","venue":null,"work_id":"dea6227f-f1bf-4d67-9212-2269081fe0e7","year":null},"citing_paper":{"arxiv_id":"2608.09802","last_updated":"2026-08-10T16:23:19Z","snapshot_observed_at":"2026-08-14T15:39:09.388241Z","submitted_at":"2026-08-10T16:23:19Z","title":"SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-11T10:33:05.165940Z"},"links":{"citing_paper":"/paper/2608.09802"},"observation_digest":"sha256:503000229de41895edad8a982e1bf306be2fbdf93660ed97e534d3486a379b9d","observation_id":"721849b7-af00-4ab7-b0fb-945c222faace","resolution":{"observed_at":"2026-08-11T10:33:06.079551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2607.07946","last_updated":"2026-07-08T21:45:34Z","snapshot_observed_at":"2026-08-14T19:42:44.835005Z","submitted_at":"2026-07-08T21:45:34Z","title":"DeepSWE: Measuring Frontier Coding Agents on Original, Long-Horizon Engineering Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.07946","snapshot_observed_at":"2026-08-11T10:33:05.168600Z","title":"arXiv preprint arXiv:2607.07946 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09802","last_updated":"2026-08-10T16:23:19Z","snapshot_observed_at":"2026-08-14T15:39:09.388241Z","submitted_at":"2026-08-10T16:23:19Z","title":"SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-11T10:33:05.168600Z"},"links":{"cited_paper":"/paper/2607.07946","citing_paper":"/paper/2608.09802"},"observation_digest":"sha256:5db93b07191f9d0232aa1d4cda9286517c681d19875fbc8505ed57b8b320e346","observation_id":"68561b30-bfd6-4eca-b5a7-f71b14a3cece","resolution":{"observed_at":"2026-08-11T10:33:05.168600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:33:05.171640Z","title":"arXiv preprint arXiv:2602.09892 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09802","last_updated":"2026-08-10T16:23:19Z","snapshot_observed_at":"2026-08-14T15:39:09.388241Z","submitted_at":"2026-08-10T16:23:19Z","title":"SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-11T10:33:05.171640Z"},"links":{"citing_paper":"/paper/2608.09802"},"observation_digest":"sha256:7d4b61d77eb56649a2e0421f87e304171e795c524e11fb2e6b022ee70ebff474","observation_id":"c39e42ed-83c4-4a40-90f6-032e842bc57f","resolution":{"observed_at":"2026-08-11T10:33:05.171640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:33:05.174132Z","title":"arXiv preprint arXiv:2603.13023 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09802","last_updated":"2026-08-10T16:23:19Z","snapshot_observed_at":"2026-08-14T15:39:09.388241Z","submitted_at":"2026-08-10T16:23:19Z","title":"SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-11T10:33:05.174132Z"},"links":{"citing_paper":"/paper/2608.09802"},"observation_digest":"sha256:dab614930fcad110b353482a53a6d484ddb1e7a9edb2e14c943a0268c739a04f","observation_id":"2d2557dc-c8bd-4b1c-8229-0e96dbda32ca","resolution":{"observed_at":"2026-08-11T10:33:05.174132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.07682","last_updated":"2026-06-05T00:39:44Z","snapshot_observed_at":"2026-08-14T07:25:57.458636Z","submitted_at":"2026-06-05T00:39:44Z","title":"SWE-Marathon: Can Agents Autonomously Complete Ultra-Long-Horizon Software Work?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.07682","snapshot_observed_at":"2026-08-11T10:33:05.176471Z","title":"arXiv preprint arXiv:2606.07682 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09802","last_updated":"2026-08-10T16:23:19Z","snapshot_observed_at":"2026-08-14T15:39:09.388241Z","submitted_at":"2026-08-10T16:23:19Z","title":"SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-11T10:33:05.176471Z"},"links":{"cited_paper":"/paper/2606.07682","citing_paper":"/paper/2608.09802"},"observation_digest":"sha256:33be5e9b18b8b6912dead4b145d9de30fcd979d88480851842d78ab1c4eaff67","observation_id":"f289ac6f-bd83-4ed4-b5b4-87df9830f8c8","resolution":{"observed_at":"2026-08-11T10:33:05.176471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:33:06.066279Z","title":"2025 IEEE/ACM 47th International Conference on Software Engineering (ICSE 2025) , year=","venue":null,"work_id":"f1e800ca-dd99-45bc-b2ff-b6dd36abfdd3","year":2025},"citing_paper":{"arxiv_id":"2608.09802","last_updated":"2026-08-10T16:23:19Z","snapshot_observed_at":"2026-08-14T15:39:09.388241Z","submitted_at":"2026-08-10T16:23:19Z","title":"SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-11T10:33:05.179259Z"},"links":{"citing_paper":"/paper/2608.09802"},"observation_digest":"sha256:b2dbcb3e18c6197d785b7a2b52d3951ae661398923691c2f25b4b137255143d8","observation_id":"37b1c540-47f4-44c3-b6b8-3fbf94f47fb2","resolution":{"observed_at":"2026-08-11T10:33:06.069679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:33:06.056514Z","title":"2026 IEEE/ACM 48th International Conference on Software Engineering (ICSE 2026) , year=","venue":null,"work_id":"59d19ccd-5cf2-4961-9a53-446a4c878bdd","year":2026},"citing_paper":{"arxiv_id":"2608.09802","last_updated":"2026-08-10T16:23:19Z","snapshot_observed_at":"2026-08-14T15:39:09.388241Z","submitted_at":"2026-08-10T16:23:19Z","title":"SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-11T10:33:05.182108Z"},"links":{"citing_paper":"/paper/2608.09802"},"observation_digest":"sha256:ce1b0e9eeae5108e3508e5e8ed912417e3edd2a804540c60019dc5009950c46f","observation_id":"482b1260-b00e-4acb-a488-0cebbb20a2f8","resolution":{"observed_at":"2026-08-11T10:33:06.059866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.14635","last_updated":"2026-04-26T17:37:00Z","snapshot_observed_at":"2026-07-06T22:30:11.897367Z","submitted_at":"2025-09-18T05:25:32Z","title":"SWE-QA: Can Language Models Answer Repository-level Code Questions?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.14635","snapshot_observed_at":"2026-08-11T10:33:05.185551Z","title":"arXiv preprint arXiv:2509.14635 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09802","last_updated":"2026-08-10T16:23:19Z","snapshot_observed_at":"2026-08-14T15:39:09.388241Z","submitted_at":"2026-08-10T16:23:19Z","title":"SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-11T10:33:05.185551Z"},"links":{"cited_paper":"/paper/2509.14635","citing_paper":"/paper/2608.09802"},"observation_digest":"sha256:a7d377dc47ebd63767ed889baaa78fdefbaa197b7e9719e62ec1e48c75340887","observation_id":"b455b31f-4f54-4dea-8092-a73530b9f2e8","resolution":{"observed_at":"2026-08-11T10:33:05.185551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:33:06.045736Z","title":"2025 IEEE/ACM 40th International Conference on Automated Software Engineering (ASE) , year=","venue":null,"work_id":"fa677e13-f773-4828-bce7-d38c8ae7856d","year":2025},"citing_paper":{"arxiv_id":"2608.09802","last_updated":"2026-08-10T16:23:19Z","snapshot_observed_at":"2026-08-14T15:39:09.388241Z","submitted_at":"2026-08-10T16:23:19Z","title":"SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-11T10:33:05.189108Z"},"links":{"citing_paper":"/paper/2608.09802"},"observation_digest":"sha256:3bd6386e5c1025c4a6cccfe859f94137cbfe1edcf75fbc52afca37b79fc3e27c","observation_id":"a5c3626a-90c9-42ee-85f2-10a2eb169b66","resolution":{"observed_at":"2026-08-11T10:33:06.049571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.01785","last_updated":"2026-04-28T16:05:53Z","snapshot_observed_at":"2026-08-14T21:44:02.356259Z","submitted_at":"2026-02-02T08:10:21Z","title":"CodeOCR: On the Effectiveness of Vision Language Models in Code Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.01785","snapshot_observed_at":"2026-08-11T10:33:05.192539Z","title":"arXiv preprint arXiv:2602.01785 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09802","last_updated":"2026-08-10T16:23:19Z","snapshot_observed_at":"2026-08-14T15:39:09.388241Z","submitted_at":"2026-08-10T16:23:19Z","title":"SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-11T10:33:05.192539Z"},"links":{"cited_paper":"/paper/2602.01785","citing_paper":"/paper/2608.09802"},"observation_digest":"sha256:c11c871f7f1be4f0d0e09c259a89312b0945a2c5cdb11f541787431938b9f8a8","observation_id":"3feab7a6-395e-4bdc-8421-cbf47fc53339","resolution":{"observed_at":"2026-08-11T10:33:05.192539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:33:05.195925Z","title":"arXiv preprint arXiv:2507.23361 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09802","last_updated":"2026-08-10T16:23:19Z","snapshot_observed_at":"2026-08-14T15:39:09.388241Z","submitted_at":"2026-08-10T16:23:19Z","title":"SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-11T10:33:05.195925Z"},"links":{"citing_paper":"/paper/2608.09802"},"observation_digest":"sha256:4411c42f298fd0c7e9117b16afa18560c9be3fcae5e1a694b9fc4ee21da5b522","observation_id":"8ef10c72-4675-4346-ad97-1eaa3499ffc7","resolution":{"observed_at":"2026-08-11T10:33:05.195925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.16746","last_updated":"2026-05-07T13:28:51Z","snapshot_observed_at":"2026-08-14T03:06:36.939366Z","submitted_at":"2026-01-23T13:51:59Z","title":"SWE-Pruner: Self-Adaptive Context Pruning for Coding Agents","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.16746","snapshot_observed_at":"2026-08-11T10:33:05.199145Z","title":"arXiv preprint arXiv:2601.16746 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09802","last_updated":"2026-08-10T16:23:19Z","snapshot_observed_at":"2026-08-14T15:39:09.388241Z","submitted_at":"2026-08-10T16:23:19Z","title":"SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-11T10:33:05.199145Z"},"links":{"cited_paper":"/paper/2601.16746","citing_paper":"/paper/2608.09802"},"observation_digest":"sha256:c12e2c8a566a8f85ec00e970e92956d50e1ebcb4edeab1c8882b3fbcae633844","observation_id":"e7360d33-bf91-44ff-a54d-97619353261a","resolution":{"observed_at":"2026-08-11T10:33:05.199145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.23348","last_updated":"2025-07-31T08:54:46Z","snapshot_observed_at":"2026-08-14T07:31:06.428492Z","submitted_at":"2025-07-31T08:54:46Z","title":"SWE-Debate: Competitive Multi-Agent Debate for Software Issue Resolution","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.23348","snapshot_observed_at":"2026-08-11T10:33:05.202398Z","title":"arXiv preprint arXiv:2507.23348 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09802","last_updated":"2026-08-10T16:23:19Z","snapshot_observed_at":"2026-08-14T15:39:09.388241Z","submitted_at":"2026-08-10T16:23:19Z","title":"SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-11T10:33:05.202398Z"},"links":{"cited_paper":"/paper/2507.23348","citing_paper":"/paper/2608.09802"},"observation_digest":"sha256:9ae56c7b32776c646956d982427907ec9afa6a5294208e1b0c53fa7e443cef77","observation_id":"de7094cb-f340-4247-b194-167c88acfb46","resolution":{"observed_at":"2026-08-11T10:33:05.202398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.09802","last_updated":"2026-08-10T16:23:19Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-14T15:39:09.388241Z","submitted_at":"2026-08-10T16:23:19Z","title":"SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring"},"reference_resolution":{"displayed":67,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":1,"unresolved":45,"verified_exact":0,"verified_fuzzy":20},"total_outbound_references":67},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 67 of 67 outbound references and 0 inbound Pith citation observations for arXiv:2608.09802."}