{"as_of":"2026-08-11T16:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:62518660f8025b498ee0d367a2cfc3b969020cf2da2ea5d802de48087c878128","coverage":[{"denominator":66,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":66,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-14T18:34:39.997353Z","state":"measured"},{"denominator":68,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":68,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:14:40.967694Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-06-29T12:43:25.368479Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-11T09:08:34.116683Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"cited_work":{"arxiv_id":"2605.13139","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.13139","snapshot_observed_at":"2026-06-29T12:43:25.368479Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","venue":"cs.SE","work_id":"c2c8a81b-bfc8-40c4-b975-12358fedeed6","year":2026},"citing_paper":{"arxiv_id":"2605.28424","last_updated":"2026-05-27T12:54:33Z","snapshot_observed_at":"2026-08-06T06:19:44.176919Z","submitted_at":"2026-05-27T12:54:33Z","title":"Skill0.5: Joint Skill Internalization and Utilization for Out-of-Distribution Generalization in Agentic Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-29T12:40:56.078495Z"},"links":{"cited_paper":"/paper/2605.13139","citing_paper":"/paper/2605.28424"},"observation_digest":"sha256:b6fbb06a3020b4e7a2e8091053fd47ecc57ece836669534f08711fe61ba04eb3","observation_id":"bae87c06-11ed-4748-b529-1eff90569c4b","resolution":{"observed_at":"2026-06-29T12:43:25.369715Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-11T09:08:34.116683Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.13139","snapshot_observed_at":"2026-08-07T00:14:40.967694Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02685","last_updated":"2026-08-03T07:24:33Z","snapshot_observed_at":"2026-08-10T23:36:42.312193Z","submitted_at":"2026-08-03T07:24:33Z","title":"BulkPR-Bench: Benchmarking Queue-Level Governance of Interacting Pull Requests","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:40.967694Z"},"links":{"cited_paper":"/paper/2605.13139","citing_paper":"/paper/2608.02685"},"observation_digest":"sha256:7572cbc67edbf5b316d19d42634effc0e587270edc5d516ee6d6d881f5c737f7","observation_id":"cf6b6e19-dd65-4858-a242-e2e422860398","resolution":{"observed_at":"2026-08-07T00:14:40.967694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.13139/citation-record","integrity":"/paper/2605.13139/integrity","json":"/paper/2605.13139/citation-record.json","paper":"/paper/2605.13139"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Claude 4.6 sonnet system card","venue":null,"work_id":"85bdec73-f606-453f-ac9a-34ba951a6b05","year":null},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-11T09:08:34.116683Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:6a463f963c0d7bf1c8b87fc92925363226723e740c66d0b317e958dcbf88487a","observation_id":"8f39a84c-823f-4f0d-97b8-9ca1cf76a4d2","resolution":{"observed_at":"2026-05-15T23:01:49.914350Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"9dc8b2b7-21b7-4e27-ac6c-d6ac7d3ec38f","year":null},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-11T09:08:34.116683Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:78358298504df65cd7b4880a2bf8a13c035edbf9bb28f3b6ef27270993c4a539","observation_id":"24dc2c11-d7c6-4521-b9d6-e106024ab202","resolution":{"observed_at":"2026-05-15T23:01:49.956856Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Claude code","venue":null,"work_id":"a974e0ed-b8d8-4534-a3aa-34731e913fbf","year":2025},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-11T09:08:34.116683Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:865be72dbdff2f7ff3befcf6793abafc0175d0c974d92bdf9f8caae56a79dcae","observation_id":"d4c5bfbc-d48b-4138-abca-e5e90f2810c6","resolution":{"observed_at":"2026-05-15T23:01:49.941349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Introducing claude opus 4.5","venue":null,"work_id":"135f65e0-92b8-43bb-8f8e-a7cd633b7005","year":2025},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-11T09:08:34.116683Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:92953da1b2a301e2ebad34b5aaf024b4568033478d28fbb6ec4ddf06fcce529d","observation_id":"b112b683-aeeb-446e-b940-6b102c5ce529","resolution":{"observed_at":"2026-05-15T23:01:49.975076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13657","last_updated":"2025-10-26T23:25:18Z","snapshot_observed_at":"2026-08-11T04:16:48.156601Z","submitted_at":"2025-03-17T19:04:38Z","title":"Why Do Multi-Agent LLM Systems Fail?","version":3},"cited_work":{"arxiv_id":"2503.13657","doi":"10.48550/arxiv.2503.13657","metadata_source":"pith","pith_arxiv_id":"2503.13657","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Why Do Multi-Agent LLM Systems Fail?","venue":"cs.AI","work_id":"b186294a-cda7-4df0-9a28-27d379af92b2","year":2025},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-11T09:08:34.116683Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"cited_paper":"/paper/2503.13657","citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:1f2e8c2e4207653818d0abd8261e36093414cc41437e6ea287b664474aa27af9","observation_id":"0acde9b6-8974-44b9-87c6-d7fdf97d1b18","resolution":{"observed_at":"2026-05-14T18:37:35.740135Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Jimenez, John Yang, Kevin Liu, and Aleksander Madry","venue":null,"work_id":"2631f770-df37-4397-ab24-8a3cd91580b6","year":2024},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-11T09:08:34.116683Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:38456f228d72656645826007fbeaad4535cfd985e3e84c8943d8d52426c959e0","observation_id":"b5a57f9d-55e2-4252-aef0-dbe1af71b807","resolution":{"observed_at":"2026-05-15T23:01:49.901436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deepseek-v3.2: Pushing the frontier of open large language models","venue":null,"work_id":"677e125a-e75e-4f84-bf7b-8d045b046e21","year":null},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-11T09:08:34.116683Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:cd6419b4b08dc15a23b613f5dfc05d9da7794aea057e023c2594f5350c637dc4","observation_id":"2e170f2c-23a6-495d-afa8-27eae894a2fa","resolution":{"observed_at":"2026-05-15T23:01:50.031137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.02556","last_updated":"2025-12-02T09:25:14Z","snapshot_observed_at":"2026-07-31T23:49:25.878472Z","submitted_at":"2025-12-02T09:25:14Z","title":"DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models","version":1},"cited_work":{"arxiv_id":"2512.02556","doi":"10.18653/v1/d18-1512","metadata_source":"pith","pith_arxiv_id":"2512.02556","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models","venue":"cs.CL","work_id":"07c85cc5-4086-4abc-823b-6d0f4ff784d0","year":2025},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-11T09:08:34.116683Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"cited_paper":"/paper/2512.02556","citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:882c9a0ef6e6f62b77cc1e65cd0a8ea4b651997347b95162e2846f95210cf63b","observation_id":"800defb5-7cfc-4cd9-8999-d1d5a271988f","resolution":{"observed_at":"2026-05-14T18:37:35.728961Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.16941","last_updated":"2025-11-14T22:00:03Z","snapshot_observed_at":"2026-08-10T12:32:55.999823Z","submitted_at":"2025-09-21T06:28:17Z","title":"SWE-Bench Pro: Can AI Agents Solve Long-Horizon Software Engineering Tasks?","version":2},"cited_work":{"arxiv_id":"2509.16941","doi":"10.48550/arxiv.2509.16941","metadata_source":"pith","pith_arxiv_id":"2509.16941","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SWE-Bench Pro: Can AI Agents Solve Long-Horizon Software Engineering Tasks?","venue":"cs.SE","work_id":"a561c78a-4b02-4053-a92a-bc5c7c5f6b9b","year":2025},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-11T09:08:34.116683Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"cited_paper":"/paper/2509.16941","citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:2af7a40597a00b6322e32a65f35168b2778a4f86dc3bec76d1470dbe567c7c16","observation_id":"06d7c0a3-9c97-4644-b93b-5a6fc3091519","resolution":{"observed_at":"2026-05-14T18:37:35.647810Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-07-11T01:50:48.977196+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T01:50:48.977196+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.12730","doi":"10.48550/arxiv.2512.12730","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Nl2repo-bench: Towards long-horizon repository generation evaluation of coding agents.CoRR, abs/2512.12730","venue":"ArXiv.org","work_id":"0ea67a78-d9a4-4898-ab97-00d13ebca55f","year":2025},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-11T09:08:34.116683Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:31874092d60e79aea0c044e5985acbd021ff1df6fcace492766d089277b11f6d","observation_id":"7cf8b928-d7a6-4caa-b8b8-61f34119c575","resolution":{"observed_at":"2026-05-14T18:37:35.654299Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14443","last_updated":"2025-03-18T17:19:12Z","snapshot_observed_at":"2026-08-07T16:54:18.123894Z","submitted_at":"2025-03-18T17:19:12Z","title":"EnvBench: A Benchmark for Automated Environment Setup","version":1},"cited_work":{"arxiv_id":"2503.14443","doi":"10.48550/arxiv.2503.14443","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.14443","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Envbench: A benchmark for automated environment setup","venue":"arXiv (Cornell University)","work_id":"d76b3e0a-08bc-49db-bd44-f7772ec39f90","year":2025},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-11T09:08:34.116683Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"cited_paper":"/paper/2503.14443","citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:399095641162750bd4ef522e7b434079a96262159c4a652559d976b5b90553c8","observation_id":"10ea27d6-ad3c-420d-9d3d-96a718860108","resolution":{"observed_at":"2026-05-14T18:37:35.670953Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Automatically benchmarking llm code agents through agent-driven annotation and evaluation","venue":null,"work_id":"c1a8a8cf-983e-4ae9-ba56-a20fe389faac","year":2025},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-11T09:08:34.116683Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:509515c9a4d2a730113536d59e6eadc75d4a3bdb14aec6494872b6154ed4a207","observation_id":"b4512bb2-5f9b-4206-af4a-d2ac7f29c606","resolution":{"observed_at":"2026-05-15T23:01:50.006590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.15763","last_updated":"2026-02-24T10:44:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-17T17:50:56Z","title":"GLM-5: from Vibe Coding to Agentic Engineering","version":2},"cited_work":{"arxiv_id":"2602.15763","doi":"10.48550/arxiv.2602.15763","metadata_source":"pith","pith_arxiv_id":"2602.15763","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GLM-5: from Vibe Coding to Agentic Engineering","venue":"cs.LG","work_id":"ad29b1a2-bf77-46b3-9ead-fb62b1d2c6fe","year":2026},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-11T09:08:34.116683Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"cited_paper":"/paper/2602.15763","citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:26d143d92da3be28cd3fecd79204f7a339b099714185301dbda16c9a0dc36132","observation_id":"bbee0fd7-96dd-494f-b598-28c093a64afa","resolution":{"observed_at":"2026-05-14T18:37:35.734348Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.11895","last_updated":"2026-05-16T19:19:54Z","snapshot_observed_at":"2026-07-06T22:41:58.373427Z","submitted_at":"2026-01-17T03:33:08Z","title":"DevBench: A Realistic, Developer-Informed Benchmark for Code Generation Models","version":3},"cited_work":{"arxiv_id":"2601.11895","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.11895","snapshot_observed_at":"2026-06-28T18:02:27.204106Z","title":"DevBench: A Realistic, Developer-Informed Benchmark for Code Generation Models","venue":"cs.LG","work_id":"392e25e9-225d-4f73-b94a-cb0664063320","year":2026},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-11T09:08:34.116683Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"cited_paper":"/paper/2601.11895","citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:c546e8b871e829ad806d6e81d82f7d6f9d0291a771030c7120f3c76cf8c78acf","observation_id":"99f5f7dd-57c9-4fa6-9301-3d8edef72cc7","resolution":{"observed_at":"2026-05-20T00:03:02.290016Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"SWE-bench goes live!","venue":null,"work_id":"1369b70b-2539-4c1b-bd56-c8ee266c2035","year":null},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-11T09:08:34.116683Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:c5383bb9ad99a6050c530d4965021169f93cb1b18298ec1a957cc0ec2ec527f1","observation_id":"3bd95873-df6a-48ce-af0d-da02a47e4d69","resolution":{"observed_at":"2026-05-15T23:01:49.947884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23419","last_updated":"2025-06-01T14:53:40Z","snapshot_observed_at":"2026-08-08T14:28:49.134889Z","submitted_at":"2025-05-29T13:09:44Z","title":"SWE-bench Goes Live!","version":2},"cited_work":{"arxiv_id":"2505.23419","doi":"10.48550/arxiv.2505.23419","metadata_source":"pith","pith_arxiv_id":"2505.23419","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Swe-bench goes live!","venue":"cs.SE","work_id":"648e52f0-7b78-4b75-8b1d-e89c9ba63afe","year":2025},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-11T09:08:34.116683Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"cited_paper":"/paper/2505.23419","citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:0e7c305d6e2ac4e20892768f868e08312436bbd772fe450b990418e737947cae","observation_id":"168dcc66-f3f1-450c-96b1-19f8d2b24351","resolution":{"observed_at":"2026-05-14T18:37:35.642255Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A survey on LLM-as-a-judge","venue":null,"work_id":"a27288c0-1f79-4219-8d1c-08b986b5d933","year":null},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-11T09:08:34.116683Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:d1a7e69582d06baec3d285d2a3f52516158e224231efad0993a08d66ea46f432","observation_id":"c9d67d3c-c3f4-4c6b-a413-dd94be48cfef","resolution":{"observed_at":"2026-05-15T23:01:49.971230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15594","last_updated":"2025-10-19T10:32:43Z","snapshot_observed_at":"2026-08-02T10:23:50.881300Z","submitted_at":"2024-11-23T16:03:35Z","title":"A Survey on LLM-as-a-Judge","version":6},"cited_work":{"arxiv_id":"2411.15594","doi":"10.1016/j.xinn.2025.101253","metadata_source":"pith","pith_arxiv_id":"2411.15594","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A Survey on LLM-as-a-Judge","venue":"cs.CL","work_id":"2676656a-67bd-4ad5-bad6-cb6f5fcdbfbe","year":2024},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-11T09:08:34.116683Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"cited_paper":"/paper/2411.15594","citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:4321bd911f75e79849b546a6f13ea3e46081fc689de9193577ffb24bc64ceff7","observation_id":"05c195a7-ecff-4b7f-8051-da32307a8de2","resolution":{"observed_at":"2026-05-14T18:37:35.694334Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:20:01.818871+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:20:01.818871+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06770","last_updated":"2024-11-11T23:05:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T16:47:29Z","title":"SWE-bench: Can Language Models Resolve Real-World GitHub Issues?","version":3},"cited_work":{"arxiv_id":"2310.06770","doi":"10.1145/512927.512945","metadata_source":"pith","pith_arxiv_id":"2310.06770","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SWE-bench: Can Language Models Resolve Real-World GitHub Issues?","venue":"cs.CL","work_id":"d0effe15-a689-441a-8e3f-ea35f1c4e4b1","year":2023},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-11T09:08:34.116683Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"cited_paper":"/paper/2310.06770","citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:56e41b99e641e55b648194dfd1f6e49de4dd597a43ad14324c79f2ea7523c487","observation_id":"47d985c1-63ae-4e6d-b40d-da0006c859d3","resolution":{"observed_at":"2026-05-14T18:37:35.625161Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kimi k2.5: Scaling reinforcement learning with llms","venue":null,"work_id":"fede601b-ba92-48d8-a2d6-ad386a2ba909","year":2025},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-11T09:08:34.116683Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:656d7de5a24f1f02cc9ce0208b0a98e4b3642aab938051cca06d4b46eef293b8","observation_id":"c9b2f28a-9075-49ca-8c91-aeaf68a706ca","resolution":{"observed_at":"2026-05-15T23:01:49.952440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fea-bench: A benchmark for evaluating repository-level code generation for feature implementation","venue":null,"work_id":"29adb8ec-98d6-49f0-a23b-bbfaa0878e2d","year":2025},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-11T09:08:34.116683Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:f77f9eb8d26dba3f1e0fc4381915eca7b6ebd77e2e1fe18bd93125bdcc5e9db3","observation_id":"157a6330-e45b-45ea-98d1-cb016d0ca2ae","resolution":{"observed_at":"2026-05-15T23:01:50.027105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.12286","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T15:07:19.641893Z","title":"The swe-bench illusion: When state-of-the-art llms remember instead of reason","venue":null,"work_id":"d26dd136-7889-4ef2-a5f0-285608e2ca30","year":2025},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-11T09:08:34.116683Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:1e3487b6fba8b87e5d9f705437ac31eca5bf934aca2f729ff94dcdf5cc9fcba1","observation_id":"b741897f-c688-422f-9069-1a37b35a06b5","resolution":{"observed_at":"2026-05-14T18:37:35.677223Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.10535","last_updated":"2025-08-14T17:58:50Z","snapshot_observed_at":"2026-08-11T16:27:16.053717Z","submitted_at":"2025-07-14T17:56:29Z","title":"CodeJudgeBench: Benchmarking LLM-as-a-Judge for Coding Tasks","version":2},"cited_work":{"arxiv_id":"2507.10535","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.10535","snapshot_observed_at":"2026-07-07T12:53:50.345403Z","title":"CodeJudgeBench: Benchmarking LLM-as-a-judge for coding tasks","venue":"cs.CL","work_id":"7e37bba3-99fb-4b09-af65-f199ccc4101e","year":2025},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-11T09:08:34.116683Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"cited_paper":"/paper/2507.10535","citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:bc9da77f3c91118480afdbb619bf0239b904e4f9f9e137469c001dcf3c84142f","observation_id":"7e8a0566-9712-4552-86ea-45b3bb2a9231","resolution":{"observed_at":"2026-05-14T18:37:35.746653Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2508.11867","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T15:17:07.515044Z","title":"AI-augmented CI/CD pipelines: From code commit to production with autonomous decisions","venue":null,"work_id":"6c4083a4-4662-49d0-96ed-52f0d64f2819","year":2025},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-11T09:08:34.116683Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:d666a8807d49a777bc6f5220285b297982927dbda70806bf9571386b98919657","observation_id":"ae762665-5c15-4411-bc08-83ddb720f0e9","resolution":{"observed_at":"2026-05-14T18:37:35.665526Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Minimax 2.7","venue":null,"work_id":"f26600bc-1b20-4714-896e-32ae891fec59","year":2026},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-11T09:08:34.116683Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:a9309c00fcfeba49690a9b69e98d224f6e88ed1babcb8b82d75d0ce72c3dc9f9","observation_id":"820c68bf-b14e-4bd3-b6fa-6490f60cf458","resolution":{"observed_at":"2026-05-15T23:01:50.014101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Introducing codex","venue":null,"work_id":"c06b02e7-f3be-4f0b-813a-e63f05db72c9","year":2025},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-11T09:08:34.116683Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:6a873463597fad67c937c0ef489648cb757ce42e9070b60a357754d9df0f5f26","observation_id":"f8d488e6-da18-4a01-ba1b-89bf51a58f7c","resolution":{"observed_at":"2026-05-15T23:01:49.967009Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Introducing gpt -5.4","venue":null,"work_id":"c5849d99-c47a-46c0-bdc9-8423bef1d04a","year":2026},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-11T09:08:34.116683Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:70e3a0a14bebb84573652ac5a66dd6faaa8291c7256751ed2bd3f7791f6e149e","observation_id":"757583f8-c768-4c7b-be1e-6a23621e5d77","resolution":{"observed_at":"2026-05-15T23:01:49.928700Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Why swe-bench verified no longer measures frontier coding capabilities","venue":null,"work_id":"44e21fe3-a948-4630-a4a5-7fb8b8078b42","year":2026},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-11T09:08:34.116683Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:d942248ce60454bd3be4a86d975d69901aebeb53f4a6a63f6e826687b471ce21","observation_id":"47a95b06-f6c5-4221-af19-5526b3f1b2d5","resolution":{"observed_at":"2026-05-15T23:01:50.018434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Opencode","venue":null,"work_id":"839d0c32-d026-467d-bdd7-af8d89ea1d2e","year":2026},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-11T09:08:34.116683Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:e188bc8618fd25a1d2ecfc6accaf12669e6895504c66998cb9764cd4a01b10b4","observation_id":"57532272-9dff-447d-918a-81a595b91fae","resolution":{"observed_at":"2026-05-15T23:01:49.892926Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Qwen3.5: Towards native multimodal agents","venue":null,"work_id":"1b58eeb8-86a7-4531-ad00-1fc91203f19a","year":2026},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-11T09:08:34.116683Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:9c3a758e3b5dbfaf2a88d6396e114d0bd5e193dc2def6037c31de5a7b5c602ee","observation_id":"79aebd07-797c-4c7f-b08c-255fb7710ef5","resolution":{"observed_at":"2026-05-15T23:01:49.910330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Judging the judges: A systematic study of position bias in LLM-as-a-judge","venue":null,"work_id":"a33deac8-8ab7-4c58-8439-ae183ee55503","year":null},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-11T09:08:34.116683Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:3aedf185ca3931588334b1267cc6f9bb79b47f60388c49a8e95df6cee3221727","observation_id":"8105ea53-4ae9-4099-8061-a08b4bdaf9c5","resolution":{"observed_at":"2026-05-15T23:01:49.984096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2406.07791","doi":"10.48550/arxiv.2406.07791","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Judging the judges: A systematic study of position bias in llm-as-a-judge","venue":"arXiv (Cornell University)","work_id":"11308458-d080-4667-b088-70cc9c815627","year":2025},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-11T09:08:34.116683Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:f2fa8118066f8cf9170a94f186b66d32f595f82e1fd2422a9978cb1a2282d383","observation_id":"87a6cf65-e1a2-495b-b7c0-201cf7c4f6f6","resolution":{"observed_at":"2026-05-14T18:37:35.689428Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04531","last_updated":"2025-02-01T08:28:28Z","snapshot_observed_at":"2026-07-06T18:26:50.515452Z","submitted_at":"2024-06-06T22:07:50Z","title":"TESTEVAL: Benchmarking Large Language Models for Test Case Generation","version":2},"cited_work":{"arxiv_id":"2406.04531","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.04531","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Testeval: Benchmarking large language models for test case generation","venue":null,"work_id":"7c48f804-10b9-4ff7-be40-771b4a27d54e","year":2024},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-11T09:08:34.116683Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"cited_paper":"/paper/2406.04531","citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:4ab0bb83dcfb96ae19ca18c2394357c7d34268fa729b589ab43eafca01d893c5","observation_id":"186f474c-93d4-4942-af0e-5c2d5ddf9276","resolution":{"observed_at":"2026-05-14T18:37:35.700926Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.16741","last_updated":"2025-04-18T18:14:31Z","snapshot_observed_at":"2026-08-02T14:58:44.167588Z","submitted_at":"2024-07-23T17:50:43Z","title":"OpenHands: An Open Platform for AI Software Developers as Generalist Agents","version":3},"cited_work":{"arxiv_id":"2407.16741","doi":"10.1145/3718958.3750537","metadata_source":"pith","pith_arxiv_id":"2407.16741","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenHands: An Open Platform for AI Software Developers as Generalist Agents","venue":"cs.SE","work_id":"f1762ea0-e382-4f38-a28c-adc643789859","year":2024},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-11T09:08:34.116683Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"cited_paper":"/paper/2407.16741","citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:d9fc07538f99f10d3305eb9ff014b1a0ff5279401de3b033edff10f09bfda5af","observation_id":"ffbef9ce-f7a9-451c-95f4-794e77d3bc1a","resolution":{"observed_at":"2026-05-14T18:37:35.682928Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.05459","doi":"10.48550/arxiv.2511.05459","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Swe-compass: Towards unified evaluation of agentic coding abilities for large language models","venue":"ArXiv.org","work_id":"d066d198-9f17-456c-b54f-1e021e2491d4","year":2025},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-11T09:08:34.116683Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:4fe7576764e98791a94ba1e1c3728b95065f3b19b10c5d677d6b7453c78eb2f1","observation_id":"cd10b8d8-8ccd-4133-a331-affe3082a46f","resolution":{"observed_at":"2026-05-14T18:37:35.718131Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-07-11T01:50:50.256143+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T01:50:50.256143+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15793","last_updated":"2024-11-11T20:01:15Z","snapshot_observed_at":"2026-07-06T18:19:29.996982Z","submitted_at":"2024-05-06T17:41:33Z","title":"SWE-agent: Agent-Computer Interfaces Enable Automated Software Engineering","version":3},"cited_work":{"arxiv_id":"2405.15793","doi":"10.48550/arxiv.2405.15793","metadata_source":"pith","pith_arxiv_id":"2405.15793","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SWE-agent: Agent-Computer Interfaces Enable Automated Software Engineering","venue":"cs.SE","work_id":"01826cd9-a652-403c-a2ec-531da9fe2b6a","year":2024},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-11T09:08:34.116683Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"cited_paper":"/paper/2405.15793","citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:f9cc5f8b40621e54d959ad62fa03c276b9b45c3f15144ebe247504d32b8d9130","observation_id":"ba7c243e-a464-4d83-9c98-5bd5bb1aca93","resolution":{"observed_at":"2026-05-14T18:37:35.723441Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-07-14T18:20:24.962823+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T18:20:24.962823+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.21798","last_updated":"2025-05-21T17:21:45Z","snapshot_observed_at":"2026-08-11T02:21:44.551484Z","submitted_at":"2025-04-30T16:56:06Z","title":"SWE-smith: Scaling Data for Software Engineering Agents","version":2},"cited_work":{"arxiv_id":"2504.21798","doi":"10.48550/arxiv.2504.21798","metadata_source":"pith","pith_arxiv_id":"2504.21798","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SWE-smith: Scaling Data for Software Engineering Agents","venue":"cs.SE","work_id":"6a906763-2e4e-4cea-a19c-d7a169c9376b","year":2025},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-11T09:08:34.116683Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"cited_paper":"/paper/2504.21798","citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:a2c610ad0b54b2a79d9ea263b707eeb1fa28a2dd711a13a5cc8be346e627e8dd","observation_id":"6dc1be81-c762-4733-9820-836d59fdf508","resolution":{"observed_at":"2026-05-15T10:22:07.061654Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.05111","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T02:46:28.203038Z","title":"A survey on agent-as-a-judge","venue":null,"work_id":"87fad81b-b92e-4cdd-8ed9-4b3eab319533","year":2026},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-11T09:08:34.116683Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:b43db405e4da72c9aceb9956b44f72dc814836704d7fd9e6c81a34abbb138a4f","observation_id":"9bf6cb5b-05b5-465a-a0a9-35aead4d7647","resolution":{"observed_at":"2026-05-14T18:37:35.636641Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09289","last_updated":"2025-06-10T22:56:49Z","snapshot_observed_at":"2026-08-09T11:07:05.731678Z","submitted_at":"2025-06-10T22:56:49Z","title":"UTBoost: Rigorous Evaluation of Coding Agents on SWE-Bench","version":1},"cited_work":{"arxiv_id":"2506.09289","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.09289","snapshot_observed_at":"2026-07-09T00:45:49.165798Z","title":"Utboost: Rigorous evaluation of coding agents on swe-bench","venue":"cs.SE","work_id":"9a32973a-42d7-45be-b7f4-1c8f16defec1","year":2025},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-11T09:08:34.116683Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"cited_paper":"/paper/2506.09289","citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:93dd29c7bd1339cc63dbe41473c65f405927f3593d8f510120a04ab759878436","observation_id":"e8bffac2-2362-405e-979e-0d80bf9124d8","resolution":{"observed_at":"2026-05-14T18:37:35.712422Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02605","last_updated":"2025-04-03T14:06:17Z","snapshot_observed_at":"2026-08-09T23:51:45.534260Z","submitted_at":"2025-04-03T14:06:17Z","title":"Multi-SWE-bench: A Multilingual Benchmark for Issue Resolving","version":1},"cited_work":{"arxiv_id":"2504.02605","doi":"10.48550/arxiv.2504.02605","metadata_source":"pith","pith_arxiv_id":"2504.02605","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multi-SWE-bench: A Multilingual Benchmark for Issue Resolving","venue":"cs.SE","work_id":"c66ce635-0931-4807-8300-a45863330d75","year":2025},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-11T09:08:34.116683Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"cited_paper":"/paper/2504.02605","citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:f68650b12c5c3f3e16964bfef8a59ea0f27098b0218151b46b294e9855131c63","observation_id":"5d79af07-b491-413c-9565-b0ca16be89d0","resolution":{"observed_at":"2026-05-16T06:48:50.578231Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-07-11T01:50:49.442994+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T01:50:49.442994+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.04064","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Benchmarking and studying the LLM-based agent system in end-to-end software development","venue":null,"work_id":"dc25761d-fffa-46f4-abf5-626b1e80b59b","year":2025},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-11T09:08:34.116683Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:85cf02d455898b54acf63b054b88fd5ad136108f51bac2bf0a302c0f247973f2","observation_id":"58b34f3b-6e84-46fa-8d8f-b4ba0606b841","resolution":{"observed_at":"2026-05-14T18:37:35.706846Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.23448","last_updated":"2026-04-07T08:07:13Z","snapshot_observed_at":"2026-08-11T12:52:04.306608Z","submitted_at":"2026-03-24T17:19:32Z","title":"Code Review Agent Benchmark","version":3},"cited_work":{"arxiv_id":"2603.23448","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.23448","snapshot_observed_at":"2026-07-01T23:46:24.195113Z","title":"Code Review Agent Benchmark","venue":"cs.SE","work_id":"7b56d65d-90c8-4222-b267-b8e4ca8eacf7","year":2026},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-11T09:08:34.116683Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"cited_paper":"/paper/2603.23448","citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:b89594f3bc5a0b0ac5e340150fc32e6d8277edd2ee661d3ad5625023563d9286","observation_id":"4137c77f-1907-4dab-a990-90f6801c62e1","resolution":{"observed_at":"2026-05-14T18:37:35.601499Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05685","last_updated":"2023-12-24T02:01:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-09T05:55:52Z","title":"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena","version":4},"cited_work":{"arxiv_id":"2306.05685","doi":"10.1109/4235.797969","metadata_source":"pith","pith_arxiv_id":"2306.05685","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena","venue":"cs.CL","work_id":"d0c30cd7-81e1-4159-a87f-f6adca77ff08","year":2023},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-11T09:08:34.116683Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"cited_paper":"/paper/2306.05685","citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:1c9119575c936b5e725371555ec4fa4c090f3a3badb8a71fe30e60d0d08764ab","observation_id":"ed42a165-78bc-424e-87dd-a1eb4ae84664","resolution":{"observed_at":"2026-05-14T18:37:35.595562Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.10975","doi":"10.48550/arxiv.2602.10975","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Featurebench: Benchmarking agentic coding for complex feature development","venue":"Open MIND","work_id":"b018156c-79c6-4598-ab07-bbbd49818525","year":2026},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-11T09:08:34.116683Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:d96b83e172e16cbd8b2ae6432790c4a74b6c371ddc23a1c691881d9d3862951e","observation_id":"d9834f42-147b-4b28-8578-ef0bb7705754","resolution":{"observed_at":"2026-05-14T18:37:35.606935Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02825","last_updated":"2025-08-07T06:58:08Z","snapshot_observed_at":"2026-08-09T13:14:30.968472Z","submitted_at":"2025-07-03T17:35:31Z","title":"Establishing Best Practices for Building Rigorous Agentic Benchmarks","version":5},"cited_work":{"arxiv_id":"2507.02825","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02825","snapshot_observed_at":"2026-07-03T22:08:59.930877Z","title":"Establishing best practices for building rigorous agentic benchmarks","venue":null,"work_id":"981c0760-99e5-4175-bca8-6be3ed159f5b","year":2025},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-11T09:08:34.116683Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"cited_paper":"/paper/2507.02825","citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:9d7cc2a43288e561db8568bee9a369b27d5f5c6c9c90624ae3aa3a745c465c4a","observation_id":"439b1478-b2b6-49fe-b683-513b6b3c67d9","resolution":{"observed_at":"2026-05-14T18:37:35.612990Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10934","last_updated":"2024-10-16T17:54:12Z","snapshot_observed_at":"2026-08-08T15:14:50.065788Z","submitted_at":"2024-10-14T17:57:02Z","title":"Agent-as-a-Judge: Evaluate Agents with Agents","version":2},"cited_work":{"arxiv_id":"2410.10934","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.10934","snapshot_observed_at":"2026-07-10T15:07:19.644728Z","title":"arXiv preprint 2410.10934","venue":"cs.AI","work_id":"2e127924-0ccf-418b-9de5-0daa4fb9ad9b","year":2024},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-11T09:08:34.116683Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"cited_paper":"/paper/2410.10934","citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:6543ec3bbc953c95013675f7581d48f5f2e1b02a17c38b20e1c228ed1c49357e","observation_id":"25d3278a-d921-4036-8ea9-7e4ab95b21e4","resolution":{"observed_at":"2026-05-14T18:37:35.630963Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"6007bda5-a8dc-41c0-8863-1c3c9e068d4b","year":null},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-11T09:08:34.116683Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:5f93fe862b7a79962a699cc2b09d902fea6f5f54648496704a03d95477f9d644","observation_id":"8d69d62f-7e95-4fb1-ab4e-023371b1f24b","resolution":{"observed_at":"2026-05-15T23:01:50.043851Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"4a28afb8-73d8-456f-8625-511c40d5f828","year":null},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-11T09:08:34.116683Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:432ae26b1791254c493293b6590fae47b84f33b99f9c268bd2c8b7e7556ee9bd","observation_id":"2e21bd4a-f7af-4c30-bba1-7b2bfbca1dcc","resolution":{"observed_at":"2026-05-15T23:01:50.010212Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"dad75306-4153-4ba2-8e03-0ba06e52ea28","year":null},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-11T09:08:34.116683Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:d8c13fc727d5fcab37d3b689277accd0f31435d296da3bf793b90a92e5a5ca86","observation_id":"1d57bd5b-70e3-4bbd-bac1-4f537dedcefc","resolution":{"observed_at":"2026-05-15T23:01:50.022529Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"90e132e2-227e-4062-a00d-d9aa1f8bd637","year":null},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-11T09:08:34.116683Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:10b4b93206e58e749c6d38bf018f280cd1c0730d4f780b0b98ee851a4b0c1fb2","observation_id":"b120c0a3-ec14-47c2-9d62-564cb9377c83","resolution":{"observed_at":"2026-05-15T23:01:50.035401Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"980f4c14-b594-4f8e-ac04-7cfb8ad2693f","year":null},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-11T09:08:34.116683Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:1fcc1020a84c4710e89f3358f23b3e6868e7a1e4be8cfd8fe4974cfc17d814be","observation_id":"01a4390e-1089-4a6e-9157-30213b2708e1","resolution":{"observed_at":"2026-05-15T23:01:50.002326Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Couldn’t find the node_modules state file","venue":null,"work_id":"eb200b34-5fcd-4599-a956-5b05395fb5e9","year":null},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-11T09:08:34.116683Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:19b1ce97850240f92cd0fbba9293771b7e88752f6419e3809239ff8585320034","observation_id":"bfeed184-1892-446e-8941-50f8d41799ec","resolution":{"observed_at":"2026-05-15T23:01:49.919142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"aa1ca75e-03a9-43b5-af55-51784cc17d51","year":null},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-11T09:08:34.116683Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:cada316541cfe859d442748f7e194efcc147e8532ec956bf616b5255c0b4ef47","observation_id":"30114309-4de2-44d2-ac52-6bec5cca32d4","resolution":{"observed_at":"2026-05-15T23:01:49.988243Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"a898064c-cb2a-4da4-821d-9c0ac22b0aab","year":null},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-11T09:08:34.116683Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:c53a19dfd1d9d9892d2033686e447bdfedd471ab32ceeee98eaa84d75ef9e95a","observation_id":"769648b1-d8f0-4bf2-b349-6c597f4914c7","resolution":{"observed_at":"2026-05-15T23:01:49.905830Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dynamic: Node.js v18.20.8 available, packages import successfully, 359 tests collected","venue":null,"work_id":"2ef58fdf-e071-4761-baee-6198f467a324","year":null},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-11T09:08:34.116683Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:5fb05e9fa86fed88ffbeb25e32e49ff97cca1d656e6768c398791042a59d18c3","observation_id":"f338d8c3-2562-4565-a009-be497e945760","resolution":{"observed_at":"2026-05-15T23:01:49.923955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dynamic: Phase 1 fails with TypeError: User.getLocalCoverPath is not a function (imprecise failure)","venue":null,"work_id":"3408be9c-1d4d-418f-b9e5-95861207befd","year":null},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-11T09:08:34.116683Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:aa9b318367816161cc8d53b51d7946eccb031a36f04b2fb117a401b1914aed2e","observation_id":"ab444dc9-7c4d-4cf9-a427-284fbd7287df","resolution":{"observed_at":"2026-05-15T23:01:49.897115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f680e9c0-7b1f-4bdf-875c-ef0b39641cf5","year":null},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-11T09:08:34.116683Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:81a6e8dcf69b056f7092042a03eef75711d44c67fb8f81fa13fd9a7a3555d78b","observation_id":"8aed5eff-be21-45ab-b9e6-3af4fa0013d5","resolution":{"observed_at":"2026-05-15T23:01:49.883785Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Score: 2/4","venue":null,"work_id":"9e93ee54-5c8b-415e-8f7e-0ef0e5be69db","year":null},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-11T09:08:34.116683Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:56a178dfb729cb7e38db0f6ffe5e12a151d5cda2f106d419b5ad118239b628ea","observation_id":"1506d4e0-abd3-417f-91c2-95a62a1c3083","resolution":{"observed_at":"2026-05-15T23:01:49.888657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The agent correctly implements both required changes: adding -Dsolr.max.booleanClauses=30000 to SOLR_OPTSand definingFILTER_BOOK_LIMIT = 30_000","venue":null,"work_id":"ee9f3abb-c237-4374-9070-3f0ad4c2098b","year":null},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-11T09:08:34.116683Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:e52ddd7f438a79e625e849b67106099284454d28181cfea7fad9fff07309d632","observation_id":"d5894d27-5935-435f-a6f7-38e2f3d532ad","resolution":{"observed_at":"2026-05-15T23:01:49.979350Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Both tests pass: test_filter_book_limit_constant_exists and test_solr_opts_has_boolean_clauses_limit","venue":null,"work_id":"78209386-ae23-4aca-9c6c-580bfda7812d","year":null},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-11T09:08:34.116683Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:357d3a0a530f6e91e54b6b3ae0b00146b8d205807a9256bf04761ee973c71096","observation_id":"69bbb8a5-8322-48fc-9519-5a3d666f09a6","resolution":{"observed_at":"2026-05-15T23:01:49.937280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"SWE-Judge confirms the agent’s tests are not trivial or overfitted: they verify specific code content rather than relying on indirect signals","venue":null,"work_id":"f038fe73-3c82-4964-a5e9-76e4c5d3ed7a","year":null},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-11T09:08:34.116683Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:ae3c073c12920f114f24ef0cf44775f08d494f7bf8633ede7dad29025b593eb6","observation_id":"15fd44fd-657f-4a83-9e13-cfb5c271921a","resolution":{"observed_at":"2026-05-15T23:01:49.997690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dynamic: Python 3.11.1 available, but core package import fails (ModuleNotFoundError: web)","venue":null,"work_id":"9c522878-50e2-4272-94c7-c99748785440","year":null},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-11T09:08:34.116683Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:a4bbfbbc6d99821b2701d4d2c02d8635fc39e4a4e68b7b163c034e73f916a140","observation_id":"0e0feb14-e7c4-48c9-be4e-2a496622fdad","resolution":{"observed_at":"2026-05-15T23:01:49.992963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"6b5d5a92-94a9-4ff6-9d09-b9717c0c8d83","year":null},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-11T09:08:34.116683Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:9cf513b2fa1903d76bc0f480c0a9060caf1cfc29d82e109527895245f5d7cb7b","observation_id":"e83ddd70-1853-42e4-8426-01e8921b2968","resolution":{"observed_at":"2026-05-15T23:01:49.961018Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The agent’s implementation aligns closely with the golden patch, using cleaner error handling patterns in some cases","venue":null,"work_id":"4216faed-713b-4e3b-ae88-e4f2a4db02aa","year":null},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-11T09:08:34.116683Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:87e7fe82dcad7c9844b1a928793eebe278c588c14c480f56f3b44d7f2a29d43f","observation_id":"e389089a-a207-4b09-8069-47139314dddf","resolution":{"observed_at":"2026-05-15T23:01:49.933040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"to confirm compilation succeeds, then uses a non-matching test pattern to verify test collection without execution","venue":null,"work_id":"0f422c5a-b0fc-484e-a8aa-2724597fa2c9","year":null},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-11T09:08:34.116683Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:8662668073583c900e648e38054087625cab508fc874496156c1693d81d53abd","observation_id":"86b61698-9222-47dc-9084-83d69b810310","resolution":{"observed_at":"2026-05-15T23:01:50.039513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Implementation is functionally identical to gold.patch—correctly implementsescapeseqfilter with equivalent logic","venue":null,"work_id":"e1c8f457-cc3d-4829-87d0-a13ab466bd7c","year":null},"citing_paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","snapshot_observed_at":"2026-08-11T09:08:34.116683Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-14T18:34:39.997353Z"},"links":{"citing_paper":"/paper/2605.13139"},"observation_digest":"sha256:e1443788f971bd6736020c04c508c9362d8807070b87e092efac3cbb223efc78","observation_id":"711dc2ad-1865-4a14-98d0-c69ea1dfcf20","resolution":{"observed_at":"2026-05-15T23:01:49.879449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.13139","last_updated":"2026-05-13T08:05:16Z","latest_version":1,"primary_category":"cs.SE","snapshot_observed_at":"2026-08-11T09:08:34.116683Z","submitted_at":"2026-05-13T08:05:16Z","title":"SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle"},"reference_resolution":{"displayed":66,"state_counts":{"malformed_identifier":1,"metadata_mismatch":5,"parse_uncertain":0,"unresolved":10,"verified_exact":22,"verified_fuzzy":28},"total_outbound_references":66},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 66 of 66 outbound references and 2 inbound Pith citation observations for arXiv:2605.13139."}