{"as_of":"2026-08-23T15:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d589ce5d96e4b10bd11a6e3668c04703363b4752d857496c20e27001cc9ba34c","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":35,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T21:32:07.773449Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.08703","last_updated":"2025-04-23T20:22:37Z","snapshot_observed_at":"2026-08-21T12:55:07.095532Z","submitted_at":"2025-04-11T17:08:02Z","title":"SWE-PolyBench: A multi-language benchmark for repository level evaluation of coding agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08703","snapshot_observed_at":"2026-08-15T21:32:07.773449Z","title":"Swe-polybench: A multi-language benchmark for repository level evaluation of coding agents, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.09569","last_updated":"2026-05-28T04:44:35Z","snapshot_observed_at":"2026-08-18T13:16:39.102859Z","submitted_at":"2025-05-14T17:11:23Z","title":"MigrationBench: Repository-Level Code Migration Benchmark from Java 8","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T21:32:07.773449Z"},"links":{"cited_paper":"/paper/2504.08703","citing_paper":"/paper/2505.09569"},"observation_digest":"sha256:8dcc8b138b9313e1889a92cc292baa800a567586870b3a159cf26b4b5c159605","observation_id":"0ec09632-f2d9-4c6a-95be-8947c0d99554","resolution":{"observed_at":"2026-08-15T21:32:07.773449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08703","last_updated":"2025-04-23T20:22:37Z","snapshot_observed_at":"2026-08-21T12:55:07.095532Z","submitted_at":"2025-04-11T17:08:02Z","title":"SWE-PolyBench: A multi-language benchmark for repository level evaluation of coding agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08703","snapshot_observed_at":"2026-08-07T12:35:33.519926Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24715","last_updated":"2025-05-30T15:36:37Z","snapshot_observed_at":"2026-08-18T00:58:38.899466Z","submitted_at":"2025-05-30T15:36:37Z","title":"CoRet: Improved Retriever for Code Editing","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:33.519926Z"},"links":{"cited_paper":"/paper/2504.08703","citing_paper":"/paper/2505.24715"},"observation_digest":"sha256:182a34f5f50ddeb436a97291204251c624c59165b7aab2a06d86b5e74c2dd50e","observation_id":"c6840061-8020-4f91-9307-9c76666be5f1","resolution":{"observed_at":"2026-08-07T12:35:33.519926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08703","last_updated":"2025-04-23T20:22:37Z","snapshot_observed_at":"2026-08-21T12:55:07.095532Z","submitted_at":"2025-04-11T17:08:02Z","title":"SWE-PolyBench: A multi-language benchmark for repository level evaluation of coding agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08703","snapshot_observed_at":"2026-08-15T19:26:51.172895Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.16650","last_updated":"2025-06-19T23:27:58Z","snapshot_observed_at":"2026-08-18T19:52:43.751629Z","submitted_at":"2025-06-19T23:27:58Z","title":"SemAgent: A Semantics Aware Program Repair Agent","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T19:26:51.172895Z"},"links":{"cited_paper":"/paper/2504.08703","citing_paper":"/paper/2506.16650"},"observation_digest":"sha256:bbd3b4f69be4c9e263ed915b39af52de250c90abc0c631d692f1d3e99ac7cb1f","observation_id":"8d5a436d-2c7d-4f6c-a0c4-cc0393dca03d","resolution":{"observed_at":"2026-08-15T19:26:51.172895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08703","last_updated":"2025-04-23T20:22:37Z","snapshot_observed_at":"2026-08-21T12:55:07.095532Z","submitted_at":"2025-04-11T17:08:02Z","title":"SWE-PolyBench: A multi-language benchmark for repository level evaluation of coding agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08703","snapshot_observed_at":"2026-08-15T19:06:53.865883Z","title":"Swe-polybench: A multi-language benchmark for repository level evaluation of coding agents,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17812","last_updated":"2025-06-21T20:56:20Z","snapshot_observed_at":"2026-08-20T14:23:24.044192Z","submitted_at":"2025-06-21T20:56:20Z","title":"Is Your Automated Software Engineer Trustworthy?","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T19:06:53.865883Z"},"links":{"cited_paper":"/paper/2504.08703","citing_paper":"/paper/2506.17812"},"observation_digest":"sha256:703a5f0845c781af3892b1c3f9b39b159f8ab3f26260de9dff6a049394bc9f3d","observation_id":"89ce5fba-1f0f-4c4c-a4b2-0eb064c6aa2e","resolution":{"observed_at":"2026-08-15T19:06:53.865883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08703","last_updated":"2025-04-23T20:22:37Z","snapshot_observed_at":"2026-08-21T12:55:07.095532Z","submitted_at":"2025-04-11T17:08:02Z","title":"SWE-PolyBench: A multi-language benchmark for repository level evaluation of coding agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08703","snapshot_observed_at":"2026-08-06T16:29:48.231955Z","title":"Swe-polybench: A multi-language benchmark for repository level evaluation of coding agents,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.13499","last_updated":"2025-07-17T19:11:00Z","snapshot_observed_at":"2026-08-14T11:07:22.226195Z","submitted_at":"2025-07-17T19:11:00Z","title":"AI-Assisted Fixes to Code Review Comments at Scale","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T16:29:48.231955Z"},"links":{"cited_paper":"/paper/2504.08703","citing_paper":"/paper/2507.13499"},"observation_digest":"sha256:da35f727640602d2238b9219e00fc5d37c74e4791559d77e15c7804be8c15174","observation_id":"f959a0d6-0aac-4caa-8f88-4f6a70d79a16","resolution":{"observed_at":"2026-08-06T16:29:48.231955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08703","last_updated":"2025-04-23T20:22:37Z","snapshot_observed_at":"2026-08-21T12:55:07.095532Z","submitted_at":"2025-04-11T17:08:02Z","title":"SWE-PolyBench: A multi-language benchmark for repository level evaluation of coding agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08703","snapshot_observed_at":"2026-08-06T14:43:14.337616Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.18130","last_updated":"2025-08-18T15:26:59Z","snapshot_observed_at":"2026-08-15T13:19:22.203600Z","submitted_at":"2025-07-24T06:38:19Z","title":"NoCode-bench: A Benchmark for Evaluating Natural Language-Driven Feature Addition","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T14:43:14.337616Z"},"links":{"cited_paper":"/paper/2504.08703","citing_paper":"/paper/2507.18130"},"observation_digest":"sha256:142fa4b16abe34f97cb74b39a0bd82e832cb7420b424ed900b2c8581bcc351df","observation_id":"9db39d24-7605-4fab-ab05-23178030fac3","resolution":{"observed_at":"2026-08-06T14:43:14.337616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08703","last_updated":"2025-04-23T20:22:37Z","snapshot_observed_at":"2026-08-21T12:55:07.095532Z","submitted_at":"2025-04-11T17:08:02Z","title":"SWE-PolyBench: A multi-language benchmark for repository level evaluation of coding agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08703","snapshot_observed_at":"2026-08-05T10:28:37.987551Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.04078","last_updated":"2025-09-08T08:22:38Z","snapshot_observed_at":"2026-08-19T08:23:22.995820Z","submitted_at":"2025-09-04T10:13:21Z","title":"RepoDebug: Repository-Level Multi-Task and Multi-Language Debugging Evaluation of Large Language Models","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-05T10:28:37.987551Z"},"links":{"cited_paper":"/paper/2504.08703","citing_paper":"/paper/2509.04078"},"observation_digest":"sha256:9b6aa66352ec911c6c2147ae0ad695d38721c5af48e117544543d3cb3e571ce3","observation_id":"5a38868c-0153-4821-b29e-ffea33ada3bb","resolution":{"observed_at":"2026-08-05T10:28:37.987551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08703","last_updated":"2025-04-23T20:22:37Z","snapshot_observed_at":"2026-08-21T12:55:07.095532Z","submitted_at":"2025-04-11T17:08:02Z","title":"SWE-PolyBench: A multi-language benchmark for repository level evaluation of coding agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08703","snapshot_observed_at":"2026-08-03T13:15:17.244078Z","title":"Swe-polybench: A multi-language benchmark for repository level evaluation of coding agents.arXiv preprint arXiv:2504.08703, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.25065","last_updated":"2026-06-16T17:27:56Z","snapshot_observed_at":"2026-08-10T02:04:46.374678Z","submitted_at":"2025-12-31T18:58:19Z","title":"Vulcan: Instance-specialized, Verifiable Systems Heuristics Through LLM-driven Search","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-03T13:15:17.244078Z"},"links":{"cited_paper":"/paper/2504.08703","citing_paper":"/paper/2512.25065"},"observation_digest":"sha256:ec9772cee11d95fa195a6b1cfe8129ec1d9feb6765f46cc6667e0f5d4b8b6293","observation_id":"556750d0-1a52-4700-a53a-c74ffca308bc","resolution":{"observed_at":"2026-08-03T13:15:17.244078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08703","last_updated":"2025-04-23T20:22:37Z","snapshot_observed_at":"2026-08-21T12:55:07.095532Z","submitted_at":"2025-04-11T17:08:02Z","title":"SWE-PolyBench: A multi-language benchmark for repository level evaluation of coding agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08703","snapshot_observed_at":"2026-08-02T19:12:54.875615Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.03194","last_updated":"2026-05-26T12:00:46Z","snapshot_observed_at":"2026-08-20T16:45:18.617760Z","submitted_at":"2026-03-03T17:52:01Z","title":"BeyondSWE: Can Current Code Agent Survive Beyond Single-Repo Bug Fixing?","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T19:12:54.875615Z"},"links":{"cited_paper":"/paper/2504.08703","citing_paper":"/paper/2603.03194"},"observation_digest":"sha256:e7987e93cf8d6e0dae5ba2b6d205a060cd22ef075d1f0639a089da91b2f5161a","observation_id":"7275fef0-9400-493e-bb0f-73e710672053","resolution":{"observed_at":"2026-08-02T19:12:54.875615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08703","last_updated":"2025-04-23T20:22:37Z","snapshot_observed_at":"2026-08-21T12:55:07.095532Z","submitted_at":"2025-04-11T17:08:02Z","title":"SWE-PolyBench: A multi-language benchmark for repository level evaluation of coding agents","version":3},"cited_work":{"arxiv_id":"2504.08703","doi":"10.48550/arxiv.2504.08703","metadata_source":"pith","pith_arxiv_id":"2504.08703","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Swe-polybench: A multi-language benchmark for repository level evaluation of coding agents","venue":"cs.SE","work_id":"611fbec5-22e8-47e9-9dde-f27c272a3d63","year":2025},"citing_paper":{"arxiv_id":"2605.04320","last_updated":"2026-05-07T19:11:05Z","snapshot_observed_at":"2026-08-21T10:26:55.263167Z","submitted_at":"2026-05-05T21:49:52Z","title":"Reproduction Test Generation for Java SWE Issues","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-08T16:56:33.346935Z"},"links":{"cited_paper":"/paper/2504.08703","citing_paper":"/paper/2605.04320"},"observation_digest":"sha256:ebdff7829e0ebbdd9293e4ab2576081797fa22a9931a0cfd64593131ba05ca1e","observation_id":"4de5c26f-12ea-44f2-a967-ffdc32a0d7ec","resolution":{"observed_at":"2026-05-11T17:56:06.513480Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-07-11T01:50:49.842142+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T01:50:49.842142+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08703","last_updated":"2025-04-23T20:22:37Z","snapshot_observed_at":"2026-08-21T12:55:07.095532Z","submitted_at":"2025-04-11T17:08:02Z","title":"SWE-PolyBench: A multi-language benchmark for repository level evaluation of coding agents","version":3},"cited_work":{"arxiv_id":"2504.08703","doi":"10.48550/arxiv.2504.08703","metadata_source":"pith","pith_arxiv_id":"2504.08703","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Swe-polybench: A multi-language benchmark for repository level evaluation of coding agents","venue":"cs.SE","work_id":"611fbec5-22e8-47e9-9dde-f27c272a3d63","year":2025},"citing_paper":{"arxiv_id":"2605.04320","last_updated":"2026-05-07T19:11:05Z","snapshot_observed_at":"2026-08-21T10:26:55.263167Z","submitted_at":"2026-05-05T21:49:52Z","title":"Reproduction Test Generation for Java SWE Issues","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-11T00:48:28.794195Z"},"links":{"cited_paper":"/paper/2504.08703","citing_paper":"/paper/2605.04320"},"observation_digest":"sha256:6cc6037a3750071eafbb34edcdc07ea4e520ecca79f2cb0fadc64d2081934d85","observation_id":"084b3ac7-c203-40f1-b9a1-b5cc75fc3470","resolution":{"observed_at":"2026-05-11T00:50:49.895264Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-07-11T01:50:49.842142+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T01:50:49.842142+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08703","last_updated":"2025-04-23T20:22:37Z","snapshot_observed_at":"2026-08-21T12:55:07.095532Z","submitted_at":"2025-04-11T17:08:02Z","title":"SWE-PolyBench: A multi-language benchmark for repository level evaluation of coding agents","version":3},"cited_work":{"arxiv_id":"2504.08703","doi":"10.48550/arxiv.2504.08703","metadata_source":"pith","pith_arxiv_id":"2504.08703","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Swe-polybench: A multi-language benchmark for repository level evaluation of coding agents","venue":"cs.SE","work_id":"611fbec5-22e8-47e9-9dde-f27c272a3d63","year":2025},"citing_paper":{"arxiv_id":"2605.06445","last_updated":"2026-05-07T15:44:40Z","snapshot_observed_at":"2026-08-15T00:01:59.493454Z","submitted_at":"2026-05-07T15:44:40Z","title":"Constraint Decay: The Fragility of LLM Agents in Backend Code Generation","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-08T08:48:36.848425Z"},"links":{"cited_paper":"/paper/2504.08703","citing_paper":"/paper/2605.06445"},"observation_digest":"sha256:2bec5418aa9ed59de795a2a04f677b1ab4b9f32751f9771b64adfee7da6d08d9","observation_id":"dd5f6290-f84e-4999-9947-6ed841d1a0eb","resolution":{"observed_at":"2026-05-11T20:31:11.916648Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-07-11T01:50:49.842142+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T01:50:49.842142+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08703","last_updated":"2025-04-23T20:22:37Z","snapshot_observed_at":"2026-08-21T12:55:07.095532Z","submitted_at":"2025-04-11T17:08:02Z","title":"SWE-PolyBench: A multi-language benchmark for repository level evaluation of coding agents","version":3},"cited_work":{"arxiv_id":"2504.08703","doi":"10.48550/arxiv.2504.08703","metadata_source":"pith","pith_arxiv_id":"2504.08703","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Swe-polybench: A multi-language benchmark for repository level evaluation of coding agents","venue":"cs.SE","work_id":"611fbec5-22e8-47e9-9dde-f27c272a3d63","year":2025},"citing_paper":{"arxiv_id":"2605.08693","last_updated":"2026-05-12T07:27:47Z","snapshot_observed_at":"2026-08-13T12:28:22.158396Z","submitted_at":"2026-05-09T05:03:00Z","title":"SkillMaster: Toward Autonomous Skill Mastery in LLM Agents","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-12T00:59:03.361037Z"},"links":{"cited_paper":"/paper/2504.08703","citing_paper":"/paper/2605.08693"},"observation_digest":"sha256:3f47f0eae7da949c3c66ab8b6ca8eb6a6a2b1308d3a70f32781557d609c696aa","observation_id":"79e4c14f-be29-40e1-b775-334c6b6e7ec4","resolution":{"observed_at":"2026-05-12T08:36:24.072276Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-07-11T01:50:49.842142+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T01:50:49.842142+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08703","last_updated":"2025-04-23T20:22:37Z","snapshot_observed_at":"2026-08-21T12:55:07.095532Z","submitted_at":"2025-04-11T17:08:02Z","title":"SWE-PolyBench: A multi-language benchmark for repository level evaluation of coding agents","version":3},"cited_work":{"arxiv_id":"2504.08703","doi":"10.48550/arxiv.2504.08703","metadata_source":"pith","pith_arxiv_id":"2504.08703","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Swe-polybench: A multi-language benchmark for repository level evaluation of coding agents","venue":"cs.SE","work_id":"611fbec5-22e8-47e9-9dde-f27c272a3d63","year":2025},"citing_paper":{"arxiv_id":"2605.08693","last_updated":"2026-05-12T07:27:47Z","snapshot_observed_at":"2026-08-13T12:28:22.158396Z","submitted_at":"2026-05-09T05:03:00Z","title":"SkillMaster: Toward Autonomous Skill Mastery in LLM Agents","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-13T07:30:09.985448Z"},"links":{"cited_paper":"/paper/2504.08703","citing_paper":"/paper/2605.08693"},"observation_digest":"sha256:c9dc9f867b2953da5b228cf5f9cb37dc9e61edd6dd38705d5b39ff4cdf01be0e","observation_id":"0ce48223-aa1f-4691-8e5e-fed59c3bf9d9","resolution":{"observed_at":"2026-05-13T07:32:29.879949Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-07-11T01:50:49.842142+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T01:50:49.842142+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08703","last_updated":"2025-04-23T20:22:37Z","snapshot_observed_at":"2026-08-21T12:55:07.095532Z","submitted_at":"2025-04-11T17:08:02Z","title":"SWE-PolyBench: A multi-language benchmark for repository level evaluation of coding agents","version":3},"cited_work":{"arxiv_id":"2504.08703","doi":"10.48550/arxiv.2504.08703","metadata_source":"pith","pith_arxiv_id":"2504.08703","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Swe-polybench: A multi-language benchmark for repository level evaluation of coding agents","venue":"cs.SE","work_id":"611fbec5-22e8-47e9-9dde-f27c272a3d63","year":2025},"citing_paper":{"arxiv_id":"2605.14859","last_updated":"2026-05-15T03:53:20Z","snapshot_observed_at":"2026-08-16T16:39:04.165278Z","submitted_at":"2026-05-14T14:05:58Z","title":"Do Coding Agents Understand Least-Privilege Authorization?","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-19T16:34:14.379419Z"},"links":{"cited_paper":"/paper/2504.08703","citing_paper":"/paper/2605.14859"},"observation_digest":"sha256:a2e72340dc12c2cc0e557154c9a852884181ad609c0559ba8c2875971f4ea933","observation_id":"d2c908b6-d85d-4bed-ae64-dfdcbab49330","resolution":{"observed_at":"2026-05-19T16:37:39.990907Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-07-11T01:50:49.842142+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T01:50:49.842142+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08703","last_updated":"2025-04-23T20:22:37Z","snapshot_observed_at":"2026-08-21T12:55:07.095532Z","submitted_at":"2025-04-11T17:08:02Z","title":"SWE-PolyBench: A multi-language benchmark for repository level evaluation of coding agents","version":3},"cited_work":{"arxiv_id":"2504.08703","doi":"10.48550/arxiv.2504.08703","metadata_source":"pith","pith_arxiv_id":"2504.08703","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Swe-polybench: A multi-language benchmark for repository level evaluation of coding agents","venue":"cs.SE","work_id":"611fbec5-22e8-47e9-9dde-f27c272a3d63","year":2025},"citing_paper":{"arxiv_id":"2605.26100","last_updated":"2026-05-25T17:56:46Z","snapshot_observed_at":"2026-08-15T11:49:48.589801Z","submitted_at":"2026-05-25T17:56:46Z","title":"Beyond Summaries: Structure-Aware Labeling of Code Changes with Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-29T20:11:45.644494Z"},"links":{"cited_paper":"/paper/2504.08703","citing_paper":"/paper/2605.26100"},"observation_digest":"sha256:f0aa5bd488cae4e90fcb1144e99bffee3d7168a631f49fb7354774d22989fc12","observation_id":"7a29ded5-7b9f-49f1-89a8-621a29370407","resolution":{"observed_at":"2026-06-29T20:13:58.857087Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-07-11T01:50:49.842142+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T01:50:49.842142+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08703","last_updated":"2025-04-23T20:22:37Z","snapshot_observed_at":"2026-08-21T12:55:07.095532Z","submitted_at":"2025-04-11T17:08:02Z","title":"SWE-PolyBench: A multi-language benchmark for repository level evaluation of coding agents","version":3},"cited_work":{"arxiv_id":"2504.08703","doi":"10.48550/arxiv.2504.08703","metadata_source":"pith","pith_arxiv_id":"2504.08703","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Swe-polybench: A multi-language benchmark for repository level evaluation of coding agents","venue":"cs.SE","work_id":"611fbec5-22e8-47e9-9dde-f27c272a3d63","year":2025},"citing_paper":{"arxiv_id":"2605.26177","last_updated":"2026-05-25T06:26:43Z","snapshot_observed_at":"2026-07-06T23:36:06.135765Z","submitted_at":"2026-05-25T06:26:43Z","title":"RepoMirage: Probing Repository Context Reasoning in Code Agents with Perturbations","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-29T20:53:30.382870Z"},"links":{"cited_paper":"/paper/2504.08703","citing_paper":"/paper/2605.26177"},"observation_digest":"sha256:526e86d0f8442658081371e5b835f24857385476b9fd1418b18c4120f219aff9","observation_id":"ef2aa17a-230b-4cf0-bbe1-411dee9dd333","resolution":{"observed_at":"2026-06-29T20:53:57.810161Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-07-11T01:50:49.842142+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T01:50:49.842142+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08703","last_updated":"2025-04-23T20:22:37Z","snapshot_observed_at":"2026-08-21T12:55:07.095532Z","submitted_at":"2025-04-11T17:08:02Z","title":"SWE-PolyBench: A multi-language benchmark for repository level evaluation of coding agents","version":3},"cited_work":{"arxiv_id":"2504.08703","doi":"10.48550/arxiv.2504.08703","metadata_source":"pith","pith_arxiv_id":"2504.08703","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Swe-polybench: A multi-language benchmark for repository level evaluation of coding agents","venue":"cs.SE","work_id":"611fbec5-22e8-47e9-9dde-f27c272a3d63","year":2025},"citing_paper":{"arxiv_id":"2605.27489","last_updated":"2026-05-26T16:03:10Z","snapshot_observed_at":"2026-08-14T11:28:01.264566Z","submitted_at":"2026-05-26T16:03:10Z","title":"HARP: Measuring Harm Amplification in Multi-Agent LLM Systems","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-29T17:20:09.363041Z"},"links":{"cited_paper":"/paper/2504.08703","citing_paper":"/paper/2605.27489"},"observation_digest":"sha256:2952faa12e58e749536b32d9812be219a7e4867d3f07bb03e06b324fb86fd4c6","observation_id":"be5bfb7f-fc18-41eb-91f2-77ad0d2cecc9","resolution":{"observed_at":"2026-06-29T17:23:44.861699Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-07-11T01:50:49.842142+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T01:50:49.842142+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08703","last_updated":"2025-04-23T20:22:37Z","snapshot_observed_at":"2026-08-21T12:55:07.095532Z","submitted_at":"2025-04-11T17:08:02Z","title":"SWE-PolyBench: A multi-language benchmark for repository level evaluation of coding agents","version":3},"cited_work":{"arxiv_id":"2504.08703","doi":"10.48550/arxiv.2504.08703","metadata_source":"pith","pith_arxiv_id":"2504.08703","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Swe-polybench: A multi-language benchmark for repository level evaluation of coding agents","venue":"cs.SE","work_id":"611fbec5-22e8-47e9-9dde-f27c272a3d63","year":2025},"citing_paper":{"arxiv_id":"2606.05249","last_updated":"2026-06-03T12:48:53Z","snapshot_observed_at":"2026-08-08T22:49:24.290386Z","submitted_at":"2026-06-03T12:48:53Z","title":"SWE-InfraBench: Evaluating Language Models on Cloud Infrastructure Code","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-28T05:21:34.772199Z"},"links":{"cited_paper":"/paper/2504.08703","citing_paper":"/paper/2606.05249"},"observation_digest":"sha256:f5159bb758444a1fe8ada7e634c2996ebf8916e4b7cc0b5ed8601313ec11071c","observation_id":"4ce69601-6eb9-402b-b649-8167127c7905","resolution":{"observed_at":"2026-07-02T09:56:51.737060Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-07-11T01:50:49.842142+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T01:50:49.842142+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08703","last_updated":"2025-04-23T20:22:37Z","snapshot_observed_at":"2026-08-21T12:55:07.095532Z","submitted_at":"2025-04-11T17:08:02Z","title":"SWE-PolyBench: A multi-language benchmark for repository level evaluation of coding agents","version":3},"cited_work":{"arxiv_id":"2504.08703","doi":"10.48550/arxiv.2504.08703","metadata_source":"pith","pith_arxiv_id":"2504.08703","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Swe-polybench: A multi-language benchmark for repository level evaluation of coding agents","venue":"cs.SE","work_id":"611fbec5-22e8-47e9-9dde-f27c272a3d63","year":2025},"citing_paper":{"arxiv_id":"2606.08500","last_updated":"2026-06-07T07:57:22Z","snapshot_observed_at":"2026-08-03T18:22:47.492947Z","submitted_at":"2026-06-07T07:57:22Z","title":"Projecting the Emerging Mindset of SWE Agent by Launching a Wild Code Understanding Journey","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-27T18:18:41.453580Z"},"links":{"cited_paper":"/paper/2504.08703","citing_paper":"/paper/2606.08500"},"observation_digest":"sha256:24246615ea4160c9c116c4c2b617c93edb7bd4e5c605ce464ce0c6a9a1190cdf","observation_id":"40079cff-c810-4807-af2b-5e86041df481","resolution":{"observed_at":"2026-07-02T23:17:29.843586Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-07-11T01:50:49.842142+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T01:50:49.842142+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08703","last_updated":"2025-04-23T20:22:37Z","snapshot_observed_at":"2026-08-21T12:55:07.095532Z","submitted_at":"2025-04-11T17:08:02Z","title":"SWE-PolyBench: A multi-language benchmark for repository level evaluation of coding agents","version":3},"cited_work":{"arxiv_id":"2504.08703","doi":"10.48550/arxiv.2504.08703","metadata_source":"pith","pith_arxiv_id":"2504.08703","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Swe-polybench: A multi-language benchmark for repository level evaluation of coding agents","venue":"cs.SE","work_id":"611fbec5-22e8-47e9-9dde-f27c272a3d63","year":2025},"citing_paper":{"arxiv_id":"2606.22417","last_updated":"2026-06-21T10:10:51Z","snapshot_observed_at":"2026-08-15T05:55:37.162367Z","submitted_at":"2026-06-21T10:10:51Z","title":"Code Isn't Memory: A Structural Codebase Index Inside a Coding Agent","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-26T10:59:52.756992Z"},"links":{"cited_paper":"/paper/2504.08703","citing_paper":"/paper/2606.22417"},"observation_digest":"sha256:69104036737dfffe3ad489a82179ac88008f0e789595519b1fe14fb41600bd98","observation_id":"3db99ded-e4dc-4bbd-be11-530475791d76","resolution":{"observed_at":"2026-07-04T08:49:41.745699Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-07-11T01:50:49.842142+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T01:50:49.842142+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08703","last_updated":"2025-04-23T20:22:37Z","snapshot_observed_at":"2026-08-21T12:55:07.095532Z","submitted_at":"2025-04-11T17:08:02Z","title":"SWE-PolyBench: A multi-language benchmark for repository level evaluation of coding agents","version":3},"cited_work":{"arxiv_id":"2504.08703","doi":"10.48550/arxiv.2504.08703","metadata_source":"pith","pith_arxiv_id":"2504.08703","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Swe-polybench: A multi-language benchmark for repository level evaluation of coding agents","venue":"cs.SE","work_id":"611fbec5-22e8-47e9-9dde-f27c272a3d63","year":2025},"citing_paper":{"arxiv_id":"2606.22504","last_updated":"2026-06-21T13:52:37Z","snapshot_observed_at":"2026-08-12T16:08:21.984357Z","submitted_at":"2026-06-21T13:52:37Z","title":"Lingering Authority: Revocable Resource-and-Effect Capabilities for Coding Agents","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-26T10:13:31.405238Z"},"links":{"cited_paper":"/paper/2504.08703","citing_paper":"/paper/2606.22504"},"observation_digest":"sha256:78d977fca38d04b7ca796512f450f9d396a2d0df11815ad168577d043e0ea1ee","observation_id":"2f60a935-f5ec-46a0-a1ec-b17d58d41293","resolution":{"observed_at":"2026-07-04T09:19:43.615477Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-07-11T01:50:49.842142+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T01:50:49.842142+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08703","last_updated":"2025-04-23T20:22:37Z","snapshot_observed_at":"2026-08-21T12:55:07.095532Z","submitted_at":"2025-04-11T17:08:02Z","title":"SWE-PolyBench: A multi-language benchmark for repository level evaluation of coding agents","version":3},"cited_work":{"arxiv_id":"2504.08703","doi":"10.48550/arxiv.2504.08703","metadata_source":"pith","pith_arxiv_id":"2504.08703","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Swe-polybench: A multi-language benchmark for repository level evaluation of coding agents","venue":"cs.SE","work_id":"611fbec5-22e8-47e9-9dde-f27c272a3d63","year":2025},"citing_paper":{"arxiv_id":"2606.25514","last_updated":"2026-06-24T07:48:05Z","snapshot_observed_at":"2026-08-15T12:00:05.978192Z","submitted_at":"2026-06-24T07:48:05Z","title":"Unlocking Model Potentials Through Adaptive Multi-Agent Scaffolding for Efficient Issue Resolution","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-25T20:15:00.517571Z"},"links":{"cited_paper":"/paper/2504.08703","citing_paper":"/paper/2606.25514"},"observation_digest":"sha256:fab861571ea346dddf4cd29075106afab533ac01cd3c1a77c3e4ee2b1e7d9914","observation_id":"a0e49560-a412-4918-ac6c-83696027dce1","resolution":{"observed_at":"2026-07-04T20:20:07.786589Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-07-11T01:50:49.842142+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T01:50:49.842142+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08703","last_updated":"2025-04-23T20:22:37Z","snapshot_observed_at":"2026-08-21T12:55:07.095532Z","submitted_at":"2025-04-11T17:08:02Z","title":"SWE-PolyBench: A multi-language benchmark for repository level evaluation of coding agents","version":3},"cited_work":{"arxiv_id":"2504.08703","doi":"10.48550/arxiv.2504.08703","metadata_source":"pith","pith_arxiv_id":"2504.08703","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Swe-polybench: A multi-language benchmark for repository level evaluation of coding agents","venue":"cs.SE","work_id":"611fbec5-22e8-47e9-9dde-f27c272a3d63","year":2025},"citing_paper":{"arxiv_id":"2607.00700","last_updated":"2026-07-01T09:50:26Z","snapshot_observed_at":"2026-08-19T20:08:18.863692Z","submitted_at":"2026-07-01T09:50:26Z","title":"LLVM-Bench: Benchmarking and Advancing Large Language Models for LLVM Compiler Issue Resolution","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-02T08:42:10.658469Z"},"links":{"cited_paper":"/paper/2504.08703","citing_paper":"/paper/2607.00700"},"observation_digest":"sha256:d4a6fcc59278b8435bc1cffd01a7dbb29f4665fc13df1391c8cee9adc0768571","observation_id":"a4370db8-2b61-4139-983d-3fd729037edb","resolution":{"observed_at":"2026-07-02T08:46:48.588686Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-07-11T01:50:49.842142+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T01:50:49.842142+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08703","last_updated":"2025-04-23T20:22:37Z","snapshot_observed_at":"2026-08-21T12:55:07.095532Z","submitted_at":"2025-04-11T17:08:02Z","title":"SWE-PolyBench: A multi-language benchmark for repository level evaluation of coding agents","version":3},"cited_work":{"arxiv_id":"2504.08703","doi":"10.48550/arxiv.2504.08703","metadata_source":"pith","pith_arxiv_id":"2504.08703","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Swe-polybench: A multi-language benchmark for repository level evaluation of coding agents","venue":"cs.SE","work_id":"611fbec5-22e8-47e9-9dde-f27c272a3d63","year":2025},"citing_paper":{"arxiv_id":"2607.00990","last_updated":"2026-07-01T14:27:12Z","snapshot_observed_at":"2026-08-07T07:02:20.772696Z","submitted_at":"2026-07-01T14:27:12Z","title":"SWE-Doctor: Guiding Software Engineering Agents with Runtime Diagnosis from Multi-Faceted Bug Reproduction Tests","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-02T08:22:54.966922Z"},"links":{"cited_paper":"/paper/2504.08703","citing_paper":"/paper/2607.00990"},"observation_digest":"sha256:48ae7b147e02adc4322de5f84b5df385697496fb9839f67dac0da9104cbb6fb2","observation_id":"d6b33905-2d98-4e07-9a77-ff3abf94e719","resolution":{"observed_at":"2026-07-02T08:26:47.285372Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-07-11T01:50:49.842142+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T01:50:49.842142+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08703","last_updated":"2025-04-23T20:22:37Z","snapshot_observed_at":"2026-08-21T12:55:07.095532Z","submitted_at":"2025-04-11T17:08:02Z","title":"SWE-PolyBench: A multi-language benchmark for repository level evaluation of coding agents","version":3},"cited_work":{"arxiv_id":"2504.08703","doi":"10.48550/arxiv.2504.08703","metadata_source":"pith","pith_arxiv_id":"2504.08703","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Swe-polybench: A multi-language benchmark for repository level evaluation of coding agents","venue":"cs.SE","work_id":"611fbec5-22e8-47e9-9dde-f27c272a3d63","year":2025},"citing_paper":{"arxiv_id":"2607.06184","last_updated":"2026-07-07T12:09:46Z","snapshot_observed_at":"2026-08-15T23:05:54.249561Z","submitted_at":"2026-07-07T12:09:46Z","title":"What Resolve Rate Hides: Trajectory Structure Diagnostics for Coding Agents","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-08T14:16:25.641101Z"},"links":{"cited_paper":"/paper/2504.08703","citing_paper":"/paper/2607.06184"},"observation_digest":"sha256:e0336cd97ef495ca1b356bdf3a58807ee73e95932dad017d11f905c7469830c5","observation_id":"1a25496d-0ef0-4a49-8363-9c8639d30965","resolution":{"observed_at":"2026-07-08T14:25:02.410420Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-07-11T01:50:49.842142+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T01:50:49.842142+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08703","last_updated":"2025-04-23T20:22:37Z","snapshot_observed_at":"2026-08-21T12:55:07.095532Z","submitted_at":"2025-04-11T17:08:02Z","title":"SWE-PolyBench: A multi-language benchmark for repository level evaluation of coding agents","version":3},"cited_work":{"arxiv_id":"2504.08703","doi":"10.48550/arxiv.2504.08703","metadata_source":"pith","pith_arxiv_id":"2504.08703","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Swe-polybench: A multi-language benchmark for repository level evaluation of coding agents","venue":"cs.SE","work_id":"611fbec5-22e8-47e9-9dde-f27c272a3d63","year":2025},"citing_paper":{"arxiv_id":"2607.08009","last_updated":"2026-07-09T00:27:07Z","snapshot_observed_at":"2026-08-13T06:08:17.610900Z","submitted_at":"2026-07-09T00:27:07Z","title":"From Execution to Education: A Bloom-Aligned Framework for Measuring Educational Control in LLMs","version":1},"reference_index":149,"source":"arxiv_source","source_observed_at":"2026-07-10T13:49:17.343893Z"},"links":{"cited_paper":"/paper/2504.08703","citing_paper":"/paper/2607.08009"},"observation_digest":"sha256:1bec99529a1ff59a35d1b4bedc03b244f395a7b4a1b8d3ad2421309a8d81a311","observation_id":"38dcf282-46d8-40dc-b7b4-5cbd9d787ffa","resolution":{"observed_at":"2026-07-10T13:57:06.670054Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-07-11T01:50:49.842142+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T01:50:49.842142+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08703","last_updated":"2025-04-23T20:22:37Z","snapshot_observed_at":"2026-08-21T12:55:07.095532Z","submitted_at":"2025-04-11T17:08:02Z","title":"SWE-PolyBench: A multi-language benchmark for repository level evaluation of coding agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08703","snapshot_observed_at":"2026-07-14T10:46:01.272433Z","title":"Amazon Science","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10569","last_updated":"2026-07-12T04:52:08Z","snapshot_observed_at":"2026-08-19T23:43:18.492120Z","submitted_at":"2026-07-12T04:52:08Z","title":"When Does Restricting a Coding Agent to execute_code Help? A Regime $\\times$ Agent-Design Ablation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-14T10:46:01.272433Z"},"links":{"cited_paper":"/paper/2504.08703","citing_paper":"/paper/2607.10569"},"observation_digest":"sha256:b25c370e847883a22bf47ec546ad588171da20d82b4480cd4b2445cb919d4da8","observation_id":"868d74f9-c2a1-4362-a2f8-dc85f2d96a19","resolution":{"observed_at":"2026-07-14T10:46:01.272433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08703","last_updated":"2025-04-23T20:22:37Z","snapshot_observed_at":"2026-08-21T12:55:07.095532Z","submitted_at":"2025-04-11T17:08:02Z","title":"SWE-PolyBench: A multi-language benchmark for repository level evaluation of coding agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08703","snapshot_observed_at":"2026-08-01T06:48:47.258312Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21760","last_updated":"2026-07-23T19:21:40Z","snapshot_observed_at":"2026-08-14T11:07:25.222129Z","submitted_at":"2026-07-23T19:21:40Z","title":"Bespoke Visual Assistance: What and How do Blind and Low-Vision People Create with Agentic Programming?","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-01T06:48:47.258312Z"},"links":{"cited_paper":"/paper/2504.08703","citing_paper":"/paper/2607.21760"},"observation_digest":"sha256:eea57eda86fec641318485c00fdec0985f8efd324d3bf6972c49d92f66dbb6a2","observation_id":"c6dbbf03-e191-4648-b221-062e31cd8bef","resolution":{"observed_at":"2026-08-01T06:48:47.258312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08703","last_updated":"2025-04-23T20:22:37Z","snapshot_observed_at":"2026-08-21T12:55:07.095532Z","submitted_at":"2025-04-11T17:08:02Z","title":"SWE-PolyBench: A multi-language benchmark for repository level evaluation of coding agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08703","snapshot_observed_at":"2026-08-01T15:36:24.159083Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26451","last_updated":"2026-07-29T04:04:54Z","snapshot_observed_at":"2026-08-15T02:19:35.706955Z","submitted_at":"2026-07-29T04:04:54Z","title":"ExplainBench: Evaluating Code Explanations from Agents","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T15:36:24.159083Z"},"links":{"cited_paper":"/paper/2504.08703","citing_paper":"/paper/2607.26451"},"observation_digest":"sha256:7a6de13484c6bdc88b8ae627ad05ba6b0533262641469c836d680326d3a21ebb","observation_id":"93ad891a-740d-4833-80ac-59b502d4e4f4","resolution":{"observed_at":"2026-08-01T15:36:24.159083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08703","last_updated":"2025-04-23T20:22:37Z","snapshot_observed_at":"2026-08-21T12:55:07.095532Z","submitted_at":"2025-04-11T17:08:02Z","title":"SWE-PolyBench: A multi-language benchmark for repository level evaluation of coding agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08703","snapshot_observed_at":"2026-08-01T07:55:25.299066Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.27409","last_updated":"2026-07-29T19:28:32Z","snapshot_observed_at":"2026-08-15T02:04:23.965666Z","submitted_at":"2026-07-29T19:28:32Z","title":"SWE-NFI: Studying and Benchmarking Coding Agents for Non-Functional Improvements","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-01T07:55:25.299066Z"},"links":{"cited_paper":"/paper/2504.08703","citing_paper":"/paper/2607.27409"},"observation_digest":"sha256:8dec264c1d5c39870b3dbd9e70f9892f66da1e78f019e95f36b987fec5e7f8a3","observation_id":"6f6eecbf-26b4-4811-83cd-9892d8dafca8","resolution":{"observed_at":"2026-08-01T07:55:25.299066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08703","last_updated":"2025-04-23T20:22:37Z","snapshot_observed_at":"2026-08-21T12:55:07.095532Z","submitted_at":"2025-04-11T17:08:02Z","title":"SWE-PolyBench: A multi-language benchmark for repository level evaluation of coding agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08703","snapshot_observed_at":"2026-07-31T03:01:05.590423Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28587","last_updated":"2026-08-04T09:26:35Z","snapshot_observed_at":"2026-08-15T17:32:22.267239Z","submitted_at":"2026-07-30T17:42:44Z","title":"PAIChecker: Uncovering and Checking PR-Issue Misalignment in SWE-Bench-Like Benchmarks","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-31T03:01:05.590423Z"},"links":{"cited_paper":"/paper/2504.08703","citing_paper":"/paper/2607.28587"},"observation_digest":"sha256:ee247b215bfde78f9bbcbd8669850ab971be79a0f0db944be1b56aa8cfc0130f","observation_id":"dbfa0fc3-3702-4796-b194-091c90ce97f7","resolution":{"observed_at":"2026-07-31T03:01:05.590423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08703","last_updated":"2025-04-23T20:22:37Z","snapshot_observed_at":"2026-08-21T12:55:07.095532Z","submitted_at":"2025-04-11T17:08:02Z","title":"SWE-PolyBench: A multi-language benchmark for repository level evaluation of coding agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08703","snapshot_observed_at":"2026-08-05T04:24:46.096618Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28587","last_updated":"2026-08-04T09:26:35Z","snapshot_observed_at":"2026-08-15T17:32:22.267239Z","submitted_at":"2026-07-30T17:42:44Z","title":"PAIChecker: Uncovering and Checking PR-Issue Misalignment in SWE-Bench-Like Benchmarks","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T04:24:46.096618Z"},"links":{"cited_paper":"/paper/2504.08703","citing_paper":"/paper/2607.28587"},"observation_digest":"sha256:7ac300d10b8fcaea5080b35b01e49c11044f06fdafea6ffd0b7a8d7afd5265c9","observation_id":"c876ea63-a64d-4a70-b5fb-2e4fe5bf4988","resolution":{"observed_at":"2026-08-05T04:24:46.096618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08703","last_updated":"2025-04-23T20:22:37Z","snapshot_observed_at":"2026-08-21T12:55:07.095532Z","submitted_at":"2025-04-11T17:08:02Z","title":"SWE-PolyBench: A multi-language benchmark for repository level evaluation of coding agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08703","snapshot_observed_at":"2026-08-11T10:33:05.142802Z","title":"arXiv preprint arXiv:2504.08703 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09802","last_updated":"2026-08-10T16:23:19Z","snapshot_observed_at":"2026-08-15T12:01:36.368087Z","submitted_at":"2026-08-10T16:23:19Z","title":"SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-11T10:33:05.142802Z"},"links":{"cited_paper":"/paper/2504.08703","citing_paper":"/paper/2608.09802"},"observation_digest":"sha256:eb87cf5da9bdf657796900235a72ee1a4f89f97623bf9e25e428ded9d98ca04f","observation_id":"a70a37d2-dabb-4c9b-9b66-d9a51647561f","resolution":{"observed_at":"2026-08-11T10:33:05.142802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08703","last_updated":"2025-04-23T20:22:37Z","snapshot_observed_at":"2026-08-21T12:55:07.095532Z","submitted_at":"2025-04-11T17:08:02Z","title":"SWE-PolyBench: A multi-language benchmark for repository level evaluation of coding agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08703","snapshot_observed_at":"2026-08-14T04:18:57.350641Z","title":"donotsubmit until the hidden test passes","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10178","last_updated":"2026-08-10T19:45:45Z","snapshot_observed_at":"2026-08-18T18:44:55.389615Z","submitted_at":"2026-08-10T19:45:45Z","title":"One Recipe, Many Harnesses: What Self-Evolution Encodes Across Languages and Models","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-14T04:18:57.350641Z"},"links":{"cited_paper":"/paper/2504.08703","citing_paper":"/paper/2608.10178"},"observation_digest":"sha256:5350ab8b5bded6f2ff08bd91f225de3d86f248c3b0b18afb8b2e3c3d51ac4c7f","observation_id":"babcfd37-37e3-40c3-8eda-c32d9e406937","resolution":{"observed_at":"2026-08-14T04:18:57.350641Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2504.08703/citation-record","integrity":"/paper/2504.08703/integrity","json":"/paper/2504.08703/citation-record.json","paper":"/paper/2504.08703"},"outbound":[],"paper":{"arxiv_id":"2504.08703","last_updated":"2025-04-23T20:22:37Z","latest_version":3,"primary_category":"cs.SE","snapshot_observed_at":"2026-08-21T12:55:07.095532Z","submitted_at":"2025-04-11T17:08:02Z","title":"SWE-PolyBench: A multi-language benchmark for repository level evaluation of coding agents"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 35 inbound Pith citation observations for arXiv:2504.08703."}