{"as_of":"2026-08-07T05:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5d257dd29d90abe7deb7a849be7729f53b672bd079a0834dfc795bc435cd012d","coverage":[{"denominator":25,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:08:50.185042Z","state":"measured"},{"denominator":30,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":30,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T00:25:09.639122Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T06:59:37.262688Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.09063","last_updated":"2025-07-11T22:45:07Z","snapshot_observed_at":"2026-08-06T18:02:57.107843Z","submitted_at":"2025-07-11T22:45:07Z","title":"SetupBench: Assessing Software Engineering Agents' Ability to Bootstrap Development Environments","version":1},"cited_work":{"arxiv_id":"2507.09063","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.09063","snapshot_observed_at":"2026-07-04T06:59:37.262688Z","title":"Setupbench: Assessing software engineering agents’ ability to bootstrap development environments","venue":null,"work_id":"db3dc07a-47e6-4f8a-9da7-0a5ad98429ad","year":2025},"citing_paper":{"arxiv_id":"2605.15815","last_updated":"2026-05-15T10:09:59Z","snapshot_observed_at":"2026-08-01T21:40:05.316602Z","submitted_at":"2026-05-15T10:09:59Z","title":"BootstrapAgent: Distilling Repository Setup into Reusable Agent Knowledge","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-20T17:04:07.449733Z"},"links":{"cited_paper":"/paper/2507.09063","citing_paper":"/paper/2605.15815"},"observation_digest":"sha256:f7552a9ebb6da8fd56e449f7009ac633f03cf5773cab0aa986d745252393f70b","observation_id":"ffbff7db-862b-4a39-a151-2dd1eed36654","resolution":{"observed_at":"2026-05-20T17:08:41.972644Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.09063","last_updated":"2025-07-11T22:45:07Z","snapshot_observed_at":"2026-08-06T18:02:57.107843Z","submitted_at":"2025-07-11T22:45:07Z","title":"SetupBench: Assessing Software Engineering Agents' Ability to Bootstrap Development Environments","version":1},"cited_work":{"arxiv_id":"2507.09063","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.09063","snapshot_observed_at":"2026-07-04T06:59:37.262688Z","title":"Setupbench: Assessing software engineering agents’ ability to bootstrap development environments","venue":null,"work_id":"db3dc07a-47e6-4f8a-9da7-0a5ad98429ad","year":2025},"citing_paper":{"arxiv_id":"2606.05238","last_updated":"2026-06-03T04:59:34Z","snapshot_observed_at":"2026-08-06T20:20:32.352351Z","submitted_at":"2026-06-03T04:59:34Z","title":"DeployBench: Benchmarking LLM Agents for Research Artifact Deployment","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-28T05:35:12.027697Z"},"links":{"cited_paper":"/paper/2507.09063","citing_paper":"/paper/2606.05238"},"observation_digest":"sha256:c270f7f1354544e648d39de7d80382337ee8233e2fe47ee5cf90a0f827c5590c","observation_id":"a46cff9f-fb2b-450e-a320-c89f9805d8d8","resolution":{"observed_at":"2026-07-02T09:16:49.263539Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.09063","last_updated":"2025-07-11T22:45:07Z","snapshot_observed_at":"2026-08-06T18:02:57.107843Z","submitted_at":"2025-07-11T22:45:07Z","title":"SetupBench: Assessing Software Engineering Agents' Ability to Bootstrap Development Environments","version":1},"cited_work":{"arxiv_id":"2507.09063","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.09063","snapshot_observed_at":"2026-07-04T06:59:37.262688Z","title":"Setupbench: Assessing software engineering agents’ ability to bootstrap development environments","venue":null,"work_id":"db3dc07a-47e6-4f8a-9da7-0a5ad98429ad","year":2025},"citing_paper":{"arxiv_id":"2606.21071","last_updated":"2026-06-19T03:40:00Z","snapshot_observed_at":"2026-08-06T19:34:26.539767Z","submitted_at":"2026-06-19T03:40:00Z","title":"Local LLM Agents as Vulnerable Runtimes:A Source-Code Audit of the Agent Runtime Layer","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-26T14:02:37.404821Z"},"links":{"cited_paper":"/paper/2507.09063","citing_paper":"/paper/2606.21071"},"observation_digest":"sha256:f3837ed48da21afe2b6dc00e2d14470fd55f4a534cfd1e6ec1770446501e7474","observation_id":"019662f6-356d-4c7d-9f4c-df963549c716","resolution":{"observed_at":"2026-07-04T06:59:37.264275Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.09063","last_updated":"2025-07-11T22:45:07Z","snapshot_observed_at":"2026-08-06T18:02:57.107843Z","submitted_at":"2025-07-11T22:45:07Z","title":"SetupBench: Assessing Software Engineering Agents' Ability to Bootstrap Development Environments","version":1},"cited_work":{"arxiv_id":"2507.09063","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.09063","snapshot_observed_at":"2026-07-04T06:59:37.262688Z","title":"Setupbench: Assessing software engineering agents’ ability to bootstrap development environments","venue":null,"work_id":"db3dc07a-47e6-4f8a-9da7-0a5ad98429ad","year":2025},"citing_paper":{"arxiv_id":"2606.28480","last_updated":"2026-06-26T17:59:51Z","snapshot_observed_at":"2026-07-07T00:02:33.644076Z","submitted_at":"2026-06-26T17:59:51Z","title":"TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-06-30T01:19:54.081755Z"},"links":{"cited_paper":"/paper/2507.09063","citing_paper":"/paper/2606.28480"},"observation_digest":"sha256:26d6fcb2e2f0f9fe01ec047fd503b5164d4696607c6430f62196011fcc732439","observation_id":"d0300806-5c46-477b-aae5-08da90ed168a","resolution":{"observed_at":"2026-07-01T15:35:48.608177Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.09063","last_updated":"2025-07-11T22:45:07Z","snapshot_observed_at":"2026-08-06T18:02:57.107843Z","submitted_at":"2025-07-11T22:45:07Z","title":"SetupBench: Assessing Software Engineering Agents' Ability to Bootstrap Development Environments","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.09063","snapshot_observed_at":"2026-08-03T00:25:09.639122Z","title":"arXiv preprint arXiv:2507.09063 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28802","last_updated":"2026-07-30T19:55:14Z","snapshot_observed_at":"2026-08-06T22:07:38.824854Z","submitted_at":"2026-07-30T19:55:14Z","title":"Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-03T00:25:09.639122Z"},"links":{"cited_paper":"/paper/2507.09063","citing_paper":"/paper/2607.28802"},"observation_digest":"sha256:8d8c4942571c604855c2c8798bd16c9261481c88e7935f7d87cbf0b825bd05d8","observation_id":"e5abfd60-86ad-4964-a30f-6ce9e6e87fca","resolution":{"observed_at":"2026-08-03T00:25:09.639122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.09063/citation-record","integrity":"/paper/2507.09063/integrity","json":"/paper/2507.09063/citation-record.json","paper":"/paper/2507.09063"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2408.08333","last_updated":"2025-07-08T23:14:43Z","snapshot_observed_at":"2026-07-06T19:01:15.196625Z","submitted_at":"2024-08-14T22:53:07Z","title":"CodeMirage: Hallucinations in Code Generated by Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08333","snapshot_observed_at":"2026-08-06T18:08:42.937431Z","title":"Codemirage: Hallucinations in code generated by large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09063","last_updated":"2025-07-11T22:45:07Z","snapshot_observed_at":"2026-08-06T18:02:57.107843Z","submitted_at":"2025-07-11T22:45:07Z","title":"SetupBench: Assessing Software Engineering Agents' Ability to Bootstrap Development Environments","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T18:08:42.937431Z"},"links":{"cited_paper":"/paper/2408.08333","citing_paper":"/paper/2507.09063"},"observation_digest":"sha256:47094453565b97cda9ac30ed43bfd58319909cf8ae956a1b3353242f55d1e8a2","observation_id":"50d5f51c-86b7-461d-bbf0-380d477824ac","resolution":{"observed_at":"2026-08-06T18:08:42.937431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:08:53.062593Z","title":"Aider code editing","venue":null,"work_id":"8f8e74aa-a99f-416c-96d4-c1b066c9f985","year":null},"citing_paper":{"arxiv_id":"2507.09063","last_updated":"2025-07-11T22:45:07Z","snapshot_observed_at":"2026-08-06T18:02:57.107843Z","submitted_at":"2025-07-11T22:45:07Z","title":"SetupBench: Assessing Software Engineering Agents' Ability to Bootstrap Development Environments","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T18:08:43.101216Z"},"links":{"citing_paper":"/paper/2507.09063"},"observation_digest":"sha256:cc5c68320e055c528fea8d276d54fd3c956c52f828bb4af20c562c861e8e1919","observation_id":"9297bddf-9034-42d8-a918-4095eea14f66","resolution":{"observed_at":"2026-08-06T18:08:53.176750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:08:52.956825Z","title":"Introducing claude 4","venue":null,"work_id":"3ec81592-c815-4e63-af63-1550cead45fc","year":2025},"citing_paper":{"arxiv_id":"2507.09063","last_updated":"2025-07-11T22:45:07Z","snapshot_observed_at":"2026-08-06T18:02:57.107843Z","submitted_at":"2025-07-11T22:45:07Z","title":"SetupBench: Assessing Software Engineering Agents' Ability to Bootstrap Development Environments","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T18:08:43.534078Z"},"links":{"citing_paper":"/paper/2507.09063"},"observation_digest":"sha256:8fb275fbbbc5abe179bb32ecf89173213d59a2cd4c0fb5116bb5624e7bccb6c6","observation_id":"6da50e90-6837-4278-b2a5-d5a6b69f218d","resolution":{"observed_at":"2026-08-06T18:08:53.007049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:08:52.717132Z","title":"Meet devin, the first ai software engineer","venue":null,"work_id":"c7e697a5-8084-4e7b-b793-9dbb1bd9e880","year":2024},"citing_paper":{"arxiv_id":"2507.09063","last_updated":"2025-07-11T22:45:07Z","snapshot_observed_at":"2026-08-06T18:02:57.107843Z","submitted_at":"2025-07-11T22:45:07Z","title":"SetupBench: Assessing Software Engineering Agents' Ability to Bootstrap Development Environments","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T18:08:44.557141Z"},"links":{"citing_paper":"/paper/2507.09063"},"observation_digest":"sha256:de00aa6496018dd1eb6436fadb2e5c10128687da4469ebd44448c46ee3d4e252","observation_id":"3890ee47-51a6-443c-b208-cb69d2cba843","resolution":{"observed_at":"2026-08-06T18:08:52.841914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:08:52.622233Z","title":"Envbench: A benchmark for automated environment setup","venue":null,"work_id":"cab01450-ee64-469e-9110-629ee3f08b92","year":2025},"citing_paper":{"arxiv_id":"2507.09063","last_updated":"2025-07-11T22:45:07Z","snapshot_observed_at":"2026-08-06T18:02:57.107843Z","submitted_at":"2025-07-11T22:45:07Z","title":"SetupBench: Assessing Software Engineering Agents' Ability to Bootstrap Development Environments","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T18:08:45.312916Z"},"links":{"citing_paper":"/paper/2507.09063"},"observation_digest":"sha256:53db22e936ab96dd6d571c3f20a9ec0995ee338ffdd6ac83f579b7f90e5b81ba","observation_id":"d879eca9-43f8-45dd-88cc-d681e778c0de","resolution":{"observed_at":"2026-08-06T18:08:52.672129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:08:52.523574Z","title":"Code completions with github copilot","venue":null,"work_id":"c7c0ce3c-baa9-4198-8ea0-63272e5237f5","year":2022},"citing_paper":{"arxiv_id":"2507.09063","last_updated":"2025-07-11T22:45:07Z","snapshot_observed_at":"2026-08-06T18:02:57.107843Z","submitted_at":"2025-07-11T22:45:07Z","title":"SetupBench: Assessing Software Engineering Agents' Ability to Bootstrap Development Environments","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T18:08:46.040321Z"},"links":{"citing_paper":"/paper/2507.09063"},"observation_digest":"sha256:7ab13d364dfe13186370fbc2cb496bcfd114c2c243a7145bc737b4dc46885114","observation_id":"e48daeb8-4b10-4042-91ba-34afbfcdc666","resolution":{"observed_at":"2026-08-06T18:08:52.561243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:08:52.379409Z","title":"Meet the new github copilot coding agent","venue":null,"work_id":"fe280ee6-b5c7-4c00-9348-70d3c353d630","year":2025},"citing_paper":{"arxiv_id":"2507.09063","last_updated":"2025-07-11T22:45:07Z","snapshot_observed_at":"2026-08-06T18:02:57.107843Z","submitted_at":"2025-07-11T22:45:07Z","title":"SetupBench: Assessing Software Engineering Agents' Ability to Bootstrap Development Environments","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T18:08:46.588514Z"},"links":{"citing_paper":"/paper/2507.09063"},"observation_digest":"sha256:c7ecf3d1708129ec9534b2d9cb0e159223bf04a966d63acb6b71e2fd9e19ff60","observation_id":"033ba43f-9853-492f-a666-53e636a432df","resolution":{"observed_at":"2026-08-06T18:08:52.434166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:08:46.856121Z","title":"S table T ool B ench: Towards stable large-scale benchmarking on tool learning of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09063","last_updated":"2025-07-11T22:45:07Z","snapshot_observed_at":"2026-08-06T18:02:57.107843Z","submitted_at":"2025-07-11T22:45:07Z","title":"SetupBench: Assessing Software Engineering Agents' Ability to Bootstrap Development Environments","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T18:08:46.856121Z"},"links":{"citing_paper":"/paper/2507.09063"},"observation_digest":"sha256:8a59c2b95932349f3b207966a4f64c5605088e54340f821a48d101ce1b543e07","observation_id":"e125de41-40e0-4d9b-ac1e-2b951395e8a3","resolution":{"observed_at":"2026-08-06T18:08:46.856121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09997","last_updated":"2024-10-13T20:41:47Z","snapshot_observed_at":"2026-07-06T19:32:42.378146Z","submitted_at":"2024-10-13T20:41:47Z","title":"Collu-Bench: A Benchmark for Predicting Language Model Hallucinations in Code","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.09997","snapshot_observed_at":"2026-08-06T18:08:46.990851Z","title":"Collu- B ench: A benchmark for predicting language model hallucinations in code","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09063","last_updated":"2025-07-11T22:45:07Z","snapshot_observed_at":"2026-08-06T18:02:57.107843Z","submitted_at":"2025-07-11T22:45:07Z","title":"SetupBench: Assessing Software Engineering Agents' Ability to Bootstrap Development Environments","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T18:08:46.990851Z"},"links":{"cited_paper":"/paper/2410.09997","citing_paper":"/paper/2507.09063"},"observation_digest":"sha256:9f8c3d83b2d500b748e611e870f0e8f61a6bedc0afce6e5023147f4dcbbd3700","observation_id":"37340459-c733-4faf-be3e-941b902b7aa6","resolution":{"observed_at":"2026-08-06T18:08:46.990851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:08:47.207136Z","title":"SWE -bench: Can language models resolve real-world github issues? In The Twelfth International Conference on Learning Representations, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09063","last_updated":"2025-07-11T22:45:07Z","snapshot_observed_at":"2026-08-06T18:02:57.107843Z","submitted_at":"2025-07-11T22:45:07Z","title":"SetupBench: Assessing Software Engineering Agents' Ability to Bootstrap Development Environments","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T18:08:47.207136Z"},"links":{"citing_paper":"/paper/2507.09063"},"observation_digest":"sha256:1c54d6b0d07ce487d7f5a993d50a3c2b3ea57dbc27b2fea6e91bb0ffaab45d0d","observation_id":"64aadbcc-7bd0-4e5e-b9fd-a6a96feeaaf6","resolution":{"observed_at":"2026-08-06T18:08:47.207136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20825","last_updated":"2025-02-28T08:12:08Z","snapshot_observed_at":"2026-08-01T23:34:09.916735Z","submitted_at":"2025-02-28T08:12:08Z","title":"LADs: Leveraging LLMs for AI-Driven DevOps","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.20825","snapshot_observed_at":"2026-08-06T18:08:47.452716Z","title":"Butt, and Ali Anwar","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09063","last_updated":"2025-07-11T22:45:07Z","snapshot_observed_at":"2026-08-06T18:02:57.107843Z","submitted_at":"2025-07-11T22:45:07Z","title":"SetupBench: Assessing Software Engineering Agents' Ability to Bootstrap Development Environments","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T18:08:47.452716Z"},"links":{"cited_paper":"/paper/2502.20825","citing_paper":"/paper/2507.09063"},"observation_digest":"sha256:7ae2217cc13bd83ffb5f77bf1b809fd6674575ad96118ad39fced3351e513990","observation_id":"189efb8e-726d-4d8c-a012-748ab8cbcddd","resolution":{"observed_at":"2026-08-06T18:08:47.452716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08604","last_updated":"2024-12-14T09:45:51Z","snapshot_observed_at":"2026-08-06T13:32:36.381010Z","submitted_at":"2024-03-13T15:13:44Z","title":"Prompting Large Language Models to Tackle the Full Software Development Lifecycle: A Case Study","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08604","snapshot_observed_at":"2026-08-06T18:08:47.747783Z","title":"Devbench: A comprehensive benchmark for software development","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09063","last_updated":"2025-07-11T22:45:07Z","snapshot_observed_at":"2026-08-06T18:02:57.107843Z","submitted_at":"2025-07-11T22:45:07Z","title":"SetupBench: Assessing Software Engineering Agents' Ability to Bootstrap Development Environments","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T18:08:47.747783Z"},"links":{"cited_paper":"/paper/2403.08604","citing_paper":"/paper/2507.09063"},"observation_digest":"sha256:47cef4f0f70d44bf44a36424dfe4778013401f53439a17583bbbaef078eaeaed","observation_id":"2e45cd78-68a0-416c-b7a8-3838f9ccc14d","resolution":{"observed_at":"2026-08-06T18:08:47.747783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03227","last_updated":"2024-10-04T08:29:12Z","snapshot_observed_at":"2026-07-06T19:27:33.934338Z","submitted_at":"2024-10-04T08:29:12Z","title":"ALR$^2$: A Retrieve-then-Reason Framework for Long-context Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03227","snapshot_observed_at":"2026-08-06T18:08:47.901841Z","title":"ALR ^ 2 : A retrieve-then-reason framework for long-context question answering","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09063","last_updated":"2025-07-11T22:45:07Z","snapshot_observed_at":"2026-08-06T18:02:57.107843Z","submitted_at":"2025-07-11T22:45:07Z","title":"SetupBench: Assessing Software Engineering Agents' Ability to Bootstrap Development Environments","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T18:08:47.901841Z"},"links":{"cited_paper":"/paper/2410.03227","citing_paper":"/paper/2507.09063"},"observation_digest":"sha256:6fcc376f22b941d08f47083eab0c6cbb545f712a99a8e2c75e06ba34fba55f68","observation_id":"ef28d23c-67e6-42d2-ae3b-65b2ce6c1acb","resolution":{"observed_at":"2026-08-06T18:08:47.901841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02060","last_updated":"2024-06-12T02:46:16Z","snapshot_observed_at":"2026-07-06T17:54:39.685251Z","submitted_at":"2024-04-02T15:59:11Z","title":"Long-context LLMs Struggle with Long In-context Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02060","snapshot_observed_at":"2026-08-06T18:08:48.218778Z","title":"Long-context llms struggle with long in-context learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09063","last_updated":"2025-07-11T22:45:07Z","snapshot_observed_at":"2026-08-06T18:02:57.107843Z","submitted_at":"2025-07-11T22:45:07Z","title":"SetupBench: Assessing Software Engineering Agents' Ability to Bootstrap Development Environments","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T18:08:48.218778Z"},"links":{"cited_paper":"/paper/2404.02060","citing_paper":"/paper/2507.09063"},"observation_digest":"sha256:ba6f21e0b8d6f8d17d0c6b89a9b60c165b3b11ca087cc1fd1eb909ce2785eb93","observation_id":"a1b86a78-b459-40bb-ae34-1b76186d72e9","resolution":{"observed_at":"2026-08-06T18:08:48.218778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1802.08979","last_updated":"2018-03-02T17:46:59Z","snapshot_observed_at":"2026-07-06T06:25:13.996890Z","submitted_at":"2018-02-25T09:52:24Z","title":"NL2Bash: A Corpus and Semantic Parser for Natural Language Interface to the Linux Operating System","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.08979","snapshot_observed_at":"2026-08-06T18:08:48.471016Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.09063","last_updated":"2025-07-11T22:45:07Z","snapshot_observed_at":"2026-08-06T18:02:57.107843Z","submitted_at":"2025-07-11T22:45:07Z","title":"SetupBench: Assessing Software Engineering Agents' Ability to Bootstrap Development Environments","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T18:08:48.471016Z"},"links":{"cited_paper":"/paper/1802.08979","citing_paper":"/paper/2507.09063"},"observation_digest":"sha256:65592f778a8a31d7285d6f209e381589e291d3c1ff82d9a9743b7cf8f8552658","observation_id":"172e390e-a508-4fed-81b8-56cdc56880a2","resolution":{"observed_at":"2026-08-06T18:08:48.471016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22583","last_updated":"2025-05-28T16:56:11Z","snapshot_observed_at":"2026-08-01T21:04:51.262657Z","submitted_at":"2025-05-28T16:56:11Z","title":"GitGoodBench: A Novel Benchmark For Evaluating Agentic Performance On Git","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22583","snapshot_observed_at":"2026-08-06T18:08:48.894069Z","title":"Gitgoodbench: A novel benchmark for evaluating agentic performance on git","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09063","last_updated":"2025-07-11T22:45:07Z","snapshot_observed_at":"2026-08-06T18:02:57.107843Z","submitted_at":"2025-07-11T22:45:07Z","title":"SetupBench: Assessing Software Engineering Agents' Ability to Bootstrap Development Environments","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T18:08:48.894069Z"},"links":{"cited_paper":"/paper/2505.22583","citing_paper":"/paper/2507.09063"},"observation_digest":"sha256:af6b8fd00ede79a6ac63fb763607fc442ec7ff10a9b4a60565c953beb372623b","observation_id":"b22a4f2a-f6e4-41ac-ba8b-904495d780e1","resolution":{"observed_at":"2026-08-06T18:08:48.894069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:08:52.043362Z","title":"Agent B ench: Evaluating LLM s as agents","venue":null,"work_id":"482ed29e-0ba6-4039-81a8-0a31ad501631","year":2024},"citing_paper":{"arxiv_id":"2507.09063","last_updated":"2025-07-11T22:45:07Z","snapshot_observed_at":"2026-08-06T18:02:57.107843Z","submitted_at":"2025-07-11T22:45:07Z","title":"SetupBench: Assessing Software Engineering Agents' Ability to Bootstrap Development Environments","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T18:08:49.409404Z"},"links":{"citing_paper":"/paper/2507.09063"},"observation_digest":"sha256:3e86fbb1def298903aa4d33640699f35fc7fa8cce3177a9601b4b9b5e53f54b0","observation_id":"1f1c29eb-498d-45fc-8586-90fdbe2c509a","resolution":{"observed_at":"2026-08-06T18:08:52.185296Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07637","last_updated":"2025-06-17T12:53:20Z","snapshot_observed_at":"2026-07-06T16:31:21.196640Z","submitted_at":"2023-10-11T16:33:29Z","title":"OpsEval: A Comprehensive IT Operations Benchmark Suite for Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07637","snapshot_observed_at":"2026-08-06T18:08:49.556866Z","title":"Opseval: A comprehensive benchmark suite for evaluating large language models’ capability in the IT operations domain","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09063","last_updated":"2025-07-11T22:45:07Z","snapshot_observed_at":"2026-08-06T18:02:57.107843Z","submitted_at":"2025-07-11T22:45:07Z","title":"SetupBench: Assessing Software Engineering Agents' Ability to Bootstrap Development Environments","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T18:08:49.556866Z"},"links":{"cited_paper":"/paper/2310.07637","citing_paper":"/paper/2507.09063"},"observation_digest":"sha256:f86fa86bdc94631599b590ff1745079834d227cdb56c5931d2164942cd93b2c6","observation_id":"465e73db-8c85-484f-bde7-400bdb029460","resolution":{"observed_at":"2026-08-06T18:08:49.556866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:08:51.715300Z","title":"Beyond pip install : Evaluating llm agents for the automated installation of python projects","venue":null,"work_id":"f99f16c8-6848-46a3-a4b0-b4bc3b0b16d0","year":2025},"citing_paper":{"arxiv_id":"2507.09063","last_updated":"2025-07-11T22:45:07Z","snapshot_observed_at":"2026-08-06T18:02:57.107843Z","submitted_at":"2025-07-11T22:45:07Z","title":"SetupBench: Assessing Software Engineering Agents' Ability to Bootstrap Development Environments","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T18:08:49.657176Z"},"links":{"citing_paper":"/paper/2507.09063"},"observation_digest":"sha256:04fe80ead65c4d0e16b123ef851894fc3eaf549df783ccf1d75f5881793b5a07","observation_id":"f4d4ff97-6a2b-4a42-9c02-08faba3b1908","resolution":{"observed_at":"2026-08-06T18:08:51.886387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13114","last_updated":"2025-08-17T07:22:50Z","snapshot_observed_at":"2026-08-07T00:34:15.685794Z","submitted_at":"2025-06-16T05:45:03Z","title":"Understanding LLM-Centric Challenges for Deep Learning Frameworks: An Empirical Analysis","version":2},"cited_work":{"arxiv_id":"2506.13114","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.13114","snapshot_observed_at":"2026-08-06T18:08:50.650458Z","title":"Understanding LLM-Centric Challenges for Deep Learning Frameworks: An Empirical Analysis","venue":"cs.SE","work_id":"35d90a01-b953-4164-8bac-f3043dd8c229","year":2025},"citing_paper":{"arxiv_id":"2507.09063","last_updated":"2025-07-11T22:45:07Z","snapshot_observed_at":"2026-08-06T18:02:57.107843Z","submitted_at":"2025-07-11T22:45:07Z","title":"SetupBench: Assessing Software Engineering Agents' Ability to Bootstrap Development Environments","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T18:08:49.760261Z"},"links":{"cited_paper":"/paper/2506.13114","citing_paper":"/paper/2507.09063"},"observation_digest":"sha256:61f51e30dc11e4d850edb073011898e96721a591884a25050ddca34040be1f74","observation_id":"873b81fd-f42a-4b8f-b0ec-65c6c81668f8","resolution":{"observed_at":"2026-08-06T18:08:50.730388Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09392","last_updated":"2025-05-15T11:14:38Z","snapshot_observed_at":"2026-07-06T21:23:47.292610Z","submitted_at":"2025-05-14T13:48:33Z","title":"Mitigating Configuration Differences Between Development and Production Environments: A Catalog of Strategies","version":2},"cited_work":{"arxiv_id":"2505.09392","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.09392","snapshot_observed_at":"2026-08-06T18:08:50.514464Z","title":"Mitigating Configuration Differences Between Development and Production Environments: A Catalog of Strategies","venue":"cs.SE","work_id":"abe80015-d7c9-496b-8bb5-4a3e89901486","year":2025},"citing_paper":{"arxiv_id":"2507.09063","last_updated":"2025-07-11T22:45:07Z","snapshot_observed_at":"2026-08-06T18:02:57.107843Z","submitted_at":"2025-07-11T22:45:07Z","title":"SetupBench: Assessing Software Engineering Agents' Ability to Bootstrap Development Environments","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T18:08:49.838672Z"},"links":{"cited_paper":"/paper/2505.09392","citing_paper":"/paper/2507.09063"},"observation_digest":"sha256:55822bdebbea5bb23d02be9a5ebfcc4efee814e768fe5e848895ef301fc0894d","observation_id":"d1f09481-964e-487a-a003-74c3ccfc8592","resolution":{"observed_at":"2026-08-06T18:08:50.560978Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18379","last_updated":"2024-10-24T02:43:33Z","snapshot_observed_at":"2026-08-04T04:27:13.746069Z","submitted_at":"2024-10-24T02:43:33Z","title":"Identifying Factors Contributing to Bad Days for Software Developers: A Mixed Methods Study","version":1},"cited_work":{"arxiv_id":"2410.18379","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.18379","snapshot_observed_at":"2026-08-06T18:08:50.319099Z","title":"Identifying Factors Contributing to Bad Days for Software Developers: A Mixed Methods Study","venue":"cs.SE","work_id":"c0a64a05-eb9f-4447-b52e-00fb8c544157","year":2024},"citing_paper":{"arxiv_id":"2507.09063","last_updated":"2025-07-11T22:45:07Z","snapshot_observed_at":"2026-08-06T18:02:57.107843Z","submitted_at":"2025-07-11T22:45:07Z","title":"SetupBench: Assessing Software Engineering Agents' Ability to Bootstrap Development Environments","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T18:08:49.949818Z"},"links":{"cited_paper":"/paper/2410.18379","citing_paper":"/paper/2507.09063"},"observation_digest":"sha256:7a8d626f7277fde948d79f24882609e696c81d574bb22c96bd81f5ac4f116ac5","observation_id":"a745daca-bc41-4f02-b73e-483b5074a561","resolution":{"observed_at":"2026-08-06T18:08:50.393493Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:08:51.323274Z","title":"Introducing codex","venue":null,"work_id":"a482f47c-a674-49aa-b59e-5602c533fece","year":2025},"citing_paper":{"arxiv_id":"2507.09063","last_updated":"2025-07-11T22:45:07Z","snapshot_observed_at":"2026-08-06T18:02:57.107843Z","submitted_at":"2025-07-11T22:45:07Z","title":"SetupBench: Assessing Software Engineering Agents' Ability to Bootstrap Development Environments","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T18:08:50.015354Z"},"links":{"citing_paper":"/paper/2507.09063"},"observation_digest":"sha256:b5b7e85ba072320ff93b5c408efd45a9566a478e266c51a237a1c3e040bb4e06","observation_id":"1f59e4bb-8f10-4883-9797-937ad07ba375","resolution":{"observed_at":"2026-08-06T18:08:51.532796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:08:50.078862Z","title":"Tool LLM : Facilitating large language models to master 16000+ real-world API s","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09063","last_updated":"2025-07-11T22:45:07Z","snapshot_observed_at":"2026-08-06T18:02:57.107843Z","submitted_at":"2025-07-11T22:45:07Z","title":"SetupBench: Assessing Software Engineering Agents' Ability to Bootstrap Development Environments","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T18:08:50.078862Z"},"links":{"citing_paper":"/paper/2507.09063"},"observation_digest":"sha256:a32ed4bf08b43717ff94bab3e4d3418ad55280c4b3ea4fd73e1326f894fdf32c","observation_id":"6c10f197-0d49-4891-b04d-e5f550e034ff","resolution":{"observed_at":"2026-08-06T18:08:50.078862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:08:51.031734Z","title":"Retrieval models aren't tool-savvy: Benchmarking tool retrieval for large language models","venue":null,"work_id":"663c3669-b502-4f24-9cba-7d1a3f80178d","year":2025},"citing_paper":{"arxiv_id":"2507.09063","last_updated":"2025-07-11T22:45:07Z","snapshot_observed_at":"2026-08-06T18:02:57.107843Z","submitted_at":"2025-07-11T22:45:07Z","title":"SetupBench: Assessing Software Engineering Agents' Ability to Bootstrap Development Environments","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T18:08:50.185042Z"},"links":{"citing_paper":"/paper/2507.09063"},"observation_digest":"sha256:9070c1b34fa62315434dd8ad3040bc1c7efb006fbabe57815bbfcc0e48ef15b3","observation_id":"14cdc954-7a61-4ff9-ae2b-9710a708ce93","resolution":{"observed_at":"2026-08-06T18:08:51.106233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.09063","last_updated":"2025-07-11T22:45:07Z","latest_version":1,"primary_category":"cs.SE","snapshot_observed_at":"2026-08-06T18:02:57.107843Z","submitted_at":"2025-07-11T22:45:07Z","title":"SetupBench: Assessing Software Engineering Agents' Ability to Bootstrap Development Environments"},"reference_resolution":{"displayed":25,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":12,"verified_exact":3,"verified_fuzzy":10},"total_outbound_references":25},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 25 of 25 outbound references and 5 inbound Pith citation observations for arXiv:2507.09063."}