{"as_of":"2026-08-04T13:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:25b61e72aa49b4122e15836cd5e9477d700e16e41a86c3541cc6d5dcd1ed23e5","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T11:02:12.103316Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-21T00:02:09.490384Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-21T00:03:51.800680Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2510.07315","last_updated":"2026-06-05T00:30:48Z","snapshot_observed_at":"2026-08-04T11:02:02.033578Z","submitted_at":"2025-10-08T17:59:19Z","title":"SWE-IF: Aligning Code Evaluation with Human Preference","version":2},"cited_work":{"arxiv_id":"2510.07315","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2510.07315","snapshot_observed_at":"2026-06-08T02:03:46.049900Z","title":"Yixuan Zhu, Zhitong Zeng, Zhaoxue Liu, Yixing Feng, Yuming Sun, Zhaoyang Chen, Yiling Liu, and Haoyu Wang","venue":null,"work_id":"7ac75faf-d5e4-471f-b165-dee4f98721a7","year":2024},"citing_paper":{"arxiv_id":"2604.17338","last_updated":"2026-05-16T01:01:08Z","snapshot_observed_at":"2026-08-04T01:50:51.745798Z","submitted_at":"2026-04-19T09:08:23Z","title":"Precise Debugging Benchmark: Is Your Model Debugging or Regenerating?","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T06:05:32.866387Z"},"links":{"cited_paper":"/paper/2510.07315","citing_paper":"/paper/2604.17338"},"observation_digest":"sha256:349bb8ca0fd96f4ecbedbcc9d12719ab0137639a1d9ef330e4b723d9404f974e","observation_id":"1bce1f41-c21c-46c4-8063-b649c99b6823","resolution":{"observed_at":"2026-06-08T02:03:46.049900Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.07315","last_updated":"2026-06-05T00:30:48Z","snapshot_observed_at":"2026-08-04T11:02:02.033578Z","submitted_at":"2025-10-08T17:59:19Z","title":"SWE-IF: Aligning Code Evaluation with Human Preference","version":2},"cited_work":{"arxiv_id":"2510.07315","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2510.07315","snapshot_observed_at":"2026-06-08T02:03:46.049900Z","title":"Yixuan Zhu, Zhitong Zeng, Zhaoxue Liu, Yixing Feng, Yuming Sun, Zhaoyang Chen, Yiling Liu, and Haoyu Wang","venue":null,"work_id":"7ac75faf-d5e4-471f-b165-dee4f98721a7","year":2024},"citing_paper":{"arxiv_id":"2604.17338","last_updated":"2026-05-16T01:01:08Z","snapshot_observed_at":"2026-08-04T01:50:51.745798Z","submitted_at":"2026-04-19T09:08:23Z","title":"Precise Debugging Benchmark: Is Your Model Debugging or Regenerating?","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-21T00:02:09.490384Z"},"links":{"cited_paper":"/paper/2510.07315","citing_paper":"/paper/2604.17338"},"observation_digest":"sha256:35c0d54faf60724cc80c621b64577c27d213e72ae04cf15d14c4c05320af2f72","observation_id":"53d670d2-4233-4e19-a301-3850f949a849","resolution":{"observed_at":"2026-06-08T02:03:46.049900Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2510.07315/citation-record","integrity":"/paper/2510.07315/integrity","json":"/paper/2510.07315/citation-record.json","paper":"/paper/2510.07315"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:02:06.715961Z","title":"Introducing claude 3.5, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.07315","last_updated":"2026-06-05T00:30:48Z","snapshot_observed_at":"2026-08-04T11:02:02.033578Z","submitted_at":"2025-10-08T17:59:19Z","title":"SWE-IF: Aligning Code Evaluation with Human Preference","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-04T11:02:06.715961Z"},"links":{"citing_paper":"/paper/2510.07315"},"observation_digest":"sha256:db2665a1c8f096f0e2ac7182b2b927bd9d61dc9b6559a14aafa557561fefb961","observation_id":"6542db8a-0fb4-4182-a509-ec820c7accad","resolution":{"observed_at":"2026-08-04T11:02:06.715961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:02:06.806258Z","title":"Introducing claude 4, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.07315","last_updated":"2026-06-05T00:30:48Z","snapshot_observed_at":"2026-08-04T11:02:02.033578Z","submitted_at":"2025-10-08T17:59:19Z","title":"SWE-IF: Aligning Code Evaluation with Human Preference","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-04T11:02:06.806258Z"},"links":{"citing_paper":"/paper/2510.07315"},"observation_digest":"sha256:117d1ab4d6b069d33ad748f7b16776479b33ccc0a627876e745782805729685d","observation_id":"e2ac4ddf-547e-45d3-90a6-0bde7c515abd","resolution":{"observed_at":"2026-08-04T11:02:06.806258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-02T19:23:53.535075Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-04T11:02:06.856989Z","title":"Austin, A","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.07315","last_updated":"2026-06-05T00:30:48Z","snapshot_observed_at":"2026-08-04T11:02:02.033578Z","submitted_at":"2025-10-08T17:59:19Z","title":"SWE-IF: Aligning Code Evaluation with Human Preference","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-04T11:02:06.856989Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2510.07315"},"observation_digest":"sha256:7410e02e0a2f3c9ecdd925f63e6263fccc2fa98f34bc2ed0e3753e4ee308356f","observation_id":"325bfac5-c250-402f-9c8b-2684b730ae86","resolution":{"observed_at":"2026-08-04T11:02:06.856989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-04T11:02:06.966381Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.07315","last_updated":"2026-06-05T00:30:48Z","snapshot_observed_at":"2026-08-04T11:02:02.033578Z","submitted_at":"2025-10-08T17:59:19Z","title":"SWE-IF: Aligning Code Evaluation with Human Preference","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-04T11:02:06.966381Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2510.07315"},"observation_digest":"sha256:a9105cb32d1ae34c070147b2f767ab35709eb2fdb832362f61947c7c00234e95","observation_id":"b02b2151-bf57-421a-9f2e-2b2eece7ee7f","resolution":{"observed_at":"2026-08-04T11:02:06.966381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:02:07.129972Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.07315","last_updated":"2026-06-05T00:30:48Z","snapshot_observed_at":"2026-08-04T11:02:02.033578Z","submitted_at":"2025-10-08T17:59:19Z","title":"SWE-IF: Aligning Code Evaluation with Human Preference","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-04T11:02:07.129972Z"},"links":{"citing_paper":"/paper/2510.07315"},"observation_digest":"sha256:37f0b5fb99b62efddc9c6e3ae55e222e45548e0826b9e95d4bd0a17f09911ae5","observation_id":"8366bb98-2305-4498-94b7-5acee17d4e8c","resolution":{"observed_at":"2026-08-04T11:02:07.129972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:02:07.275943Z","title":"Chiang, L","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.07315","last_updated":"2026-06-05T00:30:48Z","snapshot_observed_at":"2026-08-04T11:02:02.033578Z","submitted_at":"2025-10-08T17:59:19Z","title":"SWE-IF: Aligning Code Evaluation with Human Preference","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-04T11:02:07.275943Z"},"links":{"citing_paper":"/paper/2510.07315"},"observation_digest":"sha256:230fa52452fd22feda0cb420972a432d4ffbcf072ea9573a376e1a55b5f57185","observation_id":"d031d4cc-ecbb-4038-8b20-ec0ed7eb0d71","resolution":{"observed_at":"2026-08-04T11:02:07.275943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:02:07.427013Z","title":"Chowdhury, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.07315","last_updated":"2026-06-05T00:30:48Z","snapshot_observed_at":"2026-08-04T11:02:02.033578Z","submitted_at":"2025-10-08T17:59:19Z","title":"SWE-IF: Aligning Code Evaluation with Human Preference","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-04T11:02:07.427013Z"},"links":{"citing_paper":"/paper/2510.07315"},"observation_digest":"sha256:a0bfff9d6027197083ad405f558940a40d5e1cea828701ab91211059656f8adf","observation_id":"5cd80c95-0840-4a3f-837b-80d424ef081b","resolution":{"observed_at":"2026-08-04T11:02:07.427013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-02T10:10:46.757463Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.11425","snapshot_observed_at":"2026-08-04T11:02:07.533516Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.07315","last_updated":"2026-06-05T00:30:48Z","snapshot_observed_at":"2026-08-04T11:02:02.033578Z","submitted_at":"2025-10-08T17:59:19Z","title":"SWE-IF: Aligning Code Evaluation with Human Preference","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-04T11:02:07.533516Z"},"links":{"cited_paper":"/paper/2506.11425","citing_paper":"/paper/2510.07315"},"observation_digest":"sha256:b1fe2fcbe61a2b7236b9dba597b63b55343222ea06c5650ca9954a0b3ce0c723","observation_id":"5b423429-604d-4cd8-81b3-3549e256206a","resolution":{"observed_at":"2026-08-04T11:02:07.533516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-04T11:02:07.617499Z","title":"Deepseek-v3 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.07315","last_updated":"2026-06-05T00:30:48Z","snapshot_observed_at":"2026-08-04T11:02:02.033578Z","submitted_at":"2025-10-08T17:59:19Z","title":"SWE-IF: Aligning Code Evaluation with Human Preference","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-04T11:02:07.617499Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2510.07315"},"observation_digest":"sha256:f6cf8dd53d7972f947890c91e6e473292833df913dc18bd3f536be03c34ce2e0","observation_id":"d4045e98-9339-4c0d-899b-ce2bf3dbd50c","resolution":{"observed_at":"2026-08-04T11:02:07.617499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-04T11:02:07.669214Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.07315","last_updated":"2026-06-05T00:30:48Z","snapshot_observed_at":"2026-08-04T11:02:02.033578Z","submitted_at":"2025-10-08T17:59:19Z","title":"SWE-IF: Aligning Code Evaluation with Human Preference","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-04T11:02:07.669214Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2510.07315"},"observation_digest":"sha256:f01513a8685722629f5f4efc9f839535837fd0dc00c165610923862cd4cd4895","observation_id":"aa96202e-d7f4-4984-a2d2-084bed0f101f","resolution":{"observed_at":"2026-08-04T11:02:07.669214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01861","last_updated":"2023-08-14T09:07:00Z","snapshot_observed_at":"2026-08-03T22:16:12.497107Z","submitted_at":"2023-08-03T16:31:02Z","title":"ClassEval: A Manually-Crafted Benchmark for Evaluating LLMs on Class-level Code Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01861","snapshot_observed_at":"2026-08-04T11:02:07.722535Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.07315","last_updated":"2026-06-05T00:30:48Z","snapshot_observed_at":"2026-08-04T11:02:02.033578Z","submitted_at":"2025-10-08T17:59:19Z","title":"SWE-IF: Aligning Code Evaluation with Human Preference","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-04T11:02:07.722535Z"},"links":{"cited_paper":"/paper/2308.01861","citing_paper":"/paper/2510.07315"},"observation_digest":"sha256:df090295ad867641d7dc4ba9d77862e70d3d2af37d9ea98314f204abf73b3deb","observation_id":"81ade79a-5bac-4455-81be-05faa1fa6fd6","resolution":{"observed_at":"2026-08-04T11:02:07.722535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-08-04T11:02:07.805859Z","title":"Gemini 2.5: Pushing the frontier with advanced reasoning, multimodality, long context, and next generation agentic capabilities","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.07315","last_updated":"2026-06-05T00:30:48Z","snapshot_observed_at":"2026-08-04T11:02:02.033578Z","submitted_at":"2025-10-08T17:59:19Z","title":"SWE-IF: Aligning Code Evaluation with Human Preference","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-04T11:02:07.805859Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2510.07315"},"observation_digest":"sha256:e86907a60eee6a642da9c12ba2cfe9ee1c38ed0bbefa3b5decb355a1ff99d269","observation_id":"2d5fda2f-ecaf-4696-9c60-c942901d296b","resolution":{"observed_at":"2026-08-04T11:02:07.805859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-08-04T11:02:07.890607Z","title":"Gemma 3 technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.07315","last_updated":"2026-06-05T00:30:48Z","snapshot_observed_at":"2026-08-04T11:02:02.033578Z","submitted_at":"2025-10-08T17:59:19Z","title":"SWE-IF: Aligning Code Evaluation with Human Preference","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-04T11:02:07.890607Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2510.07315"},"observation_digest":"sha256:0bdc12e85bc2c5bc249458005d62aea689d18aa9f22b33e4afbe6fcf4cfa8cfa","observation_id":"e0338f77-ee08-455f-9f84-4f7b3dd8c808","resolution":{"observed_at":"2026-08-04T11:02:07.890607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:02:07.945865Z","title":"Hendrycks, S","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.07315","last_updated":"2026-06-05T00:30:48Z","snapshot_observed_at":"2026-08-04T11:02:02.033578Z","submitted_at":"2025-10-08T17:59:19Z","title":"SWE-IF: Aligning Code Evaluation with Human Preference","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-04T11:02:07.945865Z"},"links":{"citing_paper":"/paper/2510.07315"},"observation_digest":"sha256:5e0c2d4be8f8c95fbb123a24b5dd5cf8c0254094b184836a75002be526fe40d2","observation_id":"c61ba3df-619e-4bf6-b880-80ca8aca9094","resolution":{"observed_at":"2026-08-04T11:02:07.945865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12186","last_updated":"2024-11-12T13:24:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-18T17:57:57Z","title":"Qwen2.5-Coder Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12186","snapshot_observed_at":"2026-08-04T11:02:08.016467Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.07315","last_updated":"2026-06-05T00:30:48Z","snapshot_observed_at":"2026-08-04T11:02:02.033578Z","submitted_at":"2025-10-08T17:59:19Z","title":"SWE-IF: Aligning Code Evaluation with Human Preference","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-04T11:02:08.016467Z"},"links":{"cited_paper":"/paper/2409.12186","citing_paper":"/paper/2510.07315"},"observation_digest":"sha256:75069badc877a5ab39591145db9af69d909c50280e6b1bbba4c694fcc4d8725d","observation_id":"bfc92b07-6fff-4553-b063-ce9c07fb25d0","resolution":{"observed_at":"2026-08-04T11:02:08.016467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:02:08.097918Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.07315","last_updated":"2026-06-05T00:30:48Z","snapshot_observed_at":"2026-08-04T11:02:02.033578Z","submitted_at":"2025-10-08T17:59:19Z","title":"SWE-IF: Aligning Code Evaluation with Human Preference","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-04T11:02:08.097918Z"},"links":{"citing_paper":"/paper/2510.07315"},"observation_digest":"sha256:deece8d0813cb5460515092a78ff1d933ea4746c1bd8c94f8f1d413fae8bb0fb","observation_id":"ca8c9ce8-f7e7-406a-9fd1-4f9e657d2d86","resolution":{"observed_at":"2026-08-04T11:02:08.097918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:02:08.157590Z","title":"Jiang, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.07315","last_updated":"2026-06-05T00:30:48Z","snapshot_observed_at":"2026-08-04T11:02:02.033578Z","submitted_at":"2025-10-08T17:59:19Z","title":"SWE-IF: Aligning Code Evaluation with Human Preference","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-04T11:02:08.157590Z"},"links":{"citing_paper":"/paper/2510.07315"},"observation_digest":"sha256:97ce9717c77c9eec5d5cdcbd96ddd39d3290b5da903fc38e44c1c91a767467f3","observation_id":"2deee6ed-861a-4333-84ae-9b55173fc310","resolution":{"observed_at":"2026-08-04T11:02:08.157590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:02:08.235267Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.07315","last_updated":"2026-06-05T00:30:48Z","snapshot_observed_at":"2026-08-04T11:02:02.033578Z","submitted_at":"2025-10-08T17:59:19Z","title":"SWE-IF: Aligning Code Evaluation with Human Preference","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-04T11:02:08.235267Z"},"links":{"citing_paper":"/paper/2510.07315"},"observation_digest":"sha256:5cb7b76333a7b8a09ae464fb58fe71925cb29eab349a92f3f31bd0d4f760cae0","observation_id":"34d78033-a655-4822-b983-3d168c0d87ed","resolution":{"observed_at":"2026-08-04T11:02:08.235267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:02:08.293044Z","title":"Karpathy","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.07315","last_updated":"2026-06-05T00:30:48Z","snapshot_observed_at":"2026-08-04T11:02:02.033578Z","submitted_at":"2025-10-08T17:59:19Z","title":"SWE-IF: Aligning Code Evaluation with Human Preference","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-04T11:02:08.293044Z"},"links":{"citing_paper":"/paper/2510.07315"},"observation_digest":"sha256:2cca249cddadf8836f57d57f0854152cdaf9b73b014706dd5d26473182f9cbd1","observation_id":"1ef9cf22-1c42-4bc1-a710-10f816d2fc27","resolution":{"observed_at":"2026-08-04T11:02:08.293044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20534","last_updated":"2026-02-03T04:57:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-28T05:35:43Z","title":"Kimi K2: Open Agentic Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.20534","snapshot_observed_at":"2026-08-04T11:02:08.356746Z","title":"Kimi k2: Open agentic intelligence","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.07315","last_updated":"2026-06-05T00:30:48Z","snapshot_observed_at":"2026-08-04T11:02:02.033578Z","submitted_at":"2025-10-08T17:59:19Z","title":"SWE-IF: Aligning Code Evaluation with Human Preference","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-04T11:02:08.356746Z"},"links":{"cited_paper":"/paper/2507.20534","citing_paper":"/paper/2510.07315"},"observation_digest":"sha256:5bb6c7e8dbe07ea921fe66d6bf7c6d79ad33dab8e1807b6dae2ae63be44c891f","observation_id":"e47671b7-d587-4a66-8ac5-04b90dd9b50b","resolution":{"observed_at":"2026-08-04T11:02:08.356746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:02:08.453243Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.07315","last_updated":"2026-06-05T00:30:48Z","snapshot_observed_at":"2026-08-04T11:02:02.033578Z","submitted_at":"2025-10-08T17:59:19Z","title":"SWE-IF: Aligning Code Evaluation with Human Preference","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-04T11:02:08.453243Z"},"links":{"citing_paper":"/paper/2510.07315"},"observation_digest":"sha256:0bb14f846b5c41a01dcb6acbc6f1f22a02b34e717d7b6abce48d66bb3abbc74f","observation_id":"9986f8fe-8eab-4426-b823-6c6b71bac001","resolution":{"observed_at":"2026-08-04T11:02:08.453243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:02:08.507942Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.07315","last_updated":"2026-06-05T00:30:48Z","snapshot_observed_at":"2026-08-04T11:02:02.033578Z","submitted_at":"2025-10-08T17:59:19Z","title":"SWE-IF: Aligning Code Evaluation with Human Preference","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-04T11:02:08.507942Z"},"links":{"citing_paper":"/paper/2510.07315"},"observation_digest":"sha256:d584bb1f72dd2899c1828dc5fee7398574186f2aa6a372ebe72793b99d516606","observation_id":"1abbb8ea-04e7-4765-be3e-16c488d4e4b5","resolution":{"observed_at":"2026-08-04T11:02:08.507942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:02:08.602722Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.07315","last_updated":"2026-06-05T00:30:48Z","snapshot_observed_at":"2026-08-04T11:02:02.033578Z","submitted_at":"2025-10-08T17:59:19Z","title":"SWE-IF: Aligning Code Evaluation with Human Preference","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-04T11:02:08.602722Z"},"links":{"citing_paper":"/paper/2510.07315"},"observation_digest":"sha256:c7918e07ae29f2c56d5bef63fcc939e44880b0c7edb3a40119ef426fac300d6a","observation_id":"fc3e21d5-d4ee-4b75-b5ea-bbfd1fbc61cf","resolution":{"observed_at":"2026-08-04T11:02:08.602722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:02:08.672001Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.07315","last_updated":"2026-06-05T00:30:48Z","snapshot_observed_at":"2026-08-04T11:02:02.033578Z","submitted_at":"2025-10-08T17:59:19Z","title":"SWE-IF: Aligning Code Evaluation with Human Preference","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-04T11:02:08.672001Z"},"links":{"citing_paper":"/paper/2510.07315"},"observation_digest":"sha256:88b71bd8f46498552c90b08d9b06112f60225b6aa26f888808a21800b84d11dc","observation_id":"236daa63-fa9a-4c7b-9306-1756323cb2a2","resolution":{"observed_at":"2026-08-04T11:02:08.672001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13585","last_updated":"2025-06-16T15:08:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-16T15:08:02Z","title":"MiniMax-M1: Scaling Test-Time Compute Efficiently with Lightning Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13585","snapshot_observed_at":"2026-08-04T11:02:08.730035Z","title":"Minimax-m1: Scaling test-time compute efficiently with lightning attention","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.07315","last_updated":"2026-06-05T00:30:48Z","snapshot_observed_at":"2026-08-04T11:02:02.033578Z","submitted_at":"2025-10-08T17:59:19Z","title":"SWE-IF: Aligning Code Evaluation with Human Preference","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-04T11:02:08.730035Z"},"links":{"cited_paper":"/paper/2506.13585","citing_paper":"/paper/2510.07315"},"observation_digest":"sha256:1423c5835c88f4e21080460a68f0e732fa4dd79a6a3e985a347f8cf869c3343f","observation_id":"17b7a108-196b-49ca-b924-eba99861fef5","resolution":{"observed_at":"2026-08-04T11:02:08.730035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:02:08.827961Z","title":"Mistral medium 3, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.07315","last_updated":"2026-06-05T00:30:48Z","snapshot_observed_at":"2026-08-04T11:02:02.033578Z","submitted_at":"2025-10-08T17:59:19Z","title":"SWE-IF: Aligning Code Evaluation with Human Preference","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-04T11:02:08.827961Z"},"links":{"citing_paper":"/paper/2510.07315"},"observation_digest":"sha256:b5bc705d4ba71a88171c3186e7581f508e374089f0082aec34e22d0249b56331","observation_id":"32ee3959-3d9c-4fde-9340-3861f4338ed8","resolution":{"observed_at":"2026-08-04T11:02:08.827961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:02:08.883870Z","title":"u ndler, M. N. M \\","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.07315","last_updated":"2026-06-05T00:30:48Z","snapshot_observed_at":"2026-08-04T11:02:02.033578Z","submitted_at":"2025-10-08T17:59:19Z","title":"SWE-IF: Aligning Code Evaluation with Human Preference","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-04T11:02:08.883870Z"},"links":{"citing_paper":"/paper/2510.07315"},"observation_digest":"sha256:c41b6873e4d670fe8f25d129056fe9f4c3f6f7b635eed49798d8f6e0ccbce2a4","observation_id":"9dccd1fa-fd99-4196-a513-dd1167ca1c4c","resolution":{"observed_at":"2026-08-04T11:02:08.883870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-04T11:02:08.988974Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.07315","last_updated":"2026-06-05T00:30:48Z","snapshot_observed_at":"2026-08-04T11:02:02.033578Z","submitted_at":"2025-10-08T17:59:19Z","title":"SWE-IF: Aligning Code Evaluation with Human Preference","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-04T11:02:08.988974Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2510.07315"},"observation_digest":"sha256:293885417ec0f36f00e140c29a1a6296fb30ee21aad8fb41b6399fb9af5674be","observation_id":"aae616e5-63eb-4d14-bb63-27575852aab6","resolution":{"observed_at":"2026-08-04T11:02:08.988974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:02:09.096726Z","title":"Openai o3 and o4-mini system card","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.07315","last_updated":"2026-06-05T00:30:48Z","snapshot_observed_at":"2026-08-04T11:02:02.033578Z","submitted_at":"2025-10-08T17:59:19Z","title":"SWE-IF: Aligning Code Evaluation with Human Preference","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-04T11:02:09.096726Z"},"links":{"citing_paper":"/paper/2510.07315"},"observation_digest":"sha256:7a1d9e129eb7c2db6dd5e8e74942f093ec6e1ea0111cc0deeda0cc648d443d14","observation_id":"7ad72267-6f1d-4d4f-acc0-435f0bef0066","resolution":{"observed_at":"2026-08-04T11:02:09.096726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.06590","last_updated":"2023-02-13T18:42:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-13T18:42:46Z","title":"The Impact of AI on Developer Productivity: Evidence from GitHub Copilot","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.06590","snapshot_observed_at":"2026-08-04T11:02:09.203528Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.07315","last_updated":"2026-06-05T00:30:48Z","snapshot_observed_at":"2026-08-04T11:02:02.033578Z","submitted_at":"2025-10-08T17:59:19Z","title":"SWE-IF: Aligning Code Evaluation with Human Preference","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-04T11:02:09.203528Z"},"links":{"cited_paper":"/paper/2302.06590","citing_paper":"/paper/2510.07315"},"observation_digest":"sha256:e543b634884da1afc6a19945a6a6281b02644b7113d275a243d8fc760919d48c","observation_id":"ee04fd97-d762-4d1a-80ae-bde59d53fd19","resolution":{"observed_at":"2026-08-04T11:02:09.203528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02833","last_updated":"2025-11-11T09:40:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-03T17:44:33Z","title":"Generalizing Verifiable Instruction Following","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02833","snapshot_observed_at":"2026-08-04T11:02:09.289371Z","title":"Pyatkin, S","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.07315","last_updated":"2026-06-05T00:30:48Z","snapshot_observed_at":"2026-08-04T11:02:02.033578Z","submitted_at":"2025-10-08T17:59:19Z","title":"SWE-IF: Aligning Code Evaluation with Human Preference","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-04T11:02:09.289371Z"},"links":{"cited_paper":"/paper/2507.02833","citing_paper":"/paper/2510.07315"},"observation_digest":"sha256:a750b950956c622e505f4640e8bfa67c526c896ea49bd572f56a5f0c35e4fa5c","observation_id":"fae888b4-4f14-4e9d-be66-4e98b240e9a5","resolution":{"observed_at":"2026-08-04T11:02:09.289371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:02:09.390009Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.07315","last_updated":"2026-06-05T00:30:48Z","snapshot_observed_at":"2026-08-04T11:02:02.033578Z","submitted_at":"2025-10-08T17:59:19Z","title":"SWE-IF: Aligning Code Evaluation with Human Preference","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-04T11:02:09.390009Z"},"links":{"citing_paper":"/paper/2510.07315"},"observation_digest":"sha256:20c32474cb3542d5c132b94e9594162d4d3ae13102b0dbb0a2d646a57cbfdc56","observation_id":"89e57bc0-f4da-4ac9-8652-6639dd5294f4","resolution":{"observed_at":"2026-08-04T11:02:09.390009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-04T11:02:09.578125Z","title":"Qwen3 technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.07315","last_updated":"2026-06-05T00:30:48Z","snapshot_observed_at":"2026-08-04T11:02:02.033578Z","submitted_at":"2025-10-08T17:59:19Z","title":"SWE-IF: Aligning Code Evaluation with Human Preference","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-04T11:02:09.578125Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2510.07315"},"observation_digest":"sha256:b803bc3f090b4c50c9fcf6df2b332194ad66a52293eb2da7a55e572f7086e01c","observation_id":"48dd4258-b0d2-4815-80a2-497e96d04b33","resolution":{"observed_at":"2026-08-04T11:02:09.578125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:02:09.750076Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.07315","last_updated":"2026-06-05T00:30:48Z","snapshot_observed_at":"2026-08-04T11:02:02.033578Z","submitted_at":"2025-10-08T17:59:19Z","title":"SWE-IF: Aligning Code Evaluation with Human Preference","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-04T11:02:09.750076Z"},"links":{"citing_paper":"/paper/2510.07315"},"observation_digest":"sha256:b19dd33943231fcddaf905d1e52958e0246a1dc2179c0762ffa3d9c839eb9dcc","observation_id":"26c15920-9bee-4b28-a35d-36f7b07a034c","resolution":{"observed_at":"2026-08-04T11:02:09.750076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.15963","last_updated":"2024-09-29T05:03:25Z","snapshot_observed_at":"2026-07-06T17:21:42.659240Z","submitted_at":"2024-01-29T08:47:31Z","title":"NoFunEval: Funny How Code LMs Falter on Requirements Beyond Functional Correctness","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.15963","snapshot_observed_at":"2026-08-04T11:02:09.872963Z","title":"Singhal, T","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.07315","last_updated":"2026-06-05T00:30:48Z","snapshot_observed_at":"2026-08-04T11:02:02.033578Z","submitted_at":"2025-10-08T17:59:19Z","title":"SWE-IF: Aligning Code Evaluation with Human Preference","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-04T11:02:09.872963Z"},"links":{"cited_paper":"/paper/2401.15963","citing_paper":"/paper/2510.07315"},"observation_digest":"sha256:56763d32b1461deed9512ae42d3a836673dc63b1b46745464df3dc768c310048","observation_id":"fca45593-bcae-41b4-af70-0a730633bf8d","resolution":{"observed_at":"2026-08-04T11:02:09.872963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:02:10.082233Z","title":"Ai | 2025 stack overflow developer survey, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.07315","last_updated":"2026-06-05T00:30:48Z","snapshot_observed_at":"2026-08-04T11:02:02.033578Z","submitted_at":"2025-10-08T17:59:19Z","title":"SWE-IF: Aligning Code Evaluation with Human Preference","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-04T11:02:10.082233Z"},"links":{"citing_paper":"/paper/2510.07315"},"observation_digest":"sha256:0b11dd540e61e1db9a2c48513f48b043826e140b98aa54188ac8d79d6be0a53c","observation_id":"1fd334f4-2c1a-4d84-82fd-5893c2d1a911","resolution":{"observed_at":"2026-08-04T11:02:10.082233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2025.findings-naacl.194","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:04:46.590754Z","title":null,"venue":null,"work_id":"e8089628-ab0f-4e78-8632-c2bea7056236","year":2025},"citing_paper":{"arxiv_id":"2510.07315","last_updated":"2026-06-05T00:30:48Z","snapshot_observed_at":"2026-08-04T11:02:02.033578Z","submitted_at":"2025-10-08T17:59:19Z","title":"SWE-IF: Aligning Code Evaluation with Human Preference","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-04T11:02:10.223928Z"},"links":{"citing_paper":"/paper/2510.07315"},"observation_digest":"sha256:10a0163c7e20104c5281a827d26063965110a813e5025443cc51e89f0ca8efd8","observation_id":"dd088ea8-c4f9-40b3-b43b-17d5daa2510b","resolution":{"observed_at":"2026-08-04T11:04:46.705835Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:02:10.367795Z","title":"Willison","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.07315","last_updated":"2026-06-05T00:30:48Z","snapshot_observed_at":"2026-08-04T11:02:02.033578Z","submitted_at":"2025-10-08T17:59:19Z","title":"SWE-IF: Aligning Code Evaluation with Human Preference","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-04T11:02:10.367795Z"},"links":{"citing_paper":"/paper/2510.07315"},"observation_digest":"sha256:077ae5b0abcbed731491e3bfd10837b34728b007196f763addd41a5236d7658d","observation_id":"65e95273-0265-4959-bbf6-364d4b523207","resolution":{"observed_at":"2026-08-04T11:02:10.367795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:02:10.521318Z","title":"Grok 3 beta — the age of reasoning agents, 2025 a","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.07315","last_updated":"2026-06-05T00:30:48Z","snapshot_observed_at":"2026-08-04T11:02:02.033578Z","submitted_at":"2025-10-08T17:59:19Z","title":"SWE-IF: Aligning Code Evaluation with Human Preference","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-04T11:02:10.521318Z"},"links":{"citing_paper":"/paper/2510.07315"},"observation_digest":"sha256:c6642dbd6d8e8035d34db0ebfe2ed349a75e913c9e21b0f3dc79bb8aa6cf8692","observation_id":"f947a0c1-c25a-4445-91f8-189070e3b016","resolution":{"observed_at":"2026-08-04T11:02:10.521318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:02:10.660494Z","title":"Grok 4 model card","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.07315","last_updated":"2026-06-05T00:30:48Z","snapshot_observed_at":"2026-08-04T11:02:02.033578Z","submitted_at":"2025-10-08T17:59:19Z","title":"SWE-IF: Aligning Code Evaluation with Human Preference","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-04T11:02:10.660494Z"},"links":{"citing_paper":"/paper/2510.07315"},"observation_digest":"sha256:e47615958c6e57e980eabe8f6bd93281ebdda526fe410e5f68a78881a44de5d9","observation_id":"c0eda5a6-f77f-4d36-a0bc-1c6137d0c81c","resolution":{"observed_at":"2026-08-04T11:02:10.660494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:02:10.762490Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.07315","last_updated":"2026-06-05T00:30:48Z","snapshot_observed_at":"2026-08-04T11:02:02.033578Z","submitted_at":"2025-10-08T17:59:19Z","title":"SWE-IF: Aligning Code Evaluation with Human Preference","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-04T11:02:10.762490Z"},"links":{"citing_paper":"/paper/2510.07315"},"observation_digest":"sha256:e0119d61068505013de78219f6c63f8945316493a29f7913ce383ecb4f7dd005","observation_id":"d214c15b-cab8-4511-909e-0529e9d8b4e6","resolution":{"observed_at":"2026-08-04T11:02:10.762490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:02:10.910403Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.07315","last_updated":"2026-06-05T00:30:48Z","snapshot_observed_at":"2026-08-04T11:02:02.033578Z","submitted_at":"2025-10-08T17:59:19Z","title":"SWE-IF: Aligning Code Evaluation with Human Preference","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-04T11:02:10.910403Z"},"links":{"citing_paper":"/paper/2510.07315"},"observation_digest":"sha256:1280a6060ac0d62d4f260e69ac3f7ce2a2e6626a73b28a715a7f56b64a3c1035","observation_id":"807b35c1-32ab-4a48-85bf-a075f45d4014","resolution":{"observed_at":"2026-08-04T11:02:10.910403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:02:11.056768Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.07315","last_updated":"2026-06-05T00:30:48Z","snapshot_observed_at":"2026-08-04T11:02:02.033578Z","submitted_at":"2025-10-08T17:59:19Z","title":"SWE-IF: Aligning Code Evaluation with Human Preference","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-04T11:02:11.056768Z"},"links":{"citing_paper":"/paper/2510.07315"},"observation_digest":"sha256:2b3caef84ac148ad114b95b40830fd8fd7c59287a7b95b47d3979ac3345775e3","observation_id":"c9fa1d30-afb3-4734-9d08-ff0f8821547f","resolution":{"observed_at":"2026-08-04T11:02:11.056768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02605","last_updated":"2025-04-03T14:06:17Z","snapshot_observed_at":"2026-07-30T07:56:48.878578Z","submitted_at":"2025-04-03T14:06:17Z","title":"Multi-SWE-bench: A Multilingual Benchmark for Issue Resolving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.02605","snapshot_observed_at":"2026-08-04T11:02:11.242735Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.07315","last_updated":"2026-06-05T00:30:48Z","snapshot_observed_at":"2026-08-04T11:02:02.033578Z","submitted_at":"2025-10-08T17:59:19Z","title":"SWE-IF: Aligning Code Evaluation with Human Preference","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-04T11:02:11.242735Z"},"links":{"cited_paper":"/paper/2504.02605","citing_paper":"/paper/2510.07315"},"observation_digest":"sha256:4e0a24e75db4fca00829f340b311540dcdf8ed7ff2f7b5c7ba63b5aeb79d1d52","observation_id":"6354d2e4-f50f-4c84-be32-b23a41f0a1c5","resolution":{"observed_at":"2026-08-04T11:02:11.242735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23419","last_updated":"2025-06-01T14:53:40Z","snapshot_observed_at":"2026-08-02T15:14:08.960111Z","submitted_at":"2025-05-29T13:09:44Z","title":"SWE-bench Goes Live!","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23419","snapshot_observed_at":"2026-08-04T11:02:11.412360Z","title":"Zhang, S","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.07315","last_updated":"2026-06-05T00:30:48Z","snapshot_observed_at":"2026-08-04T11:02:02.033578Z","submitted_at":"2025-10-08T17:59:19Z","title":"SWE-IF: Aligning Code Evaluation with Human Preference","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-04T11:02:11.412360Z"},"links":{"cited_paper":"/paper/2505.23419","citing_paper":"/paper/2510.07315"},"observation_digest":"sha256:204f3e59d01700f77f0eeb804ccb024876b4dc31e8bf95dac0719341706c390e","observation_id":"985e9bc6-ccb1-40d7-bab9-f627f0a3c81e","resolution":{"observed_at":"2026-08-04T11:02:11.412360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:02:11.602401Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.07315","last_updated":"2026-06-05T00:30:48Z","snapshot_observed_at":"2026-08-04T11:02:02.033578Z","submitted_at":"2025-10-08T17:59:19Z","title":"SWE-IF: Aligning Code Evaluation with Human Preference","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-04T11:02:11.602401Z"},"links":{"citing_paper":"/paper/2510.07315"},"observation_digest":"sha256:fb19c9ced003eaa9bbcf58be9596e2fef7d1f61b339b3c19c911f68598895d28","observation_id":"aa5c7db1-1fad-4c52-837a-a99fdc42d395","resolution":{"observed_at":"2026-08-04T11:02:11.602401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11928","last_updated":"2025-06-13T16:29:09Z","snapshot_observed_at":"2026-07-06T21:41:52.859699Z","submitted_at":"2025-06-13T16:29:09Z","title":"LiveCodeBench Pro: How Do Olympiad Medalists Judge LLMs in Competitive Programming?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.11928","snapshot_observed_at":"2026-08-04T11:02:11.745455Z","title":"Zheng, Z","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.07315","last_updated":"2026-06-05T00:30:48Z","snapshot_observed_at":"2026-08-04T11:02:02.033578Z","submitted_at":"2025-10-08T17:59:19Z","title":"SWE-IF: Aligning Code Evaluation with Human Preference","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-04T11:02:11.745455Z"},"links":{"cited_paper":"/paper/2506.11928","citing_paper":"/paper/2510.07315"},"observation_digest":"sha256:bd9c49815ae5714a93b3e38d424a581d7265b2e0c4cd0b3b8ba8922fd4fe3986","observation_id":"2d323982-ee0c-4726-8350-623cdeec47c1","resolution":{"observed_at":"2026-08-04T11:02:11.745455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07911","last_updated":"2023-11-14T05:13:55Z","snapshot_observed_at":"2026-07-06T16:47:08.877195Z","submitted_at":"2023-11-14T05:13:55Z","title":"Instruction-Following Evaluation for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07911","snapshot_observed_at":"2026-08-04T11:02:11.908707Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.07315","last_updated":"2026-06-05T00:30:48Z","snapshot_observed_at":"2026-08-04T11:02:02.033578Z","submitted_at":"2025-10-08T17:59:19Z","title":"SWE-IF: Aligning Code Evaluation with Human Preference","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-04T11:02:11.908707Z"},"links":{"cited_paper":"/paper/2311.07911","citing_paper":"/paper/2510.07315"},"observation_digest":"sha256:471c9ce572961d9eaa7b0baef80c08ed2857d2a5cdf4d4586e693fec1938d982","observation_id":"4e175421-5fe2-44e6-87bb-df2cb709f36a","resolution":{"observed_at":"2026-08-04T11:02:11.908707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:02:12.103316Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.07315","last_updated":"2026-06-05T00:30:48Z","snapshot_observed_at":"2026-08-04T11:02:02.033578Z","submitted_at":"2025-10-08T17:59:19Z","title":"SWE-IF: Aligning Code Evaluation with Human Preference","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-04T11:02:12.103316Z"},"links":{"citing_paper":"/paper/2510.07315"},"observation_digest":"sha256:16b8406d593a8e1447b8273fc3cc8c3d555b502d7adc8a66527ee57833001cd2","observation_id":"52977a25-749a-40d1-b0cf-9fa72891f9fc","resolution":{"observed_at":"2026-08-04T11:02:12.103316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2510.07315","last_updated":"2026-06-05T00:30:48Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-04T11:02:02.033578Z","submitted_at":"2025-10-08T17:59:19Z","title":"SWE-IF: Aligning Code Evaluation with Human Preference"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":48,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 2 inbound Pith citation observations for arXiv:2510.07315."}