{"as_of":"2026-08-23T17:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4b61cbc3cd07e001199faf70b978855aba645e01e35fa2a94739c244e4d38b4f","coverage":[{"denominator":87,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":87,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T07:57:43.000834Z","state":"measured"},{"denominator":92,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":92,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T15:18:12.343176Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-05T13:09:10.342277Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2607.05155","last_updated":"2026-07-06T14:39:22Z","snapshot_observed_at":"2026-08-16T06:48:52.700573Z","submitted_at":"2026-07-06T14:39:22Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.05155","snapshot_observed_at":"2026-08-01T08:43:22.628158Z","title":"EdgeBench: Unveiling scaling laws of learning from real-world environments","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21051","last_updated":"2026-07-23T08:34:31Z","snapshot_observed_at":"2026-08-19T20:02:38.314874Z","submitted_at":"2026-07-23T08:34:31Z","title":"Sample-Efficient Learning from Agent Experience","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T08:43:22.628158Z"},"links":{"cited_paper":"/paper/2607.05155","citing_paper":"/paper/2607.21051"},"observation_digest":"sha256:bd38eb225c8ea4aab8868d7115831cb0bdddeb525992c3a32760b11d5b493266","observation_id":"c7ecb65b-43ab-4cc8-9de2-de63cc58e571","resolution":{"observed_at":"2026-08-01T08:43:22.628158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.05155","last_updated":"2026-07-06T14:39:22Z","snapshot_observed_at":"2026-08-16T06:48:52.700573Z","submitted_at":"2026-07-06T14:39:22Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.05155","snapshot_observed_at":"2026-08-01T05:03:45.411378Z","title":"arXiv preprint arXiv:2607.05155 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22368","last_updated":"2026-07-24T14:55:19Z","snapshot_observed_at":"2026-08-14T23:39:20.813820Z","submitted_at":"2026-07-24T14:55:19Z","title":"Do Agent Benchmarks Measure Capability? Protocol Validity in the Age of Agentic AI","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-01T05:03:45.411378Z"},"links":{"cited_paper":"/paper/2607.05155","citing_paper":"/paper/2607.22368"},"observation_digest":"sha256:188bd718640b8842e0b2546470306dd97273bd2654d0c91ddb55fa1c73e88976","observation_id":"6bb0945f-10e2-4d11-910e-6d1883fab4cb","resolution":{"observed_at":"2026-08-01T05:03:45.411378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.05155","last_updated":"2026-07-06T14:39:22Z","snapshot_observed_at":"2026-08-16T06:48:52.700573Z","submitted_at":"2026-07-06T14:39:22Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.05155","snapshot_observed_at":"2026-07-31T06:59:15.205579Z","title":"Edgebench: Unveiling scaling laws of learning from real-world environments.arXiv preprint arXiv:2607.05155, 2026a","venue":null,"work_id":null,"year":2048},"citing_paper":{"arxiv_id":"2607.24720","last_updated":"2026-07-27T17:55:03Z","snapshot_observed_at":"2026-08-06T06:30:45.988132Z","submitted_at":"2026-07-27T17:55:03Z","title":"The Physics of Multi-Turn Long-Horizon Planning: From Pre-training to Post-training via Single- and Multi-Teacher On-Policy Agentic Distillation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-31T06:59:15.205579Z"},"links":{"cited_paper":"/paper/2607.05155","citing_paper":"/paper/2607.24720"},"observation_digest":"sha256:fcca409dee9bcfedaa2b35519647f6f2da5bcc9f7586032e06f177485fa508fd","observation_id":"4e34d1c5-958c-46d1-ae55-e7b29e03fa3f","resolution":{"observed_at":"2026-07-31T06:59:15.205579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.05155","last_updated":"2026-07-06T14:39:22Z","snapshot_observed_at":"2026-08-16T06:48:52.700573Z","submitted_at":"2026-07-06T14:39:22Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments","version":1},"cited_work":{"arxiv_id":"2607.05155","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.05155","snapshot_observed_at":"2026-08-05T13:09:10.342277Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments","venue":"cs.CL","work_id":"33b50464-e3c6-4d2c-b077-cd255bb4d470","year":2026},"citing_paper":{"arxiv_id":"2608.03764","last_updated":"2026-08-04T14:51:56Z","snapshot_observed_at":"2026-08-19T23:05:59.955395Z","submitted_at":"2026-08-04T14:51:56Z","title":"GDPevo: Evaluating Agent Self-Evolution on Real Business Tasks","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T13:09:06.494394Z"},"links":{"cited_paper":"/paper/2607.05155","citing_paper":"/paper/2608.03764"},"observation_digest":"sha256:7d9d82f978476c08794af8cc69dde43f1a48df23711030bd213da6f0703051ca","observation_id":"e58e4473-b390-4895-91ea-d33b71e320b1","resolution":{"observed_at":"2026-08-05T13:09:10.439914Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2607.05155","last_updated":"2026-07-06T14:39:22Z","snapshot_observed_at":"2026-08-16T06:48:52.700573Z","submitted_at":"2026-07-06T14:39:22Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.05155","snapshot_observed_at":"2026-08-12T15:18:12.343176Z","title":"Edgebench: Unveiling scaling laws of learning from real-world environments, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.10875","last_updated":"2026-08-16T17:38:38Z","snapshot_observed_at":"2026-08-22T09:47:16.639536Z","submitted_at":"2026-08-11T12:52:38Z","title":"VibeLifeBench: Can Your Life Agent Be Proactive and Persistent in a Living World?","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T15:18:12.343176Z"},"links":{"cited_paper":"/paper/2607.05155","citing_paper":"/paper/2608.10875"},"observation_digest":"sha256:01191ead96fd802d03b87fd66e1cf45920ee5b7d771df2643745a48b1101dc24","observation_id":"ce60c5f6-a37b-472c-b4e8-d654b87278e2","resolution":{"observed_at":"2026-08-12T15:18:12.343176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2607.05155/citation-record","integrity":"/paper/2607.05155/integrity","json":"/paper/2607.05155/citation-record.json","paper":"/paper/2607.05155"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:57:43.000834Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.05155","last_updated":"2026-07-06T14:39:22Z","snapshot_observed_at":"2026-08-16T06:48:52.700573Z","submitted_at":"2026-07-06T14:39:22Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-11T07:57:43.000834Z"},"links":{"citing_paper":"/paper/2607.05155"},"observation_digest":"sha256:cc4e2f31965b5f00e2df7ed14f887aad0e126e882eec38550093c91bb2438152","observation_id":"a4636831-ba28-49ec-9420-9d9004204895","resolution":{"observed_at":"2026-07-11T07:57:43.000834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:57:43.000834Z","title":"The Claude Model Family","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05155","last_updated":"2026-07-06T14:39:22Z","snapshot_observed_at":"2026-08-16T06:48:52.700573Z","submitted_at":"2026-07-06T14:39:22Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-11T07:57:43.000834Z"},"links":{"citing_paper":"/paper/2607.05155"},"observation_digest":"sha256:4eb6b7b5c78c39939f61795623029c8effe9185677f949647b0a5f6feeb84f90","observation_id":"732f6555-3981-44dd-a3c0-9458b0301f07","resolution":{"observed_at":"2026-07-11T07:57:43.000834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:57:43.000834Z","title":"Claude Opus 4.8 System Card","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.05155","last_updated":"2026-07-06T14:39:22Z","snapshot_observed_at":"2026-08-16T06:48:52.700573Z","submitted_at":"2026-07-06T14:39:22Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-11T07:57:43.000834Z"},"links":{"citing_paper":"/paper/2607.05155"},"observation_digest":"sha256:56a08670c95ddb51802f5f1e6fd3cbc87ed289a8c713c47895315513de24cbab","observation_id":"a0b3b172-b6e6-4bca-96a0-08bda14eb0cf","resolution":{"observed_at":"2026-07-11T07:57:43.000834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.05661","last_updated":"2026-06-04T03:43:28Z","snapshot_observed_at":"2026-08-20T12:14:31.101001Z","submitted_at":"2026-06-04T03:43:28Z","title":"Continual Learning Bench: Evaluating Frontier AI Systems in Real-World Stateful Environments","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.05661","snapshot_observed_at":"2026-07-11T07:57:43.000834Z","title":"Glaze, Gabriel Orlanski, Ramya Ramakrishnan, Benji Xu, et al","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.05155","last_updated":"2026-07-06T14:39:22Z","snapshot_observed_at":"2026-08-16T06:48:52.700573Z","submitted_at":"2026-07-06T14:39:22Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-11T07:57:43.000834Z"},"links":{"cited_paper":"/paper/2606.05661","citing_paper":"/paper/2607.05155"},"observation_digest":"sha256:143e7cbf440da6d76392115eef74e47b613c1a22f0a0e6cbdd5f1ca4adc2c01b","observation_id":"d24d591d-37b8-4184-a985-90f903ff20e6","resolution":{"observed_at":"2026-07-11T07:57:43.000834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:57:43.000834Z","title":"Self-organized criticality: An explanation of 1/f noise.Physical Review Letters, 59(4):381–384, 1987","venue":null,"work_id":null,"year":1987},"citing_paper":{"arxiv_id":"2607.05155","last_updated":"2026-07-06T14:39:22Z","snapshot_observed_at":"2026-08-16T06:48:52.700573Z","submitted_at":"2026-07-06T14:39:22Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-11T07:57:43.000834Z"},"links":{"citing_paper":"/paper/2607.05155"},"observation_digest":"sha256:6765fe354b6bedbf168cc8b76eb4141e42fe11477210e1a906ee0b243f26f8cc","observation_id":"1bbf5100-911c-4bee-9da9-096f27ec977c","resolution":{"observed_at":"2026-07-11T07:57:43.000834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:57:43.000834Z","title":"Application of the logistic function to bio-assay.Journal of the American Statistical Association, 39(227):357–365, 1944","venue":null,"work_id":null,"year":1944},"citing_paper":{"arxiv_id":"2607.05155","last_updated":"2026-07-06T14:39:22Z","snapshot_observed_at":"2026-08-16T06:48:52.700573Z","submitted_at":"2026-07-06T14:39:22Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-11T07:57:43.000834Z"},"links":{"citing_paper":"/paper/2607.05155"},"observation_digest":"sha256:284c354748e592c5724db937e35ab6b0fcedc301416fe66328f6ca388e350d07","observation_id":"f01fb070-a75a-4bc0-bdcc-27117a7f6acd","resolution":{"observed_at":"2026-07-11T07:57:43.000834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04403","last_updated":"2025-08-22T17:27:09Z","snapshot_observed_at":"2026-08-23T10:40:21.899330Z","submitted_at":"2024-12-05T18:21:49Z","title":"Establishing Task Scaling Laws via Compute-Efficient Model Ladders","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04403","snapshot_observed_at":"2026-07-11T07:57:43.000834Z","title":"Smith, Dirk Groeneveld, Pang Wei Koh, Jesse Dodge, and Hannaneh Hajishirzi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05155","last_updated":"2026-07-06T14:39:22Z","snapshot_observed_at":"2026-08-16T06:48:52.700573Z","submitted_at":"2026-07-06T14:39:22Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-11T07:57:43.000834Z"},"links":{"cited_paper":"/paper/2412.04403","citing_paper":"/paper/2607.05155"},"observation_digest":"sha256:320e48673b5c8be764ff5434c93b636da9cfffb585ae33c7d91a481fef8d8766","observation_id":"b178965b-c5bf-4417-a2ba-00ad557826a1","resolution":{"observed_at":"2026-07-11T07:57:43.000834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:57:43.000834Z","title":null,"venue":null,"work_id":null,"year":2037},"citing_paper":{"arxiv_id":"2607.05155","last_updated":"2026-07-06T14:39:22Z","snapshot_observed_at":"2026-08-16T06:48:52.700573Z","submitted_at":"2026-07-06T14:39:22Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-11T07:57:43.000834Z"},"links":{"citing_paper":"/paper/2607.05155"},"observation_digest":"sha256:61e6c5c8dbdbd0f1a55380a5da7f98e5ef88322caaa54d7225e0839f8f8934d3","observation_id":"112643a7-dff6-405a-b733-501d50eedcaa","resolution":{"observed_at":"2026-07-11T07:57:43.000834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21787","last_updated":"2024-12-30T19:03:24Z","snapshot_observed_at":"2026-08-14T10:00:52.343929Z","submitted_at":"2024-07-31T17:57:25Z","title":"Large Language Monkeys: Scaling Inference Compute with Repeated Sampling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21787","snapshot_observed_at":"2026-07-11T07:57:43.000834Z","title":"Le, Christopher Ré, and Azalia Mirhoseini","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05155","last_updated":"2026-07-06T14:39:22Z","snapshot_observed_at":"2026-08-16T06:48:52.700573Z","submitted_at":"2026-07-06T14:39:22Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-11T07:57:43.000834Z"},"links":{"cited_paper":"/paper/2407.21787","citing_paper":"/paper/2607.05155"},"observation_digest":"sha256:3f70fed3b05d8912bb7420b8c5999f3d6d622ca411b5cb1a55db776a8dcb5915","observation_id":"b01ab9ac-10cd-4952-82a4-cc692c1c6142","resolution":{"observed_at":"2026-07-11T07:57:43.000834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:57:43.000834Z","title":"MLE-bench: Evaluating machine learning agents on machine learning engineering","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05155","last_updated":"2026-07-06T14:39:22Z","snapshot_observed_at":"2026-08-16T06:48:52.700573Z","submitted_at":"2026-07-06T14:39:22Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-11T07:57:43.000834Z"},"links":{"citing_paper":"/paper/2607.05155"},"observation_digest":"sha256:9d6b87baed5377afcbc374e0f1f5355203bd0def897d8589b48b5392b0b50b13","observation_id":"57fd2404-5238-4411-93f4-e2cb70846ef4","resolution":{"observed_at":"2026-07-11T07:57:43.000834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-20T20:50:23.483838Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-07-11T07:57:43.000834Z","title":"Evaluating large language models trained on code","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.05155","last_updated":"2026-07-06T14:39:22Z","snapshot_observed_at":"2026-08-16T06:48:52.700573Z","submitted_at":"2026-07-06T14:39:22Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-11T07:57:43.000834Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2607.05155"},"observation_digest":"sha256:630feddfeefe09591eae5f723a30368a85f99408b38fbc04901dde898195ad2b","observation_id":"6cfb9ad2-ae60-4a8b-9e9a-3d0287324c71","resolution":{"observed_at":"2026-07-11T07:57:43.000834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:57:43.000834Z","title":"ScienceAgentBench: Toward rigorous assessment of language agents for data-driven scientific discovery","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05155","last_updated":"2026-07-06T14:39:22Z","snapshot_observed_at":"2026-08-16T06:48:52.700573Z","submitted_at":"2026-07-06T14:39:22Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-11T07:57:43.000834Z"},"links":{"citing_paper":"/paper/2607.05155"},"observation_digest":"sha256:e8f79a056012fa26eba695a66609908ac9d2d97e9a649d25f62c0d00396793a3","observation_id":"69d17f94-8c52-4124-84ea-a44724649fb1","resolution":{"observed_at":"2026-07-11T07:57:43.000834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06853","last_updated":"2023-12-13T06:20:56Z","snapshot_observed_at":"2026-08-16T20:15:23.102462Z","submitted_at":"2023-12-11T21:49:04Z","title":"LLF-Bench: Benchmark for Interactive Learning from Language Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06853","snapshot_observed_at":"2026-07-11T07:57:43.000834Z","title":"LLF-bench: Benchmark for interactive learning from language feedback.arXiv preprint arXiv:2312.06853, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05155","last_updated":"2026-07-06T14:39:22Z","snapshot_observed_at":"2026-08-16T06:48:52.700573Z","submitted_at":"2026-07-06T14:39:22Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-11T07:57:43.000834Z"},"links":{"cited_paper":"/paper/2312.06853","citing_paper":"/paper/2607.05155"},"observation_digest":"sha256:dedc6b8ce22c7dec7da38a6eeda22b5c021509f03eaf2057a93f24946d29763e","observation_id":"865a234f-fb3e-4033-adbf-de6358e25840","resolution":{"observed_at":"2026-07-11T07:57:43.000834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.12290","last_updated":"2026-04-27T16:57:20Z","snapshot_observed_at":"2026-08-16T07:23:04.084652Z","submitted_at":"2026-04-14T05:02:06Z","title":"Frontier-Eng: Benchmarking Self-Evolving Agents on Real-World Engineering Tasks with Generative Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.12290","snapshot_observed_at":"2026-07-11T07:57:43.000834Z","title":"Frontier-Eng: Benchmarking self-evolving agents on real-world engineering tasks with generative optimization.arXiv preprint arXiv:2604.12290, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.05155","last_updated":"2026-07-06T14:39:22Z","snapshot_observed_at":"2026-08-16T06:48:52.700573Z","submitted_at":"2026-07-06T14:39:22Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-11T07:57:43.000834Z"},"links":{"cited_paper":"/paper/2604.12290","citing_paper":"/paper/2607.05155"},"observation_digest":"sha256:4794f61325af1980ebf6176ec2f76ce041e11db12c7b988729be44bed3a51e9f","observation_id":"6881fdaa-50e7-4907-be81-cb9d72c33837","resolution":{"observed_at":"2026-07-11T07:57:43.000834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:57:43.000834Z","title":"FrontierSWE: Benchmarking coding agents at the limits of human abilities.https://www.frontierswe.com/blog, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.05155","last_updated":"2026-07-06T14:39:22Z","snapshot_observed_at":"2026-08-16T06:48:52.700573Z","submitted_at":"2026-07-06T14:39:22Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-11T07:57:43.000834Z"},"links":{"citing_paper":"/paper/2607.05155"},"observation_digest":"sha256:6b8dc71e646019013753cd45388f177e8775e87f1bec3032ecf11fddca201e28","observation_id":"fcda4993-f6c6-4743-80ac-dd446547cbe4","resolution":{"observed_at":"2026-07-11T07:57:43.000834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-07-11T07:57:43.000834Z","title":"DeepSeek-R1: Incentivizing reasoning capability in LLMs via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05155","last_updated":"2026-07-06T14:39:22Z","snapshot_observed_at":"2026-08-16T06:48:52.700573Z","submitted_at":"2026-07-06T14:39:22Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-11T07:57:43.000834Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2607.05155"},"observation_digest":"sha256:a4a4b5b234bd335965f610ee6ec56ea68cc13a15d1a131eeeca7f9e40d3e0b05","observation_id":"a3fa9e3c-b2da-46a4-b722-fe0430636231","resolution":{"observed_at":"2026-07-11T07:57:43.000834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:57:43.000834Z","title":"DeepSeek-V4: Towards highly efficient million-token context intelligence.https://huggingface","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.05155","last_updated":"2026-07-06T14:39:22Z","snapshot_observed_at":"2026-08-16T06:48:52.700573Z","submitted_at":"2026-07-06T14:39:22Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-11T07:57:43.000834Z"},"links":{"citing_paper":"/paper/2607.05155"},"observation_digest":"sha256:a099bb5e520c187e4bff3c75a0191d9ab5cb60ec6b937f3fe511c9abb1b7b736","observation_id":"7bcc2faf-d59f-4810-bd0d-a8079a128692","resolution":{"observed_at":"2026-07-11T07:57:43.000834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:57:43.000834Z","title":"NL2Repo-Bench: Towards long-horizon repository generation evaluation of coding agents.arXiv preprint arXiv:2512.12730, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05155","last_updated":"2026-07-06T14:39:22Z","snapshot_observed_at":"2026-08-16T06:48:52.700573Z","submitted_at":"2026-07-06T14:39:22Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-11T07:57:43.000834Z"},"links":{"citing_paper":"/paper/2607.05155"},"observation_digest":"sha256:92aa6e1674534a4410607061a390f1e6370ed90a3735d31a5f56f3e4ebda88d0","observation_id":"4a490dd8-b0bc-45f7-aef6-0a85af173efa","resolution":{"observed_at":"2026-07-11T07:57:43.000834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:57:43.000834Z","title":"EvaLearn: Quantifying the learning capability and efficiency of LLMs via sequential problem solving.arXiv preprint arXiv:2506.02672, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05155","last_updated":"2026-07-06T14:39:22Z","snapshot_observed_at":"2026-08-16T06:48:52.700573Z","submitted_at":"2026-07-06T14:39:22Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-11T07:57:43.000834Z"},"links":{"citing_paper":"/paper/2607.05155"},"observation_digest":"sha256:d8a53032fa4756ad0fc5b2d3dce3a4f5fb819f4995d36d114eedeff9254aa459","observation_id":"73000c7a-9880-4b6e-b1dc-6669b40dc8ab","resolution":{"observed_at":"2026-07-11T07:57:43.000834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.27043","last_updated":"2026-04-29T17:44:32Z","snapshot_observed_at":"2026-08-14T08:31:08.939995Z","submitted_at":"2026-04-29T17:44:32Z","title":"CL-bench Life: Can Language Models Learn from Real-Life Context?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.27043","snapshot_observed_at":"2026-07-11T07:57:43.000834Z","title":"CL-bench Life: Can language models learn from real-life context?arXiv preprint arXiv:2604.27043, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.05155","last_updated":"2026-07-06T14:39:22Z","snapshot_observed_at":"2026-08-16T06:48:52.700573Z","submitted_at":"2026-07-06T14:39:22Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-11T07:57:43.000834Z"},"links":{"cited_paper":"/paper/2604.27043","citing_paper":"/paper/2607.05155"},"observation_digest":"sha256:9f8d438dd645e2333337a259200bd1708079b789ab734d61b7e9d6f886d794ac","observation_id":"e3760e36-17c8-4e2f-a37e-5eabc56e6cb5","resolution":{"observed_at":"2026-07-11T07:57:43.000834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:57:43.000834Z","title":"CL-bench: A benchmark for context learning.arXiv preprint arXiv:2602.03587, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.05155","last_updated":"2026-07-06T14:39:22Z","snapshot_observed_at":"2026-08-16T06:48:52.700573Z","submitted_at":"2026-07-06T14:39:22Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-11T07:57:43.000834Z"},"links":{"citing_paper":"/paper/2607.05155"},"observation_digest":"sha256:4120b1f26c141c1c380838cdb9d760a846d515728a668ecc9c6d732589a52974","observation_id":"b43d2412-b158-4a29-998b-a5746a0433e2","resolution":{"observed_at":"2026-07-11T07:57:43.000834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-11T07:57:43.000834Z","title":"The Llama 3 herd of models.arXiv preprint arXiv:2407.21783, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05155","last_updated":"2026-07-06T14:39:22Z","snapshot_observed_at":"2026-08-16T06:48:52.700573Z","submitted_at":"2026-07-06T14:39:22Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-11T07:57:43.000834Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2607.05155"},"observation_digest":"sha256:71ab03b59eacb4a0e91aa101fbcd5a2f7d0acdfca72e0f2f3b17634b78c53de1","observation_id":"0c1af386-ae71-4832-b1c3-0ee67cf747db","resolution":{"observed_at":"2026-07-11T07:57:43.000834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.13950","last_updated":"2026-05-13T18:00:00Z","snapshot_observed_at":"2026-08-20T19:27:12.997792Z","submitted_at":"2026-05-13T18:00:00Z","title":"Collider-Bench: Benchmarking AI Agents with Particle Physics Analysis Reproduction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.13950","snapshot_observed_at":"2026-07-11T07:57:43.000834Z","title":"Faroughy, Sofia Palacios Schweitzer, Ian Pang, Siddharth Mishra-Sharma, and David Shih","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.05155","last_updated":"2026-07-06T14:39:22Z","snapshot_observed_at":"2026-08-16T06:48:52.700573Z","submitted_at":"2026-07-06T14:39:22Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-11T07:57:43.000834Z"},"links":{"cited_paper":"/paper/2605.13950","citing_paper":"/paper/2607.05155"},"observation_digest":"sha256:06cb6f30424b3a0499e46f267c8b02250d08b8fb18314bbca66bf9f84c1cb4c4","observation_id":"40b8279d-1367-4817-a873-71b42c23df15","resolution":{"observed_at":"2026-07-11T07:57:43.000834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-08-14T18:15:53.516440Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-07-11T07:57:43.000834Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context.arXiv preprint arXiv:2403.05530, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05155","last_updated":"2026-07-06T14:39:22Z","snapshot_observed_at":"2026-08-16T06:48:52.700573Z","submitted_at":"2026-07-06T14:39:22Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-11T07:57:43.000834Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2607.05155"},"observation_digest":"sha256:cf713d558919c90c490229e72a8d1feaea6671ff0002cf8021c2cf69faad37fc","observation_id":"3b5a05dc-39f8-4fce-a93c-387a838617d2","resolution":{"observed_at":"2026-07-11T07:57:43.000834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-07-11T07:57:43.000834Z","title":"Gemini 2.5: Pushing the frontier with advanced reasoning, multimodality, long context, and next generation agentic capabilities.arXiv preprint arXiv:2507.06261, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05155","last_updated":"2026-07-06T14:39:22Z","snapshot_observed_at":"2026-08-16T06:48:52.700573Z","submitted_at":"2026-07-06T14:39:22Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-11T07:57:43.000834Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2607.05155"},"observation_digest":"sha256:1649726e23affa66d167da03915fe4142306e4e8278ba977aa27dc98c083d270","observation_id":"cca37178-d682-42ea-be6f-84203d0c6f06","resolution":{"observed_at":"2026-07-11T07:57:43.000834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.15763","last_updated":"2026-02-24T10:44:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-17T17:50:56Z","title":"GLM-5: from Vibe Coding to Agentic Engineering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.15763","snapshot_observed_at":"2026-07-11T07:57:43.000834Z","title":"GLM-5: from vibe coding to agentic engineering.https://arxiv.org/abs/2602.15763, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.05155","last_updated":"2026-07-06T14:39:22Z","snapshot_observed_at":"2026-08-16T06:48:52.700573Z","submitted_at":"2026-07-06T14:39:22Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-11T07:57:43.000834Z"},"links":{"cited_paper":"/paper/2602.15763","citing_paper":"/paper/2607.05155"},"observation_digest":"sha256:639b9ba4569242a85484685fc7bd55be29a93af47e480a1fed2c67533863c59b","observation_id":"8ff51093-4805-4598-a39d-68b265670f07","resolution":{"observed_at":"2026-07-11T07:57:43.000834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:57:43.000834Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05155","last_updated":"2026-07-06T14:39:22Z","snapshot_observed_at":"2026-08-16T06:48:52.700573Z","submitted_at":"2026-07-06T14:39:22Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-11T07:57:43.000834Z"},"links":{"citing_paper":"/paper/2607.05155"},"observation_digest":"sha256:7e3dfb9ba7512e02c6d07f2d87ef88ecedaa913ea2ac5b1e34f69d5e0f28984b","observation_id":"73ff0522-3efa-4149-9dc5-e4bee394a260","resolution":{"observed_at":"2026-07-11T07:57:43.000834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:57:43.000834Z","title":"Measuring massive multitask language understanding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.05155","last_updated":"2026-07-06T14:39:22Z","snapshot_observed_at":"2026-08-16T06:48:52.700573Z","submitted_at":"2026-07-06T14:39:22Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-11T07:57:43.000834Z"},"links":{"citing_paper":"/paper/2607.05155"},"observation_digest":"sha256:366b0ecf6826a397bde7df2d74260299c68ea222ebd9cf066a84ecb294307bea","observation_id":"2523e60c-3c42-4315-a9af-b181b53a2d41","resolution":{"observed_at":"2026-07-11T07:57:43.000834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:57:43.000834Z","title":"Measuring mathematical problem solving with the MATH dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.05155","last_updated":"2026-07-06T14:39:22Z","snapshot_observed_at":"2026-08-16T06:48:52.700573Z","submitted_at":"2026-07-06T14:39:22Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-11T07:57:43.000834Z"},"links":{"citing_paper":"/paper/2607.05155"},"observation_digest":"sha256:65401b6e303ca2094b0d0318de411914b7a2905387b1a9adf609758ad7046c46","observation_id":"54d22059-df86-4576-8f40-02cd8a4c65ae","resolution":{"observed_at":"2026-07-11T07:57:43.000834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.13442","last_updated":"2023-02-19T01:24:51Z","snapshot_observed_at":"2026-08-16T15:58:56.211805Z","submitted_at":"2023-01-31T06:38:53Z","title":"Scaling laws for single-agent reinforcement learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.13442","snapshot_observed_at":"2026-07-11T07:57:43.000834Z","title":"Scaling laws for single-agent reinforcement learning.arXiv preprint arXiv:2301.13442, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05155","last_updated":"2026-07-06T14:39:22Z","snapshot_observed_at":"2026-08-16T06:48:52.700573Z","submitted_at":"2026-07-06T14:39:22Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-11T07:57:43.000834Z"},"links":{"cited_paper":"/paper/2301.13442","citing_paper":"/paper/2607.05155"},"observation_digest":"sha256:1fd621de885926709a1c816fc816c52a956972677e237894e98aafa65196f6b4","observation_id":"7e2a44c4-6fe0-4a55-b6d8-c27c0d7967b2","resolution":{"observed_at":"2026-07-11T07:57:43.000834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-08-21T02:12:10.329412Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-07-11T07:57:43.000834Z","title":"Training compute-optimal large language models.arXiv preprint arXiv:2203.15556, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.05155","last_updated":"2026-07-06T14:39:22Z","snapshot_observed_at":"2026-08-16T06:48:52.700573Z","submitted_at":"2026-07-06T14:39:22Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-11T07:57:43.000834Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2607.05155"},"observation_digest":"sha256:8257de44b3d46469623c6edad10781356557d45cfd7d1ef9ace8a18498270feb","observation_id":"a7a7b1a7-3149-4201-83cb-bdc89358b7b1","resolution":{"observed_at":"2026-07-11T07:57:43.000834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:57:43.000834Z","title":"Everything Is a Ralph Loop.https://ghuntley.com/loop/, January 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.05155","last_updated":"2026-07-06T14:39:22Z","snapshot_observed_at":"2026-08-16T06:48:52.700573Z","submitted_at":"2026-07-06T14:39:22Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-11T07:57:43.000834Z"},"links":{"citing_paper":"/paper/2607.05155"},"observation_digest":"sha256:b615b49592d3554f7a0ec800a47d6fb0b39ebdb9ede0f4989c3a920d5a6fa35e","observation_id":"34df4243-24d7-4d25-a765-11b343cd2d55","resolution":{"observed_at":"2026-07-11T07:57:43.000834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:57:43.000834Z","title":"ALE-bench: A benchmark for long-horizon objective-driven algorithm engineering.arXiv preprint arXiv:2506.09050, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05155","last_updated":"2026-07-06T14:39:22Z","snapshot_observed_at":"2026-08-16T06:48:52.700573Z","submitted_at":"2026-07-06T14:39:22Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-11T07:57:43.000834Z"},"links":{"citing_paper":"/paper/2607.05155"},"observation_digest":"sha256:407bf9db93e2b5901f228c4dd95879ee49e35d5d7b33622b7377de19915d8e3b","observation_id":"328a289c-ed48-440e-89ba-c5b5d21cf6d2","resolution":{"observed_at":"2026-07-11T07:57:43.000834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:57:43.000834Z","title":"Jimenez, John Yang, Alexander Wettig, Shunyu Yao, Kexin Pei, Ofir Press, and Karthik R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05155","last_updated":"2026-07-06T14:39:22Z","snapshot_observed_at":"2026-08-16T06:48:52.700573Z","submitted_at":"2026-07-06T14:39:22Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-11T07:57:43.000834Z"},"links":{"citing_paper":"/paper/2607.05155"},"observation_digest":"sha256:c6ec4b51a8c96d0a88c8b86e2ca796f8d50b9890a730095f1170ceb195483627","observation_id":"210837f9-5455-4f29-96ae-c6a968a9bb08","resolution":{"observed_at":"2026-07-11T07:57:43.000834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-07-11T07:57:43.000834Z","title":"Brown, Benjamin Chess, Rewon Child, Scott Gray, Alec Radford, Jeffrey Wu, and Dario Amodei","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2607.05155","last_updated":"2026-07-06T14:39:22Z","snapshot_observed_at":"2026-08-16T06:48:52.700573Z","submitted_at":"2026-07-06T14:39:22Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-11T07:57:43.000834Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2607.05155"},"observation_digest":"sha256:b984ce5d89baed8d45f12ebc149578b8d7cffe94fcf7332ff1f628b4c427d615","observation_id":"7da9ee76-5a45-45bf-8fcf-2408bf9bc4d1","resolution":{"observed_at":"2026-07-11T07:57:43.000834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.13786","last_updated":"2025-10-15T17:43:03Z","snapshot_observed_at":"2026-08-18T16:44:13.851821Z","submitted_at":"2025-10-15T17:43:03Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.13786","snapshot_observed_at":"2026-07-11T07:57:43.000834Z","title":"Dhillon, David Brandfonbrener, and Rishabh Agarwal","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05155","last_updated":"2026-07-06T14:39:22Z","snapshot_observed_at":"2026-08-16T06:48:52.700573Z","submitted_at":"2026-07-06T14:39:22Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-11T07:57:43.000834Z"},"links":{"cited_paper":"/paper/2510.13786","citing_paper":"/paper/2607.05155"},"observation_digest":"sha256:c04097e43c201c95e2caf2798663bb23b207800b766c86468f70a35fa02e3996","observation_id":"b886bcb1-417d-4c26-8913-2c0937be3a9f","resolution":{"observed_at":"2026-07-11T07:57:43.000834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:57:43.000834Z","title":"Measuring AI ability to complete long tasks.arXiv preprint arXiv:2503.14499, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05155","last_updated":"2026-07-06T14:39:22Z","snapshot_observed_at":"2026-08-16T06:48:52.700573Z","submitted_at":"2026-07-06T14:39:22Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-11T07:57:43.000834Z"},"links":{"citing_paper":"/paper/2607.05155"},"observation_digest":"sha256:bb0c9724987d630a3b68874191f6710df35bdbd6a319ac918bb131d4643dd44e","observation_id":"54bd7582-59b9-4158-b3e3-f583d7bbc9dc","resolution":{"observed_at":"2026-07-11T07:57:43.000834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.07814","last_updated":"2022-02-08T23:16:31Z","snapshot_observed_at":"2026-08-15T05:41:03.327624Z","submitted_at":"2022-02-08T23:16:31Z","title":"Competition-Level Code Generation with AlphaCode","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.07814","snapshot_observed_at":"2026-07-11T07:57:43.000834Z","title":"Mankowitz, Esme Sutherland Robson, Pushmeet Kohli, Nando de Freitas, Koray Kavukcuoglu, and Oriol Vinyals","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.05155","last_updated":"2026-07-06T14:39:22Z","snapshot_observed_at":"2026-08-16T06:48:52.700573Z","submitted_at":"2026-07-06T14:39:22Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-11T07:57:43.000834Z"},"links":{"cited_paper":"/paper/2203.07814","citing_paper":"/paper/2607.05155"},"observation_digest":"sha256:26a453193ee5bd28e9ce9cd55f6e1c0c399dcee1b112115924e8ce03c9b96945","observation_id":"3ecf02af-9595-477c-a464-f98d9e60071f","resolution":{"observed_at":"2026-07-11T07:57:43.000834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:57:43.000834Z","title":"Introducing FrontierCode.https://cognition.ai/blog/frontier-code, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.05155","last_updated":"2026-07-06T14:39:22Z","snapshot_observed_at":"2026-08-16T06:48:52.700573Z","submitted_at":"2026-07-06T14:39:22Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-11T07:57:43.000834Z"},"links":{"citing_paper":"/paper/2607.05155"},"observation_digest":"sha256:cd56e5ea89106582c774487a941a8f809191abda9d759546123fbdf46ae199b4","observation_id":"cef4f759-52e3-404c-be62-fb76adab6c5a","resolution":{"observed_at":"2026-07-11T07:57:43.000834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.08678","last_updated":"2026-07-06T13:36:13Z","snapshot_observed_at":"2026-08-14T16:53:14.701034Z","submitted_at":"2026-05-09T04:29:46Z","title":"MLS-Bench: A Holistic and Rigorous Assessment of AI Systems on Building Better AI","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.08678","snapshot_observed_at":"2026-07-11T07:57:43.000834Z","title":"MLS-Bench: A holistic and rigorous assessment of AI systems on building better AI.arXiv preprint arXiv:2605.08678, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.05155","last_updated":"2026-07-06T14:39:22Z","snapshot_observed_at":"2026-08-16T06:48:52.700573Z","submitted_at":"2026-07-06T14:39:22Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-11T07:57:43.000834Z"},"links":{"cited_paper":"/paper/2605.08678","citing_paper":"/paper/2607.05155"},"observation_digest":"sha256:d2965abae7c82b9218afae7605281cec97159717ee564ed411c375927aef0a2d","observation_id":"026adc16-e3ac-4ca3-bc46-cd519e262cde","resolution":{"observed_at":"2026-07-11T07:57:43.000834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:57:43.000834Z","title":"FrontierCS: Evolving challenges for evolving intelligence.arXiv preprint arXiv:2512.15699, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05155","last_updated":"2026-07-06T14:39:22Z","snapshot_observed_at":"2026-08-16T06:48:52.700573Z","submitted_at":"2026-07-06T14:39:22Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-11T07:57:43.000834Z"},"links":{"citing_paper":"/paper/2607.05155"},"observation_digest":"sha256:1314b8c1834607458b85b537de4541437aed1a2d4d0b48f030f24bac8bab6c46","observation_id":"17e54dcf-b41c-41b5-b9fb-2af29b9d9467","resolution":{"observed_at":"2026-07-11T07:57:43.000834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:57:43.000834Z","title":"Humans still beat AI in the long horizon: Revisiting test-time scaling in the agent era.https://joyemang33.github.io/blog/ 2026/humans-dont-just-sample/, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.05155","last_updated":"2026-07-06T14:39:22Z","snapshot_observed_at":"2026-08-16T06:48:52.700573Z","submitted_at":"2026-07-06T14:39:22Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-11T07:57:43.000834Z"},"links":{"citing_paper":"/paper/2607.05155"},"observation_digest":"sha256:8fc485292c7879c7447f0d78e90bdeb07d22f8cb2a846e1877bc34f67f8cdea9","observation_id":"bb355dfe-4034-43c7-b985-a751c46b1cb2","resolution":{"observed_at":"2026-07-11T07:57:43.000834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:57:43.000834Z","title":"MAA invitational competitions: American invitational mathematics examination (AIME).https://maa.org/maa-invitational-competitions/, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.05155","last_updated":"2026-07-06T14:39:22Z","snapshot_observed_at":"2026-08-16T06:48:52.700573Z","submitted_at":"2026-07-06T14:39:22Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-11T07:57:43.000834Z"},"links":{"citing_paper":"/paper/2607.05155"},"observation_digest":"sha256:31ef2e6bce68aec8018f35e25e3cb2767424ed4130b1795f2a863250f493d83f","observation_id":"881c1fe0-2cdf-48e5-b147-dacf0d347d52","resolution":{"observed_at":"2026-07-11T07:57:43.000834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:57:43.000834Z","title":"Merrill, Alexander G","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.05155","last_updated":"2026-07-06T14:39:22Z","snapshot_observed_at":"2026-08-16T06:48:52.700573Z","submitted_at":"2026-07-06T14:39:22Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-11T07:57:43.000834Z"},"links":{"citing_paper":"/paper/2607.05155"},"observation_digest":"sha256:31351ff161cac0086a9d808cd6b6b6f3e7be95172372173c6193b770ea27939f","observation_id":"d8bf8a6e-7811-4d3a-b6e1-6b1aef51ea03","resolution":{"observed_at":"2026-07-11T07:57:43.000834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:57:43.000834Z","title":null,"venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2607.05155","last_updated":"2026-07-06T14:39:22Z","snapshot_observed_at":"2026-08-16T06:48:52.700573Z","submitted_at":"2026-07-06T14:39:22Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-11T07:57:43.000834Z"},"links":{"citing_paper":"/paper/2607.05155"},"observation_digest":"sha256:17c25c18684281e617a6f8869fb4d550719f0ab10d2712adbbbc96d883c38bad","observation_id":"91e9f2a4-293f-49ca-adc2-bfec779246a4","resolution":{"observed_at":"2026-07-11T07:57:43.000834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-07-11T07:57:43.000834Z","title":"GPT-4 technical report.arXiv preprint arXiv:2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05155","last_updated":"2026-07-06T14:39:22Z","snapshot_observed_at":"2026-08-16T06:48:52.700573Z","submitted_at":"2026-07-06T14:39:22Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-11T07:57:43.000834Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2607.05155"},"observation_digest":"sha256:593fd31b2c601b7840f4aa556da136e26c6bf0ee64f9c56b8cbf0b83d0d374c7","observation_id":"d6b770bb-1edc-4a58-97ca-832b32585cf4","resolution":{"observed_at":"2026-07-11T07:57:43.000834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:57:43.000834Z","title":"Learning to reason with LLMs.https://openai.com/index/learning-to-reason-with-llms/, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05155","last_updated":"2026-07-06T14:39:22Z","snapshot_observed_at":"2026-08-16T06:48:52.700573Z","submitted_at":"2026-07-06T14:39:22Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-11T07:57:43.000834Z"},"links":{"citing_paper":"/paper/2607.05155"},"observation_digest":"sha256:9d0d952b8ca38700248121b47701934af08a171b648accef1d14af5e9028a854","observation_id":"a851a6a5-d2c6-477f-bf96-244b56372cab","resolution":{"observed_at":"2026-07-11T07:57:43.000834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:57:43.000834Z","title":"Introducing SWE-bench verified","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05155","last_updated":"2026-07-06T14:39:22Z","snapshot_observed_at":"2026-08-16T06:48:52.700573Z","submitted_at":"2026-07-06T14:39:22Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-11T07:57:43.000834Z"},"links":{"citing_paper":"/paper/2607.05155"},"observation_digest":"sha256:19928b57057acbab4e3ff09753e77d3efc58ea4124d1e4babfb23ccd0f1d4ce6","observation_id":"0d27af57-53f9-429e-a886-97f8b5f06485","resolution":{"observed_at":"2026-07-11T07:57:43.000834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:57:43.000834Z","title":"Computer-using agent.https://openai.com/index/computer-using-agent/, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05155","last_updated":"2026-07-06T14:39:22Z","snapshot_observed_at":"2026-08-16T06:48:52.700573Z","submitted_at":"2026-07-06T14:39:22Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-11T07:57:43.000834Z"},"links":{"citing_paper":"/paper/2607.05155"},"observation_digest":"sha256:40c68fc666f27e0cdf88e1d3bbfede4fd566d067f98a1986eb3bb900d84ff41c","observation_id":"be1cf6c6-bf4b-44a7-a72f-bd0d64a9af93","resolution":{"observed_at":"2026-07-11T07:57:43.000834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:57:43.000834Z","title":"GPT-4.5 System Card.https://cdn.openai.com/gpt-4-5-system-card-2272025.pdf, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05155","last_updated":"2026-07-06T14:39:22Z","snapshot_observed_at":"2026-08-16T06:48:52.700573Z","submitted_at":"2026-07-06T14:39:22Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-11T07:57:43.000834Z"},"links":{"citing_paper":"/paper/2607.05155"},"observation_digest":"sha256:5932d42773e4b4533beb98230f00f005d5f66b97fc2c39b03705509059e105e6","observation_id":"3a1aaa90-bc35-47e1-b1a8-2381540d2446","resolution":{"observed_at":"2026-07-11T07:57:43.000834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:57:43.000834Z","title":"Update to GPT-5 System Card: GPT-5.2","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05155","last_updated":"2026-07-06T14:39:22Z","snapshot_observed_at":"2026-08-16T06:48:52.700573Z","submitted_at":"2026-07-06T14:39:22Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-11T07:57:43.000834Z"},"links":{"citing_paper":"/paper/2607.05155"},"observation_digest":"sha256:943cb19026250d57a90d4d1371a384cc2fd6f25c387f3ccc6f6f087a30273bcf","observation_id":"78be564a-c477-4f0e-8910-22ba64918f9a","resolution":{"observed_at":"2026-07-11T07:57:43.000834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.03267","last_updated":"2026-05-01T23:55:43Z","snapshot_observed_at":"2026-08-15T00:17:32.875866Z","submitted_at":"2025-12-19T07:05:38Z","title":"OpenAI GPT-5 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.03267","snapshot_observed_at":"2026-07-11T07:57:43.000834Z","title":"GPT-5 System Card.arXiv preprint arXiv:2601.03267, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05155","last_updated":"2026-07-06T14:39:22Z","snapshot_observed_at":"2026-08-16T06:48:52.700573Z","submitted_at":"2026-07-06T14:39:22Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-11T07:57:43.000834Z"},"links":{"cited_paper":"/paper/2601.03267","citing_paper":"/paper/2607.05155"},"observation_digest":"sha256:46ae8ac56dc1e786d2c9b7171c62a8c612cc43331b5c6323b8fb5dd93d9f6897","observation_id":"e47e857d-0523-466f-9746-0b9b56a260c6","resolution":{"observed_at":"2026-07-11T07:57:43.000834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:57:43.000834Z","title":"Follow a Goal","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.05155","last_updated":"2026-07-06T14:39:22Z","snapshot_observed_at":"2026-08-16T06:48:52.700573Z","submitted_at":"2026-07-06T14:39:22Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-11T07:57:43.000834Z"},"links":{"citing_paper":"/paper/2607.05155"},"observation_digest":"sha256:3a09bb2e668b571a6f81b057a20364378f93ba28fd2c0b5e20b877402832fd34","observation_id":"70905830-041f-486b-b4cc-9343160de6a8","resolution":{"observed_at":"2026-07-11T07:57:43.000834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:57:43.000834Z","title":"GPT-5.4 Thinking System Card","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.05155","last_updated":"2026-07-06T14:39:22Z","snapshot_observed_at":"2026-08-16T06:48:52.700573Z","submitted_at":"2026-07-06T14:39:22Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-11T07:57:43.000834Z"},"links":{"citing_paper":"/paper/2607.05155"},"observation_digest":"sha256:b5856385425ce3af570578c8a3ffa82c5a9170a874e0fa3bdc44419509261083","observation_id":"e16acc0c-60f2-4a96-8241-aebfbf01853c","resolution":{"observed_at":"2026-07-11T07:57:43.000834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:57:43.000834Z","title":"GPT-5.5 System Card","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.05155","last_updated":"2026-07-06T14:39:22Z","snapshot_observed_at":"2026-08-16T06:48:52.700573Z","submitted_at":"2026-07-06T14:39:22Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-11T07:57:43.000834Z"},"links":{"citing_paper":"/paper/2607.05155"},"observation_digest":"sha256:194b439e52bd6291e88becb4d0e12e6537202a1a117cd05f13becb5b4d8d4b61","observation_id":"fc34b859-fde2-4635-981c-05305836231f","resolution":{"observed_at":"2026-07-11T07:57:43.000834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04757","last_updated":"2024-01-09T17:34:30Z","snapshot_observed_at":"2026-08-16T14:28:44.947758Z","submitted_at":"2024-01-09T17:34:30Z","title":"How predictable is language model benchmark performance?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04757","snapshot_observed_at":"2026-07-11T07:57:43.000834Z","title":"How predictable is language model benchmark performance?arXiv preprint arXiv:2401.04757, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05155","last_updated":"2026-07-06T14:39:22Z","snapshot_observed_at":"2026-08-16T06:48:52.700573Z","submitted_at":"2026-07-06T14:39:22Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-11T07:57:43.000834Z"},"links":{"cited_paper":"/paper/2401.04757","citing_paper":"/paper/2607.05155"},"observation_digest":"sha256:fd9729e67e19963f67716eabd67fbd24723ba7da55787214e1c5349e86ca5388","observation_id":"55cb6e29-b47e-46a7-911f-8a59565b5b1f","resolution":{"observed_at":"2026-07-11T07:57:43.000834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.04374","last_updated":"2025-10-05T21:36:43Z","snapshot_observed_at":"2026-07-06T22:31:44.964774Z","submitted_at":"2025-10-05T21:36:43Z","title":"GDPval: Evaluating AI Model Performance on Real-World Economically Valuable Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.04374","snapshot_observed_at":"2026-07-11T07:57:43.000834Z","title":"GDPval: Evaluating AI model performance on real-world economically valuable tasks.arXiv preprint arXiv:2510.04374, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05155","last_updated":"2026-07-06T14:39:22Z","snapshot_observed_at":"2026-08-16T06:48:52.700573Z","submitted_at":"2026-07-06T14:39:22Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-11T07:57:43.000834Z"},"links":{"cited_paper":"/paper/2510.04374","citing_paper":"/paper/2607.05155"},"observation_digest":"sha256:f1f448b24db60deb9054924e6e3ccc0c74d5d8d378cc01e6572e9f6cc0f206f9","observation_id":"8afc3c7d-9e70-430e-bce6-d4eb4626ee1c","resolution":{"observed_at":"2026-07-11T07:57:43.000834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:57:43.000834Z","title":"PRBench: End-to-end paper reproduction in physics research.arXiv preprint arXiv:2603.27646, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.05155","last_updated":"2026-07-06T14:39:22Z","snapshot_observed_at":"2026-08-16T06:48:52.700573Z","submitted_at":"2026-07-06T14:39:22Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-11T07:57:43.000834Z"},"links":{"citing_paper":"/paper/2607.05155"},"observation_digest":"sha256:5993d15fa1a4ae6f1b3bae1b35f07841ae557040c72cd01b704ecf9dbe54c906","observation_id":"f91086f6-b85b-41a4-bb86-9a70c300f0b3","resolution":{"observed_at":"2026-07-11T07:57:43.000834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12022","last_updated":"2023-11-20T18:57:34Z","snapshot_observed_at":"2026-08-21T17:04:32.090035Z","submitted_at":"2023-11-20T18:57:34Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12022","snapshot_observed_at":"2026-07-11T07:57:43.000834Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05155","last_updated":"2026-07-06T14:39:22Z","snapshot_observed_at":"2026-08-16T06:48:52.700573Z","submitted_at":"2026-07-06T14:39:22Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-11T07:57:43.000834Z"},"links":{"cited_paper":"/paper/2311.12022","citing_paper":"/paper/2607.05155"},"observation_digest":"sha256:a87e6ce6d7486fdfc6e1f2126fae097e0a2f1de884c35a2059390d89b7f6886b","observation_id":"f1e1595b-1e44-4dd1-b005-eb1d9a436803","resolution":{"observed_at":"2026-07-11T07:57:43.000834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17354","last_updated":"2025-03-21T17:54:01Z","snapshot_observed_at":"2026-08-16T12:47:51.900771Z","submitted_at":"2025-03-21T17:54:01Z","title":"HCAST: Human-Calibrated Autonomy Software Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.17354","snapshot_observed_at":"2026-07-11T07:57:43.000834Z","title":"HCAST: Human-calibrated autonomy software tasks.arXiv preprint arXiv:2503.17354, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05155","last_updated":"2026-07-06T14:39:22Z","snapshot_observed_at":"2026-08-16T06:48:52.700573Z","submitted_at":"2026-07-06T14:39:22Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-11T07:57:43.000834Z"},"links":{"cited_paper":"/paper/2503.17354","citing_paper":"/paper/2607.05155"},"observation_digest":"sha256:0ec3a174a64aa59eb6275d9670d264c3b091b4b68431aa84b4bd70d15e7c3c88","observation_id":"ee29afa1-7422-4610-8ab1-71a255dac09e","resolution":{"observed_at":"2026-07-11T07:57:43.000834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10938","last_updated":"2024-10-01T23:38:10Z","snapshot_observed_at":"2026-08-16T13:51:47.687448Z","submitted_at":"2024-05-17T17:49:44Z","title":"Observational Scaling Laws and the Predictability of Language Model Performance","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.10938","snapshot_observed_at":"2026-07-11T07:57:43.000834Z","title":"Maddison, and Tatsunori Hashimoto","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05155","last_updated":"2026-07-06T14:39:22Z","snapshot_observed_at":"2026-08-16T06:48:52.700573Z","submitted_at":"2026-07-06T14:39:22Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-11T07:57:43.000834Z"},"links":{"cited_paper":"/paper/2405.10938","citing_paper":"/paper/2607.05155"},"observation_digest":"sha256:ec7fedcfd4f8d4ed3ffeb0de6ed99fb008a9cb685c97c6e4fb23bbc7617dc88f","observation_id":"c7c6e6ae-4d1e-41ba-9124-1a301b67e354","resolution":{"observed_at":"2026-07-11T07:57:43.000834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-16T07:40:03.364615Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.07976","snapshot_observed_at":"2026-07-11T07:57:43.000834Z","title":"Thinking vs","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05155","last_updated":"2026-07-06T14:39:22Z","snapshot_observed_at":"2026-08-16T06:48:52.700573Z","submitted_at":"2026-07-06T14:39:22Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-11T07:57:43.000834Z"},"links":{"cited_paper":"/paper/2506.07976","citing_paper":"/paper/2607.05155"},"observation_digest":"sha256:0555118b69d4a1c8b3a963dc748d5204ede3ae7b5121b3aaadb2152d3c94eeaa","observation_id":"29cf167a-bdf0-43fa-ae28-3af81c202ecb","resolution":{"observed_at":"2026-07-11T07:57:43.000834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11363","last_updated":"2026-06-22T22:36:12Z","snapshot_observed_at":"2026-08-16T13:17:45.152269Z","submitted_at":"2024-09-17T17:13:19Z","title":"CORE-Bench: Fostering the Credibility of Published Research Through a Computational Reproducibility Agent Benchmark","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11363","snapshot_observed_at":"2026-07-11T07:57:43.000834Z","title":"Siegel, Sayash Kapoor, Nitya Nadgir, Benedikt Stroebl, and Arvind Narayanan","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05155","last_updated":"2026-07-06T14:39:22Z","snapshot_observed_at":"2026-08-16T06:48:52.700573Z","submitted_at":"2026-07-06T14:39:22Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-07-11T07:57:43.000834Z"},"links":{"cited_paper":"/paper/2409.11363","citing_paper":"/paper/2607.05155"},"observation_digest":"sha256:4d35608b763bb7f9e675278c556b5ef82960b8da6ae7e23736a741956d1db2a8","observation_id":"0c2d66e0-eecb-4956-b3d5-71cb9d17f48c","resolution":{"observed_at":"2026-07-11T07:57:43.000834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-07-11T07:57:43.000834Z","title":"Scaling LLM test-time compute optimally can be more effective than scaling model parameters.arXiv preprint arXiv:2408.03314, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05155","last_updated":"2026-07-06T14:39:22Z","snapshot_observed_at":"2026-08-16T06:48:52.700573Z","submitted_at":"2026-07-06T14:39:22Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-07-11T07:57:43.000834Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2607.05155"},"observation_digest":"sha256:1807b8e1e07b628299b607e7409a70854a1226e3e66ab3f828fe4deab02c57b4","observation_id":"82694a33-b01e-4646-8691-20ad6d64bcdc","resolution":{"observed_at":"2026-07-11T07:57:43.000834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:57:43.000834Z","title":"PaperBench: Evaluating AI’s ability to replicate AI research","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05155","last_updated":"2026-07-06T14:39:22Z","snapshot_observed_at":"2026-08-16T06:48:52.700573Z","submitted_at":"2026-07-06T14:39:22Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-07-11T07:57:43.000834Z"},"links":{"citing_paper":"/paper/2607.05155"},"observation_digest":"sha256:8b39d2ce21696379c0449bd0e368c23ec796ed4bfa46f2bc5ea4198eab4f7510","observation_id":"bfdd95cd-b5f7-4f98-b4d2-9fbad01feefb","resolution":{"observed_at":"2026-07-11T07:57:43.000834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:57:43.000834Z","title":"Agents’ last exam.arXiv preprint arXiv:2606.05405, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.05155","last_updated":"2026-07-06T14:39:22Z","snapshot_observed_at":"2026-08-16T06:48:52.700573Z","submitted_at":"2026-07-06T14:39:22Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-07-11T07:57:43.000834Z"},"links":{"citing_paper":"/paper/2607.05155"},"observation_digest":"sha256:13c1049042242c01843894cb98ddb3966a0c82ec9acb8a26f4fedb60ef40f93c","observation_id":"712d4198-2fad-4628-9742-ca7899573f11","resolution":{"observed_at":"2026-07-11T07:57:43.000834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.18470","last_updated":"2026-04-04T09:52:04Z","snapshot_observed_at":"2026-07-30T13:30:43.108201Z","submitted_at":"2025-12-20T19:08:15Z","title":"SWE-EVO: Benchmarking Coding Agents in Long-Horizon Software Evolution Scenarios","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.18470","snapshot_observed_at":"2026-07-11T07:57:43.000834Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05155","last_updated":"2026-07-06T14:39:22Z","snapshot_observed_at":"2026-08-16T06:48:52.700573Z","submitted_at":"2026-07-06T14:39:22Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-07-11T07:57:43.000834Z"},"links":{"cited_paper":"/paper/2512.18470","citing_paper":"/paper/2607.05155"},"observation_digest":"sha256:bb4363a26e3e47195089816402d09ef1c8b66133a125e97b9db5a128db774562","observation_id":"1defa02b-5608-43f3-a65d-70e52db69747","resolution":{"observed_at":"2026-07-11T07:57:43.000834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12516","last_updated":"2025-04-16T22:27:45Z","snapshot_observed_at":"2026-08-19T14:42:43.739745Z","submitted_at":"2025-04-16T22:27:45Z","title":"BrowseComp: A Simple Yet Challenging Benchmark for Browsing Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.12516","snapshot_observed_at":"2026-07-11T07:57:43.000834Z","title":"BrowseComp: A simple yet challenging benchmark for browsing agents.arXiv preprint arXiv:2504.12516, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05155","last_updated":"2026-07-06T14:39:22Z","snapshot_observed_at":"2026-08-16T06:48:52.700573Z","submitted_at":"2026-07-06T14:39:22Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-07-11T07:57:43.000834Z"},"links":{"cited_paper":"/paper/2504.12516","citing_paper":"/paper/2607.05155"},"observation_digest":"sha256:3b3d6655193fc0b10fcf3b46baaf7d09f7a87eb63d51b070634f9dfc8b5bb13d","observation_id":"d112d6e9-5606-40dc-a387-121b2e1da382","resolution":{"observed_at":"2026-07-11T07:57:43.000834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.20857","last_updated":"2026-05-18T16:18:02Z","snapshot_observed_at":"2026-08-20T12:55:17.970132Z","submitted_at":"2025-11-25T21:08:07Z","title":"Evo-Memory: Benchmarking LLM Agent Test-time Learning with Self-Evolving Memory","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.20857","snapshot_observed_at":"2026-07-11T07:57:43.000834Z","title":"Chi, et al","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05155","last_updated":"2026-07-06T14:39:22Z","snapshot_observed_at":"2026-08-16T06:48:52.700573Z","submitted_at":"2026-07-06T14:39:22Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-07-11T07:57:43.000834Z"},"links":{"cited_paper":"/paper/2511.20857","citing_paper":"/paper/2607.05155"},"observation_digest":"sha256:15797435765c86adca39100520634e57fb01b3a3e4051d18d152c9cf8fd5c334","observation_id":"252f20b3-6da8-46dd-b279-166d986c5e88","resolution":{"observed_at":"2026-07-11T07:57:43.000834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:57:43.000834Z","title":"A statistical distribution function of wide applicability.Journal of Applied Mechanics, 18(3): 293–297, 1951","venue":null,"work_id":null,"year":1951},"citing_paper":{"arxiv_id":"2607.05155","last_updated":"2026-07-06T14:39:22Z","snapshot_observed_at":"2026-08-16T06:48:52.700573Z","submitted_at":"2026-07-06T14:39:22Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-07-11T07:57:43.000834Z"},"links":{"citing_paper":"/paper/2607.05155"},"observation_digest":"sha256:bf886717343a4a488c440b86854197f8ff8775640aead2331f8ab9f974699ffe","observation_id":"22315c62-4bfa-47c5-a42d-840f1a112ec2","resolution":{"observed_at":"2026-07-11T07:57:43.000834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:57:43.000834Z","title":"RE-bench: Evaluating frontier AI R&D capabilities of language model agents against human experts","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05155","last_updated":"2026-07-06T14:39:22Z","snapshot_observed_at":"2026-08-16T06:48:52.700573Z","submitted_at":"2026-07-06T14:39:22Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-07-11T07:57:43.000834Z"},"links":{"citing_paper":"/paper/2607.05155"},"observation_digest":"sha256:61279fb94562f5ab54cf77efb7b8a8599c6047772c121d890f3c8d3b8adbe525","observation_id":"f8cf512a-ebdb-4e42-8857-b0716d1e392e","resolution":{"observed_at":"2026-07-11T07:57:43.000834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:57:43.000834Z","title":"Sigmoid function.https://en.wikipedia.org/wiki/Sigmoid_function, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05155","last_updated":"2026-07-06T14:39:22Z","snapshot_observed_at":"2026-08-16T06:48:52.700573Z","submitted_at":"2026-07-06T14:39:22Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-07-11T07:57:43.000834Z"},"links":{"citing_paper":"/paper/2607.05155"},"observation_digest":"sha256:01ae41b1f6b46baf24bb518f8e86c31b456e3c93718cb2b9f7a8a00dde57eded","observation_id":"7c0d626a-d78c-4aaa-b494-6941e0d25c4c","resolution":{"observed_at":"2026-07-11T07:57:43.000834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:57:43.000834Z","title":"StreamBench: Towards benchmarking continuous improvement of language agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05155","last_updated":"2026-07-06T14:39:22Z","snapshot_observed_at":"2026-08-16T06:48:52.700573Z","submitted_at":"2026-07-06T14:39:22Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-07-11T07:57:43.000834Z"},"links":{"citing_paper":"/paper/2607.05155"},"observation_digest":"sha256:c6fa6efd5a11e69b356bf442a166168b5507aa9dfa17b60c3099c5346906ae5f","observation_id":"2d6660aa-82ab-4b57-903c-a210987b8135","resolution":{"observed_at":"2026-07-11T07:57:43.000834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00724","last_updated":"2025-03-03T07:53:32Z","snapshot_observed_at":"2026-08-13T03:06:10.986532Z","submitted_at":"2024-08-01T17:16:04Z","title":"Inference Scaling Laws: An Empirical Analysis of Compute-Optimal Inference for Problem-Solving with Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00724","snapshot_observed_at":"2026-07-11T07:57:43.000834Z","title":"Inference scaling laws: An empirical analysis of compute-optimal inference for problem-solving with language models.arXiv preprint arXiv:2408.00724, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05155","last_updated":"2026-07-06T14:39:22Z","snapshot_observed_at":"2026-08-16T06:48:52.700573Z","submitted_at":"2026-07-06T14:39:22Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-07-11T07:57:43.000834Z"},"links":{"cited_paper":"/paper/2408.00724","citing_paper":"/paper/2607.05155"},"observation_digest":"sha256:3475315574389c07b369fb26f6366fd99fe2ee1caf9f5fcec32751f44cff97bd","observation_id":"47937986-7f5f-4b95-b26e-823417d4f43e","resolution":{"observed_at":"2026-07-11T07:57:43.000834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.15846","last_updated":"2026-05-19T08:10:44Z","snapshot_observed_at":"2026-08-15T10:00:23.637855Z","submitted_at":"2026-05-15T11:00:33Z","title":"RoadmapBench: Evaluating Long-Horizon Agentic Software Development Across Version Upgrades","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.15846","snapshot_observed_at":"2026-07-11T07:57:43.000834Z","title":"RoadmapBench: Evaluating long-horizon agentic software development across version upgrades.arXiv preprint arXiv:2605.15846, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.05155","last_updated":"2026-07-06T14:39:22Z","snapshot_observed_at":"2026-08-16T06:48:52.700573Z","submitted_at":"2026-07-06T14:39:22Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-07-11T07:57:43.000834Z"},"links":{"cited_paper":"/paper/2605.15846","citing_paper":"/paper/2607.05155"},"observation_digest":"sha256:65bdbc61aed1612c667badb7af084b51d247f377e06da6759bfecbe78a6ffb1a","observation_id":"82f25be7-e4ef-4f8b-a507-683c691cfcf5","resolution":{"observed_at":"2026-07-11T07:57:43.000834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.05080","last_updated":"2026-06-03T16:36:54Z","snapshot_observed_at":"2026-08-16T11:21:56.859838Z","submitted_at":"2026-06-03T16:36:54Z","title":"AutoLab: Can Frontier Models Solve Long-Horizon Auto Research and Engineering Tasks?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.05080","snapshot_observed_at":"2026-07-11T07:57:43.000834Z","title":"AutoLab: Can frontier models solve long-horizon auto research and engineering tasks?arXiv preprint arXiv:2606.05080, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.05155","last_updated":"2026-07-06T14:39:22Z","snapshot_observed_at":"2026-08-16T06:48:52.700573Z","submitted_at":"2026-07-06T14:39:22Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-07-11T07:57:43.000834Z"},"links":{"cited_paper":"/paper/2606.05080","citing_paper":"/paper/2607.05155"},"observation_digest":"sha256:d11e25fa283bee0b2ca94e8e9a8f1a529605bfb26c0a50c94e6b1c2734a8a27f","observation_id":"7b4ae5b9-58ca-4e14-bf39-7f8ab6ce8281","resolution":{"observed_at":"2026-07-11T07:57:43.000834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.03546","last_updated":"2026-05-05T09:17:02Z","snapshot_observed_at":"2026-08-19T03:40:13.471044Z","submitted_at":"2026-05-05T09:17:02Z","title":"ProgramBench: Can Language Models Rebuild Programs From Scratch?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.03546","snapshot_observed_at":"2026-07-11T07:57:43.000834Z","title":"ProgramBench: Can language models rebuild programs from scratch?arXiv preprint arXiv:2605.03546, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.05155","last_updated":"2026-07-06T14:39:22Z","snapshot_observed_at":"2026-08-16T06:48:52.700573Z","submitted_at":"2026-07-06T14:39:22Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-07-11T07:57:43.000834Z"},"links":{"cited_paper":"/paper/2605.03546","citing_paper":"/paper/2607.05155"},"observation_digest":"sha256:6141b49352061dc9812dab55f46182394afdb428bd241d2f197524abfb49df0b","observation_id":"83dd5da8-a8d8-400f-84f0-19ca19df90eb","resolution":{"observed_at":"2026-07-11T07:57:43.000834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:57:43.000834Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05155","last_updated":"2026-07-06T14:39:22Z","snapshot_observed_at":"2026-08-16T06:48:52.700573Z","submitted_at":"2026-07-06T14:39:22Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-07-11T07:57:43.000834Z"},"links":{"citing_paper":"/paper/2607.05155"},"observation_digest":"sha256:d8a3e597a65071e7b81eea2ad1e18b957e6db62913bd6c6697eda77cb8a0a94a","observation_id":"3419edba-ac58-47af-9f84-e4b284203e24","resolution":{"observed_at":"2026-07-11T07:57:43.000834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:57:43.000834Z","title":"GLM-5.1: Towards long-horizon tasks.https://z.ai/blog/glm-5.1, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.05155","last_updated":"2026-07-06T14:39:22Z","snapshot_observed_at":"2026-08-16T06:48:52.700573Z","submitted_at":"2026-07-06T14:39:22Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-07-11T07:57:43.000834Z"},"links":{"citing_paper":"/paper/2607.05155"},"observation_digest":"sha256:1b196df10c300ce355d83c147357dae742dc9eec883a9a46d991f4bf5291babc","observation_id":"2d2e2253-0e65-405a-9e00-2bec3401796b","resolution":{"observed_at":"2026-07-11T07:57:43.000834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.15327","last_updated":"2026-06-06T22:17:18Z","snapshot_observed_at":"2026-08-14T11:36:00.003257Z","submitted_at":"2026-02-17T03:13:51Z","title":"Prescriptive Scaling Reveals the Evolution of Language Model Capabilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.15327","snapshot_observed_at":"2026-07-11T07:57:43.000834Z","title":"Prescriptive scaling reveals the evolution of language model capabilities.arXiv preprint arXiv:2602.15327, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.05155","last_updated":"2026-07-06T14:39:22Z","snapshot_observed_at":"2026-08-16T06:48:52.700573Z","submitted_at":"2026-07-06T14:39:22Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-07-11T07:57:43.000834Z"},"links":{"cited_paper":"/paper/2602.15327","citing_paper":"/paper/2607.05155"},"observation_digest":"sha256:9bc9cf6ac5f05f5e8ac22bec150730d0bd24b46cc311bd145d61806c82037a1e","observation_id":"8ffc4346-e530-4b02-b3e9-dc7f9b48d6ed","resolution":{"observed_at":"2026-07-11T07:57:43.000834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:57:43.000834Z","title":"SWE-AGI: Benchmarking specification-driven software construction with MoonBit in the era of autonomous agents.arXiv preprint arXiv:2602.09447, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.05155","last_updated":"2026-07-06T14:39:22Z","snapshot_observed_at":"2026-08-16T06:48:52.700573Z","submitted_at":"2026-07-06T14:39:22Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-07-11T07:57:43.000834Z"},"links":{"citing_paper":"/paper/2607.05155"},"observation_digest":"sha256:85648a63b94e29c990d14d0f190ac4648e3f972ea1cf2d3bd592d38931553071","observation_id":"00de3fbb-5693-4642-97aa-b58b811c76c6","resolution":{"observed_at":"2026-07-11T07:57:43.000834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11942","last_updated":"2025-05-30T02:28:21Z","snapshot_observed_at":"2026-08-19T20:11:09.656463Z","submitted_at":"2025-05-17T10:09:11Z","title":"LifelongAgentBench: Evaluating LLM Agents as Lifelong Learners","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.11942","snapshot_observed_at":"2026-07-11T07:57:43.000834Z","title":"LifelongAgentBench: Evaluating LLM agents as lifelong learners.arXiv preprint arXiv:2505.11942, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05155","last_updated":"2026-07-06T14:39:22Z","snapshot_observed_at":"2026-08-16T06:48:52.700573Z","submitted_at":"2026-07-06T14:39:22Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-07-11T07:57:43.000834Z"},"links":{"cited_paper":"/paper/2505.11942","citing_paper":"/paper/2607.05155"},"observation_digest":"sha256:13b00febc07c1b56eee0338b190f5360630fb3e16b3ae1753c33b9c17d352d83","observation_id":"a011244a-6d00-4119-a029-e0ee87c7f1a5","resolution":{"observed_at":"2026-07-11T07:57:43.000834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:57:43.000834Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05155","last_updated":"2026-07-06T14:39:22Z","snapshot_observed_at":"2026-08-16T06:48:52.700573Z","submitted_at":"2026-07-06T14:39:22Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-07-11T07:57:43.000834Z"},"links":{"citing_paper":"/paper/2607.05155"},"observation_digest":"sha256:bb65acc9f49e01ecf1d143674fb282e3b9f700d6b40968d6d7856fe3f05efdb9","observation_id":"4f56a403-bb20-49d5-9cb9-a7ee627a9e52","resolution":{"observed_at":"2026-07-11T07:57:43.000834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:57:43.000834Z","title":"Within one task, the conditional expected score-growth rate is a weighted cut from unlocked score nodes to locked score nodes of the task graph","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05155","last_updated":"2026-07-06T14:39:22Z","snapshot_observed_at":"2026-08-16T06:48:52.700573Z","submitted_at":"2026-07-06T14:39:22Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-07-11T07:57:43.000834Z"},"links":{"citing_paper":"/paper/2607.05155"},"observation_digest":"sha256:a41d70aa7ea049ead5006e758432a131ce06630acac503cf2096066abe637545","observation_id":"10e6ca54-87a1-4472-b024-0179f90f2e44","resolution":{"observed_at":"2026-07-11T07:57:43.000834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:57:43.000834Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05155","last_updated":"2026-07-06T14:39:22Z","snapshot_observed_at":"2026-08-16T06:48:52.700573Z","submitted_at":"2026-07-06T14:39:22Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-07-11T07:57:43.000834Z"},"links":{"citing_paper":"/paper/2607.05155"},"observation_digest":"sha256:7f07935bc3ea4cdacd65bb925c57f54d2e0c3fb1b70c5cf6e30e9a21afea48db","observation_id":"b30b25d8-f8f9-442b-9c10-ab5aff42b72b","resolution":{"observed_at":"2026-07-11T07:57:43.000834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:57:43.000834Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05155","last_updated":"2026-07-06T14:39:22Z","snapshot_observed_at":"2026-08-16T06:48:52.700573Z","submitted_at":"2026-07-06T14:39:22Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-07-11T07:57:43.000834Z"},"links":{"citing_paper":"/paper/2607.05155"},"observation_digest":"sha256:95667b630f8ac9ad9f89e09f6970be1d9a20ba2719e94e7993f85541fcc3c920","observation_id":"2d9bd9f2-87a3-4a43-863b-97f3b7a59aea","resolution":{"observed_at":"2026-07-11T07:57:43.000834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:57:43.000834Z","title":"Throughout the section, we denote raw interaction time byt > 0, and the raw task/benchmark score byS(t)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05155","last_updated":"2026-07-06T14:39:22Z","snapshot_observed_at":"2026-08-16T06:48:52.700573Z","submitted_at":"2026-07-06T14:39:22Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-07-11T07:57:43.000834Z"},"links":{"citing_paper":"/paper/2607.05155"},"observation_digest":"sha256:fde73b77bd206438224f450960e2b1ea084c5453fd3b0e111144ff6109bbcfd5","observation_id":"17b0d53d-3e14-4212-9ece-320167a3b5c4","resolution":{"observed_at":"2026-07-11T07:57:43.000834Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.05155","last_updated":"2026-07-06T14:39:22Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-16T06:48:52.700573Z","submitted_at":"2026-07-06T14:39:22Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments"},"reference_resolution":{"displayed":87,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":86,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":87},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 87 of 87 outbound references and 5 inbound Pith citation observations for arXiv:2607.05155."}