{"as_of":"2026-08-07T09:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9940cb27c6e1d951acc8d194c788b426ba61264e0db444ec232aff7d2027b850","coverage":[{"denominator":162,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:42:36.609859Z","state":"measured"},{"denominator":116,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":116,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":16,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":16,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T10:08:58.164654Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"cited_work":{"arxiv_id":"2507.02092","doi":"10.48550/arxiv.2507.02092","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02092","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Energy-Based Transformers Are Scalable Learners and Thinkers","venue":"arXiv (Cornell University)","work_id":"72754646-43de-4211-bfba-3a9a06d897cf","year":2025},"citing_paper":{"arxiv_id":"2412.06769","last_updated":"2025-11-03T00:53:34Z","snapshot_observed_at":"2026-08-07T06:05:27.895209Z","submitted_at":"2024-12-09T18:55:56Z","title":"Training Large Language Models to Reason in a Continuous Latent Space","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-11T10:29:05.384381Z"},"links":{"cited_paper":"/paper/2507.02092","citing_paper":"/paper/2412.06769"},"observation_digest":"sha256:19d93116de95bbdc08dcfe828ead9c69e83161653536debaaab8cf1895300cb6","observation_id":"0ba7fdcc-f59d-47c7-a16e-c00c92b7d1a4","resolution":{"observed_at":"2026-05-11T10:29:05.656955Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"cited_work":{"arxiv_id":"2507.02092","doi":"10.48550/arxiv.2507.02092","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02092","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Energy-Based Transformers Are Scalable Learners and Thinkers","venue":"arXiv (Cornell University)","work_id":"72754646-43de-4211-bfba-3a9a06d897cf","year":2025},"citing_paper":{"arxiv_id":"2503.09567","last_updated":"2025-07-18T15:57:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-12T17:35:03Z","title":"Towards Reasoning Era: A Survey of Long Chain-of-Thought for Reasoning Large Language Models","version":5},"reference_index":212,"source":"pdf_text","source_observed_at":"2026-05-12T08:40:40.910461Z"},"links":{"cited_paper":"/paper/2507.02092","citing_paper":"/paper/2503.09567"},"observation_digest":"sha256:8146b098e0bd766c9da2f6814120257527885ee87b97e45877f0a9271f0d7b04","observation_id":"0648a563-5a42-4c15-80e8-df5163347832","resolution":{"observed_at":"2026-05-12T08:41:23.588094Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02092","snapshot_observed_at":"2026-08-04T10:08:58.164654Z","title":"M., Han, P., Ha, H., Chadha, A., Du, Y., Ji, H., Li, J., and Iqbal, T","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.12311","last_updated":"2026-07-14T09:30:27Z","snapshot_observed_at":"2026-08-06T13:35:29.900046Z","submitted_at":"2025-10-14T09:10:37Z","title":"Learning Latent Energy-Based Models via Interacting Particle Langevin Dynamics","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-04T10:08:58.164654Z"},"links":{"cited_paper":"/paper/2507.02092","citing_paper":"/paper/2510.12311"},"observation_digest":"sha256:5b1df3cbfb206fd31a7dca3d2b2f8c26c9f299abcc35aab4ba920a843133f14b","observation_id":"28496935-a384-4c24-94e6-9eb48389bb1d","resolution":{"observed_at":"2026-08-04T10:08:58.164654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"cited_work":{"arxiv_id":"2507.02092","doi":"10.48550/arxiv.2507.02092","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02092","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Energy-Based Transformers Are Scalable Learners and Thinkers","venue":"arXiv (Cornell University)","work_id":"72754646-43de-4211-bfba-3a9a06d897cf","year":2025},"citing_paper":{"arxiv_id":"2602.01651","last_updated":"2026-04-21T07:48:12Z","snapshot_observed_at":"2026-07-06T22:44:04.951815Z","submitted_at":"2026-02-02T05:11:48Z","title":"On the Spatiotemporal Dynamics of Generalization in Neural Networks","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-16T08:59:44.016444Z"},"links":{"cited_paper":"/paper/2507.02092","citing_paper":"/paper/2602.01651"},"observation_digest":"sha256:b5549a262fe9379a49ab0ce7a40b751aed2f8db82088dedf2574b4baf77ab6d8","observation_id":"4be6f3f6-eff6-42f3-bdc0-db59cd6df58f","resolution":{"observed_at":"2026-05-16T09:00:46.792385Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"cited_work":{"arxiv_id":"2507.02092","doi":"10.48550/arxiv.2507.02092","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02092","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Energy-Based Transformers Are Scalable Learners and Thinkers","venue":"arXiv (Cornell University)","work_id":"72754646-43de-4211-bfba-3a9a06d897cf","year":2025},"citing_paper":{"arxiv_id":"2604.03878","last_updated":"2026-04-04T22:10:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-04T22:10:28Z","title":"Learning 3D Reconstruction with Priors in Test Time","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-13T16:47:26.453813Z"},"links":{"cited_paper":"/paper/2507.02092","citing_paper":"/paper/2604.03878"},"observation_digest":"sha256:a6f62b692bb7042da9966ee55f82d744e5c77db42ed5db6c14f711aa1931660f","observation_id":"9014ed6e-12bd-4040-b93e-37d2bb28be88","resolution":{"observed_at":"2026-05-13T16:48:02.686503Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"cited_work":{"arxiv_id":"2507.02092","doi":"10.48550/arxiv.2507.02092","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02092","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Energy-Based Transformers Are Scalable Learners and Thinkers","venue":"arXiv (Cornell University)","work_id":"72754646-43de-4211-bfba-3a9a06d897cf","year":2025},"citing_paper":{"arxiv_id":"2604.10272","last_updated":"2026-04-11T16:28:27Z","snapshot_observed_at":"2026-07-06T22:58:56.307161Z","submitted_at":"2026-04-11T16:28:27Z","title":"The Phase Is the Gradient: Equilibrium Propagation for Frequency Learning in Kuramoto Networks","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-10T15:52:13.956464Z"},"links":{"cited_paper":"/paper/2507.02092","citing_paper":"/paper/2604.10272"},"observation_digest":"sha256:43ca9bddd9bc71bab56907821738d2127a9a50b4984b99eb241e4d27f7761442","observation_id":"5c92e538-13c6-42d1-9211-fba34e7489fb","resolution":{"observed_at":"2026-05-11T09:41:04.744352Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"cited_work":{"arxiv_id":"2507.02092","doi":"10.48550/arxiv.2507.02092","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02092","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Energy-Based Transformers Are Scalable Learners and Thinkers","venue":"arXiv (Cornell University)","work_id":"72754646-43de-4211-bfba-3a9a06d897cf","year":2025},"citing_paper":{"arxiv_id":"2604.11403","last_updated":"2026-04-13T12:44:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-13T12:44:04Z","title":"One Scale at a Time: Scale-Autoregressive Modeling for Fluid Flow Distributions","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T16:07:37.663509Z"},"links":{"cited_paper":"/paper/2507.02092","citing_paper":"/paper/2604.11403"},"observation_digest":"sha256:c7cf88fe6444c2417d4e1f9bbc2741af4e756a492bc95f6e8ca354824fd0e3ec","observation_id":"fe2c7e4a-a4da-4a05-a8b9-69ff96f2c005","resolution":{"observed_at":"2026-05-11T09:16:03.648656Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"cited_work":{"arxiv_id":"2507.02092","doi":"10.48550/arxiv.2507.02092","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02092","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Energy-Based Transformers Are Scalable Learners and Thinkers","venue":"arXiv (Cornell University)","work_id":"72754646-43de-4211-bfba-3a9a06d897cf","year":2025},"citing_paper":{"arxiv_id":"2604.13521","last_updated":"2026-04-15T06:10:12Z","snapshot_observed_at":"2026-07-30T06:08:24.697906Z","submitted_at":"2026-04-15T06:10:12Z","title":"C-voting: Confidence-Based Test-Time Voting without Explicit Energy Functions","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T13:02:52.920735Z"},"links":{"cited_paper":"/paper/2507.02092","citing_paper":"/paper/2604.13521"},"observation_digest":"sha256:c879d302b25951e3ec0d13a8efcebdbe6fce7caf72f017186625b05158452c88","observation_id":"5a60daec-fd0f-471e-9123-40ac7c32f1fa","resolution":{"observed_at":"2026-05-10T13:05:24.967018Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"cited_work":{"arxiv_id":"2507.02092","doi":"10.48550/arxiv.2507.02092","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02092","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Energy-Based Transformers Are Scalable Learners and Thinkers","venue":"arXiv (Cornell University)","work_id":"72754646-43de-4211-bfba-3a9a06d897cf","year":2025},"citing_paper":{"arxiv_id":"2605.07588","last_updated":"2026-05-08T11:02:11Z","snapshot_observed_at":"2026-07-06T23:19:56.415523Z","submitted_at":"2026-05-08T11:02:11Z","title":"Revisiting Transformer Layer Parameterization Through Causal Energy Minimization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-11T02:17:32.226166Z"},"links":{"cited_paper":"/paper/2507.02092","citing_paper":"/paper/2605.07588"},"observation_digest":"sha256:eba719317c8bbb129bdcd060eecc44d089be7f42acb9395b1938ef483a16cc46","observation_id":"1748119f-8f81-415d-8d7d-1ffd7fa5b459","resolution":{"observed_at":"2026-05-11T03:45:59.049118Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"cited_work":{"arxiv_id":"2507.02092","doi":"10.48550/arxiv.2507.02092","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02092","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Energy-Based Transformers Are Scalable Learners and Thinkers","venue":"arXiv (Cornell University)","work_id":"72754646-43de-4211-bfba-3a9a06d897cf","year":2025},"citing_paper":{"arxiv_id":"2606.18206","last_updated":"2026-06-16T17:36:33Z","snapshot_observed_at":"2026-08-02T16:48:27.851712Z","submitted_at":"2026-06-16T17:36:33Z","title":"Fixed-Point Reasoners: Stable and Adaptive Deep Looped Transformers","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-06-27T00:38:47.350106Z"},"links":{"cited_paper":"/paper/2507.02092","citing_paper":"/paper/2606.18206"},"observation_digest":"sha256:4ba1ffcad81527a877df91e576ad6222f5ff95a4ba36a908fd0faae526ae0e9c","observation_id":"19f380de-6671-4109-b2b7-cb06c4cb57a5","resolution":{"observed_at":"2026-06-27T00:40:17.960298Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"cited_work":{"arxiv_id":"2507.02092","doi":"10.48550/arxiv.2507.02092","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02092","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Energy-Based Transformers Are Scalable Learners and Thinkers","venue":"arXiv (Cornell University)","work_id":"72754646-43de-4211-bfba-3a9a06d897cf","year":2025},"citing_paper":{"arxiv_id":"2606.22726","last_updated":"2026-07-03T01:47:59Z","snapshot_observed_at":"2026-08-01T06:55:05.207715Z","submitted_at":"2026-06-22T00:01:05Z","title":"Text Dictates, Music Decorates: Energy-based Attention for Editable Dance Motion Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-26T09:15:27.661551Z"},"links":{"cited_paper":"/paper/2507.02092","citing_paper":"/paper/2606.22726"},"observation_digest":"sha256:5b5b5ae866b2ef4c4b6a79aac38357d8d1ad6672668ace7985074fbeab7790ab","observation_id":"3f8f7420-ec3a-4383-9ddb-7bc804697144","resolution":{"observed_at":"2026-06-26T09:19:16.020819Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02092","snapshot_observed_at":"2026-07-12T12:50:56.152971Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.22726","last_updated":"2026-07-03T01:47:59Z","snapshot_observed_at":"2026-08-01T06:55:05.207715Z","submitted_at":"2026-06-22T00:01:05Z","title":"Text Dictates, Music Decorates: Energy-based Attention for Editable Dance Motion Generation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-12T12:50:56.152971Z"},"links":{"cited_paper":"/paper/2507.02092","citing_paper":"/paper/2606.22726"},"observation_digest":"sha256:8ab59a1d26a1e34b3816678f1fed685555aab7479cd630b853550d2d4c73ad81","observation_id":"45e7168a-fde8-4723-aed8-7fc9a26ed397","resolution":{"observed_at":"2026-07-12T12:50:56.152971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02092","snapshot_observed_at":"2026-07-14T04:48:14.980753Z","title":"arXiv preprint arXiv:2507.02092 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11555","last_updated":"2026-07-13T13:37:47Z","snapshot_observed_at":"2026-07-16T23:19:52.705875Z","submitted_at":"2026-07-13T13:37:47Z","title":"Advancing Optimal Subset Oracle via Learning Relaxation of Neural Set Functions","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-07-14T04:48:14.980753Z"},"links":{"cited_paper":"/paper/2507.02092","citing_paper":"/paper/2607.11555"},"observation_digest":"sha256:9122a2055fbc581c034f5b293e61afc418883fac7340e225dc454c414705da77","observation_id":"630e150a-c971-4459-ba78-25a923b25ffa","resolution":{"observed_at":"2026-07-14T04:48:14.980753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02092","snapshot_observed_at":"2026-08-01T19:14:27.667342Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17047","last_updated":"2026-07-19T03:23:22Z","snapshot_observed_at":"2026-08-06T16:57:47.420938Z","submitted_at":"2026-07-19T03:23:22Z","title":"Solver-Hard Is Not Model-Hard: A Hardness-Controlled Diagnostic for LLM Constraint Reasoning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-01T19:14:27.667342Z"},"links":{"cited_paper":"/paper/2507.02092","citing_paper":"/paper/2607.17047"},"observation_digest":"sha256:b18ae60dc0a06747313277b40c997c37e05d14f2ba10e478f0722bad26c2fd83","observation_id":"1166e9f6-b53f-4b3c-b3fe-9293d38094c5","resolution":{"observed_at":"2026-08-01T19:14:27.667342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02092","snapshot_observed_at":"2026-08-01T09:25:23.671177Z","title":"Energy-Based Transformers Are Scalable Learners and Thinkers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20792","last_updated":"2026-07-22T23:34:56Z","snapshot_observed_at":"2026-08-03T08:26:10.984255Z","submitted_at":"2026-07-22T23:34:56Z","title":"Memoir: Should a Model Write to Its Memory While It Thinks?","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T09:25:23.671177Z"},"links":{"cited_paper":"/paper/2507.02092","citing_paper":"/paper/2607.20792"},"observation_digest":"sha256:137895434c9cc5d60515994b8af01db772f43ff9ac5c7df1bb3500c4e71e2853","observation_id":"7bbbeb4b-a6dd-464f-9e4c-f617d887e72d","resolution":{"observed_at":"2026-08-01T09:25:23.671177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02092","snapshot_observed_at":"2026-08-01T08:41:08.641850Z","title":"Energy-based transformers are scalable learners and thinkers.arXiv preprint arXiv:2507.02092, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27372","last_updated":"2026-07-29T18:25:17Z","snapshot_observed_at":"2026-08-06T07:15:21.538996Z","submitted_at":"2026-07-29T18:25:17Z","title":"Explorative Modeling: Unlocking a Third Pretraining Axis and End-to-End Generation","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-01T08:41:08.641850Z"},"links":{"cited_paper":"/paper/2507.02092","citing_paper":"/paper/2607.27372"},"observation_digest":"sha256:a13d1a1869ace6ffd10d96854a117077a6327ff74161f74c6e807346f95ef766","observation_id":"450f36dc-7179-4144-a485-09f06cb68896","resolution":{"observed_at":"2026-08-01T08:41:08.641850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.02092/citation-record","integrity":"/paper/2507.02092/integrity","json":"/paper/2507.02092/citation-record.json","paper":"/paper/2507.02092"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:27.039207Z","title":"Thinking, fast and slow","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:27.039207Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:6295ed905376ed2c83e7b0a7fd5df210824259ef22ae1b5f90331852d14f44eb","observation_id":"d6ddae26-85e1-45a8-a31d-ab70cbda7460","resolution":{"observed_at":"2026-08-06T20:42:27.039207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:27.107408Z","title":"Dual-process theories of reasoning: Contemporary issues and developmental applications","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:27.107408Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:5c7a0819769b5eb16f948a613ce7e0fd2567e21d2df69170595436c4a77180e4","observation_id":"b1453c70-fcab-479b-822a-ac4c623d20f9","resolution":{"observed_at":"2026-08-06T20:42:27.107408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:27.185821Z","title":"Representativeness revisited: Attribute substitution in intuitive judgment","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:27.185821Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:98bc005d58d75c3079334378a46630984ccbe622d913546fd577d82d32c86d5e","observation_id":"b60f4321-59fc-4c6f-9316-13fd6baa9661","resolution":{"observed_at":"2026-08-06T20:42:27.185821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:27.250112Z","title":"Dual-process and dual-system theories of reasoning","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:27.250112Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:235b356687c4b362057ca476c7fbe0b8bc20ebef4923ce6c620ba7afbab87fb8","observation_id":"b5aeefc7-b287-49fc-a6ac-979637e310e5","resolution":{"observed_at":"2026-08-06T20:42:27.250112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:27.303729Z","title":"Dual processing in reasoning: Two systems but one reasoner","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:27.303729Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:64008dd6a12337d3e988a3b8076aa369de0c70d5e3c1c3c45965403a0a28a7d0","observation_id":"35bc9d69-a7a2-45a2-88d1-8b6b1ae5938e","resolution":{"observed_at":"2026-08-06T20:42:27.303729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:27.364622Z","title":"Dissociation of mechanisms underlying syllogistic reasoning","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:27.364622Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:2c51fd9a026a5a4b813f2c0657c5afd7a78bf15c3ead53f9257308bb4ce4ad1f","observation_id":"76480e4e-74f9-44ff-aaef-25c67fae60b6","resolution":{"observed_at":"2026-08-06T20:42:27.364622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17419","last_updated":"2025-06-25T02:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-24T18:50:52Z","title":"From System 1 to System 2: A Survey of Reasoning Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.17419","snapshot_observed_at":"2026-08-06T20:42:27.410182Z","title":"From system 1 to system 2: A survey of reasoning large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:27.410182Z"},"links":{"cited_paper":"/paper/2502.17419","citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:cd5bdd4a0a8c935af6e69d2560e5278320a44534204c13c01f7faef7ebdf05ac","observation_id":"05834008-db06-413a-b1a6-563d060e2195","resolution":{"observed_at":"2026-08-06T20:42:27.410182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05229","last_updated":"2025-08-27T16:24:39Z","snapshot_observed_at":"2026-07-06T19:29:09.714725Z","submitted_at":"2024-10-07T17:36:37Z","title":"GSM-Symbolic: Understanding the Limitations of Mathematical Reasoning in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05229","snapshot_observed_at":"2026-08-06T20:42:27.462852Z","title":"Gsm-symbolic: Understanding the limitations of mathematical reasoning in large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:27.462852Z"},"links":{"cited_paper":"/paper/2410.05229","citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:dabfc5f24959e8952ad473b4b9c9dadd917ba91312e1c96814956d3e82a8ed2b","observation_id":"35cc0f0b-e247-4a74-bb70-2baa797c3e60","resolution":{"observed_at":"2026-08-06T20:42:27.462852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:27.513128Z","title":"Do phd-level llms truly grasp elementary addition? probing rule learning vs","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:27.513128Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:2bcf6e1fd8bb1a08579cafb34fb6a3f581cb7b3504a164e61bb783e94ed9365c","observation_id":"d3ed8ee4-10d9-4047-9082-5244128443f6","resolution":{"observed_at":"2026-08-06T20:42:27.513128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:27.580140Z","title":"Escapebench: Pushing language models to think outside the box","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:27.580140Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:b706acf376af4982305241408e6874b6bc79599fa3551277d88975a91ba23973","observation_id":"2edaf2a4-53b2-47b2-b5fb-0b45c014e114","resolution":{"observed_at":"2026-08-06T20:42:27.580140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-06T20:42:27.652721Z","title":"Openai o1 system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:27.652721Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:2e68cf2dda28c5446dc7b7a46f05ce7353fb431e5ccfbe89658c91a9df9dd296","observation_id":"91e63716-8981-42d4-8ae5-fa0034279328","resolution":{"observed_at":"2026-08-06T20:42:27.652721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T20:42:27.723801Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:27.723801Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:3c927854c0b53e5fc8533cf61bf0345639ebed1ff1cecc8457fc749c7d923ee7","observation_id":"d7467f5c-04d2-4cd4-a016-b551e3c2eba1","resolution":{"observed_at":"2026-08-06T20:42:27.723801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:27.734421Z","title":"Grok 3 Beta — The Age of Reasoning Agents, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:27.734421Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:7509c462ebd04e71bc48676ab3b9c60c7c7dcdeb9689ea4b3908515dffa8427f","observation_id":"039ba5e4-fad0-4346-bc5a-b5dd8c004988","resolution":{"observed_at":"2026-08-06T20:42:27.734421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:27.812198Z","title":"Claude 3.7 sonnet and claude code, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:27.812198Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:33a38b227c91553b5c5fb65ac77c724b63a4c76cbc4e87635e2466d95874f6e7","observation_id":"934436d7-d49b-4e8f-8289-dc7c202f14dd","resolution":{"observed_at":"2026-08-06T20:42:27.812198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:27.954135Z","title":"Learning to reason with llms, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:27.954135Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:176b2a6641702ee3bd25cc535d6b1e91a7d5453f47ad68421066032dcff65775","observation_id":"40ef9616-cfc2-4240-8f4b-9a1f9b82501a","resolution":{"observed_at":"2026-08-06T20:42:27.954135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23829","last_updated":"2025-04-01T14:48:02Z","snapshot_observed_at":"2026-07-06T21:01:17.931818Z","submitted_at":"2025-03-31T08:22:49Z","title":"Crossing the Reward Bridge: Expanding RL with Verifiable Rewards Across Diverse Domains","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23829","snapshot_observed_at":"2026-08-06T20:42:28.038550Z","title":"Expanding rl with verifiable rewards across diverse domains","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:28.038550Z"},"links":{"cited_paper":"/paper/2503.23829","citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:04491b448bb2164d05b5af226286cd52dfa989cca48cb68f8d6f83127f0c4ffe","observation_id":"65d37c96-ba03-4096-9c57-857ff75d8237","resolution":{"observed_at":"2026-08-06T20:42:28.038550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:28.130559Z","title":"The illusion of thinking: Understanding the strengths and limitations of reasoning mod- els via the lens of problem complexity, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:28.130559Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:dd98411af49c59f3df780a4c484991a4de7a987e2e2057f9f5b6b4f1d88674bc","observation_id":"24d9c52c-a75b-408b-b1c8-26358dfca628","resolution":{"observed_at":"2026-08-06T20:42:28.130559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13837","last_updated":"2025-11-24T06:11:04Z","snapshot_observed_at":"2026-07-06T21:11:34.701779Z","submitted_at":"2025-04-18T17:59:56Z","title":"Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13837","snapshot_observed_at":"2026-08-06T20:42:28.214770Z","title":"Does reinforcement learning really incentivize reasoning capacity in llms beyond the base model? arXiv preprint arXiv:2504.13837, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:28.214770Z"},"links":{"cited_paper":"/paper/2504.13837","citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:768d66c3f83f18e004087507d09f53e4ac8743b574e55f3e0f39b68ba0815329","observation_id":"0f637e03-8084-4a6d-a282-e8a2af4ee97d","resolution":{"observed_at":"2026-08-06T20:42:28.214770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09732","last_updated":"2025-01-16T18:30:37Z","snapshot_observed_at":"2026-07-06T20:22:04.328179Z","submitted_at":"2025-01-16T18:30:37Z","title":"Inference-Time Scaling for Diffusion Models beyond Scaling Denoising Steps","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09732","snapshot_observed_at":"2026-08-06T20:42:28.340670Z","title":"Inference-time scaling for diffusion models beyond scaling denoising steps","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:28.340670Z"},"links":{"cited_paper":"/paper/2501.09732","citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:09fc7b1662f27e0f181812ef69e6a077aa863544c9577840bb15b544b925e13b","observation_id":"62b2b6d2-ff92-4c36-a31b-6a7c366b54af","resolution":{"observed_at":"2026-08-06T20:42:28.340670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18942","last_updated":"2025-04-01T06:52:58Z","snapshot_observed_at":"2026-07-06T20:57:57.039376Z","submitted_at":"2025-03-24T17:59:04Z","title":"Video-T1: Test-Time Scaling for Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18942","snapshot_observed_at":"2026-08-06T20:42:28.447718Z","title":"Video-t1: Test-time scaling for video generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:28.447718Z"},"links":{"cited_paper":"/paper/2503.18942","citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:8397969fecb4119118856d2a6f4cc88f9a27be25ee41ff9c3035a1967951285b","observation_id":"48e8a96d-48e6-467c-901e-9549f323f18b","resolution":{"observed_at":"2026-08-06T20:42:28.447718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06848","last_updated":"2025-07-18T17:52:45Z","snapshot_observed_at":"2026-07-06T20:19:55.486841Z","submitted_at":"2025-01-12T15:34:24Z","title":"A General Framework for Inference-time Scaling and Steering of Diffusion Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.06848","snapshot_observed_at":"2026-08-06T20:42:28.538064Z","title":"A general framework for inference-time scaling and steering of diffusion models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:28.538064Z"},"links":{"cited_paper":"/paper/2501.06848","citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:56a083ef3706dc1e70aff0a7a29e8f3dda3fe7bbfd2f6a48d1e8a69ae89499ec","observation_id":"4dcbc952-9f12-4832-b1b5-fc6ecd25ff0a","resolution":{"observed_at":"2026-08-06T20:42:28.538064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-08-06T20:42:28.597176Z","title":"Mamba: Linear-time sequence modeling with selective state spaces","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:28.597176Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:bcad865ec0137af9a869d446712e189069e013d3db2222b14b5e3adae53a0d04","observation_id":"0449bfe8-5100-4ffb-99ed-9058bf6d5c48","resolution":{"observed_at":"2026-08-06T20:42:28.597176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13048","last_updated":"2023-12-11T03:58:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-22T13:57:41Z","title":"RWKV: Reinventing RNNs for the Transformer Era","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13048","snapshot_observed_at":"2026-08-06T20:42:28.721324Z","title":"Rwkv: Reinventing rnns for the transformer era","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:28.721324Z"},"links":{"cited_paper":"/paper/2305.13048","citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:4e0e89d05ca4fee328b030aeee2b982db1a88041c1f7cee6d215d8a2e9014474","observation_id":"3f3aeeba-ce7d-44b5-bcd3-3fdd8d27b453","resolution":{"observed_at":"2026-08-06T20:42:28.721324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:28.816423Z","title":"Long short-term memory","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:28.816423Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:cba13e85384631ef477892eadf389ba13bae421d4e1f868ad9de7ba1f402e615","observation_id":"60208d23-2788-4eda-94c6-d179f4583dfc","resolution":{"observed_at":"2026-08-06T20:42:28.816423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05171","last_updated":"2025-02-17T17:14:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-07T18:55:02Z","title":"Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05171","snapshot_observed_at":"2026-08-06T20:42:28.965416Z","title":"Scaling up test-time compute with latent reasoning: A recurrent depth approach","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:28.965416Z"},"links":{"cited_paper":"/paper/2502.05171","citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:1580616f96c912e4f0a8390d17b767addbeae51b7df456a29ef00cd091a18fd0","observation_id":"8db74f51-d0f9-415f-8686-321fa13d90ac","resolution":{"observed_at":"2026-08-06T20:42:28.965416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:29.094229Z","title":"Scalable diffusion models with transformers, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:29.094229Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:400378cfa23851daaea28ca8fae9bb570f6326827e8a5934e36b940cbbcc29ec","observation_id":"821711fb-2b6e-4474-aaf0-456b8dc40613","resolution":{"observed_at":"2026-08-06T20:42:29.094229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:29.227404Z","title":"Autoregressive image generation without vector quantization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:29.227404Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:4a3faf89727874e07152cd3fe1f1f723debf10a2199b7ab8e6e8b10957d2a763","observation_id":"22cf1455-e1b8-484d-875c-c7b460747ff8","resolution":{"observed_at":"2026-08-06T20:42:29.227404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.12095","last_updated":"2024-12-17T18:45:55Z","snapshot_observed_at":"2026-07-06T20:07:58.873037Z","submitted_at":"2024-12-16T18:59:29Z","title":"Causal Diffusion Transformers for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.12095","snapshot_observed_at":"2026-08-06T20:42:29.386292Z","title":"Causal diffusion transformers for generative modeling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:29.386292Z"},"links":{"cited_paper":"/paper/2412.12095","citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:b7cbf1800b3dddda7e8d0cfcd861b537175291af4f8f5549ce6bcb89ebbcb834","observation_id":"ec097216-2934-4642-abf3-ae3bc4d81e8d","resolution":{"observed_at":"2026-08-06T20:42:29.386292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06769","last_updated":"2025-11-03T00:53:34Z","snapshot_observed_at":"2026-08-07T06:05:27.895209Z","submitted_at":"2024-12-09T18:55:56Z","title":"Training Large Language Models to Reason in a Continuous Latent Space","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06769","snapshot_observed_at":"2026-08-06T20:42:29.538887Z","title":"Training large language models to reason in a continuous latent space","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:29.538887Z"},"links":{"cited_paper":"/paper/2412.06769","citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:683fb99032753f9d61f6a72613d15a21e21272498ada6c9f4741a0d08fb84e2b","observation_id":"b01f2972-59a6-43aa-968a-07d43b819ae4","resolution":{"observed_at":"2026-08-06T20:42:29.538887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02226","last_updated":"2024-04-21T03:39:21Z","snapshot_observed_at":"2026-08-06T21:01:03.193755Z","submitted_at":"2023-10-03T17:32:41Z","title":"Think before you speak: Training Language Models With Pause Tokens","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02226","snapshot_observed_at":"2026-08-06T20:42:29.670598Z","title":"Think before you speak: Training language models with pause tokens","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:29.670598Z"},"links":{"cited_paper":"/paper/2310.02226","citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:eb2fb0734c29ffb8de60c7137be8cb569dec17fea7988d4622f79bc6f6f965d9","observation_id":"7a678ad2-fe4c-488a-b99d-81b9d4b172fe","resolution":{"observed_at":"2026-08-06T20:42:29.670598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:29.797715Z","title":"Evidence for time-variant decision making","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:29.797715Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:cd53fee11904c150af413c1f07e9b90d5e5a03d0488ef978926fc4274bff62aa","observation_id":"15d0e0ca-f202-42bc-b290-4bc665fefd9d","resolution":{"observed_at":"2026-08-06T20:42:29.797715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:29.919700Z","title":"Prefrontal cortex and flexible cognitive control: Rules without symbols","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:29.919700Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:b8b24e579877b700454795644c1cd109ea4b1d086ca88fc0e9db468aca59a395","observation_id":"8d6be292-0fc9-465b-ba60-3ecf9f9667a9","resolution":{"observed_at":"2026-08-06T20:42:29.919700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10960","last_updated":"2024-04-16T23:56:38Z","snapshot_observed_at":"2026-07-06T18:01:14.416754Z","submitted_at":"2024-04-16T23:56:38Z","title":"Uncertainty-Based Abstention in LLMs Improves Safety and Reduces Hallucinations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.10960","snapshot_observed_at":"2026-08-06T20:42:30.055872Z","title":"Uncertainty- based abstention in llms improves safety and reduces hallucinations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:30.055872Z"},"links":{"cited_paper":"/paper/2404.10960","citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:7a4644a224ea7e786d932a4aa2f016801a25ba61e86a55f6c437066795da9b63","observation_id":"2e3591c7-924f-46cb-913b-3e4fa597143b","resolution":{"observed_at":"2026-08-06T20:42:30.055872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:30.175475Z","title":"Neural discrete representation learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:30.175475Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:7d61c3a0ae5d060593fb77c1c607750fa61993cea225e85375c3ad7f34eefcc9","observation_id":"e1ff8271-ec26-4588-8534-ff370e49e04e","resolution":{"observed_at":"2026-08-06T20:42:30.175475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:30.313122Z","title":"Auto-encoding variational bayes, 2013","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:30.313122Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:3da2b2b8941cb13afea7582a624a876b085e3fde344d3ddc9e5d0ea2f98c36fc","observation_id":"aad8e0f7-c227-4c04-bef2-4bf10e169e3a","resolution":{"observed_at":"2026-08-06T20:42:30.313122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.00826","last_updated":"2022-06-02T01:54:58Z","snapshot_observed_at":"2026-08-05T23:54:54.292058Z","submitted_at":"2022-06-02T01:54:58Z","title":"BayesFormer: Transformer with Uncertainty Estimation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.00826","snapshot_observed_at":"2026-08-06T20:42:30.473303Z","title":"Bayesformer: Transformer with uncertainty estimation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:30.473303Z"},"links":{"cited_paper":"/paper/2206.00826","citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:389e93acec92de5709a62d3187fdb70eb6371b67966157a0e10b19388da74bd9","observation_id":"e9a59b09-e2c4-44b6-b889-5a11f9de70cc","resolution":{"observed_at":"2026-08-06T20:42:30.473303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:30.591803Z","title":"Out-of-distribution detection with a single unconditional diffusion model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:30.591803Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:9cbed5c50b9525494eab2e8b8d945f29ecb15b16d6156f639f82acd584272eeb","observation_id":"31ef411d-9503-423d-a5eb-961b7665c9c8","resolution":{"observed_at":"2026-08-06T20:42:30.591803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.09136","last_updated":"2019-02-24T11:57:32Z","snapshot_observed_at":"2026-07-06T07:09:43.264415Z","submitted_at":"2018-10-22T08:32:02Z","title":"Do Deep Generative Models Know What They Don't Know?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.09136","snapshot_observed_at":"2026-08-06T20:42:30.700978Z","title":"Do deep generative models know what they don’t know? arXiv preprint arXiv:1810.09136, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:30.700978Z"},"links":{"cited_paper":"/paper/1810.09136","citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:0821cf202c4ab5a3f363c54bec3c27d36b80a613996ba9250f9660329e7bc8e2","observation_id":"a7c3f0f2-7e51-4ea8-af56-bd5f6bc055fe","resolution":{"observed_at":"2026-08-06T20:42:30.700978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.11480","last_updated":"2020-01-17T10:38:05Z","snapshot_observed_at":"2026-08-04T17:57:20.973568Z","submitted_at":"2019-09-25T13:27:53Z","title":"Input complexity and out-of-distribution detection with likelihood-based generative models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.11480","snapshot_observed_at":"2026-08-06T20:42:30.846893Z","title":"Input complexity and out-of-distribution detection with likelihood-based generative models","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:30.846893Z"},"links":{"cited_paper":"/paper/1909.11480","citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:c58c743ac45935a786343a09d24cf53313421f41179b4d1a896d7246cb345c48","observation_id":"de949469-b5b3-4c4c-a767-486f001a9222","resolution":{"observed_at":"2026-08-06T20:42:30.846893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:30.930035Z","title":"Mixture density networks","venue":null,"work_id":null,"year":1994},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:30.930035Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:da3415d9f54c6c630560cf863e1ffe1ab08392f36a4691d130306dcdda41e5e5","observation_id":"b8357fc2-8119-493a-94dc-c4f3103fb35b","resolution":{"observed_at":"2026-08-06T20:42:30.930035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.13456","last_updated":"2021-02-10T18:17:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-11-26T19:39:10Z","title":"Score-Based Generative Modeling through Stochastic Differential Equations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.13456","snapshot_observed_at":"2026-08-06T20:42:31.046071Z","title":"Score-based generative modeling through stochastic differential equations","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:31.046071Z"},"links":{"cited_paper":"/paper/2011.13456","citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:7269fba3c7672bdd7e2724ceff87710b3c9fdadd4ea7590ddb51d07f46aea66d","observation_id":"54cc5f5c-87b2-4894-a343-a916717a0b4b","resolution":{"observed_at":"2026-08-06T20:42:31.046071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:31.238098Z","title":"Introduction to latent variable energy-based models: a path toward autonomous machine intelligence","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:31.238098Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:f970f883fcc9f9721ef8ba23619becc7c2039d848f1e2db897e6eb473996c398","observation_id":"765bd168-eb1c-4b83-8087-aaf1581cbf03","resolution":{"observed_at":"2026-08-06T20:42:31.238098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/j.pneurobio.2017.05","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:41.806463Z","title":"Peters, B","venue":null,"work_id":"adf870f7-8b00-4acf-a711-4fc747fd3e21","year":2017},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:31.345522Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:1c75983cd7cf798ddda55c2e43de4d3dd2f0958b87d46850b2e8d7f866c28d2b","observation_id":"7b6c72d8-5eb0-4327-bf6c-6e904d4c92db","resolution":{"observed_at":"2026-08-06T20:42:41.901900Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:31.442170Z","title":"Vilares, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:31.442170Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:020bf05170645480798acb4622c9d5041456fc70d390ede26012c6398c68d05b","observation_id":"c16a1053-0ad7-4701-9d37-da136aa84d2f","resolution":{"observed_at":"2026-08-06T20:42:31.442170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1093/cercor/bhp155","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:41.525591Z","title":"Sarinopoulos, D","venue":null,"work_id":"2e93682d-e7c1-4ac6-854e-582d34860126","year":2010},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:31.750808Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:5ce100662106b867d6fc787e864b3ce477108ebabe811b5519a2060c2ccf6291","observation_id":"e6bb566b-dadb-4c0e-9b72-0076d5a63fd9","resolution":{"observed_at":"2026-08-06T20:42:41.580639Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:31.909144Z","title":"Paving the way to eureka—introducing “dira” as an experimental paradigm to observe the process of creative problem solving","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:31.909144Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:bec12ea303f9c20a932e33c4f36e865c45b8b3213619a71169cf52d58da11fa5","observation_id":"31974327-9901-45e0-8bb7-a3612916761e","resolution":{"observed_at":"2026-08-06T20:42:31.909144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:32.050358Z","title":"Using contents and containers to investigate problem solving strategies among toddlers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:32.050358Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:79a8c9747763ea34ed1155b30c1f6b61007fe93dff3f0b7b46333e1d0e4da142","observation_id":"43347ce9-4ff7-4a4c-9c81-2757c0eeecc3","resolution":{"observed_at":"2026-08-06T20:42:32.050358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:32.154915Z","title":"Learning iterative reasoning through energy minimization","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:32.154915Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:273424478f11cfd6b304229fc8177f8a5b5a73956b9b4028c8771136e871eb1c","observation_id":"dfc28f73-cd26-4e11-8821-764ed591bb90","resolution":{"observed_at":"2026-08-06T20:42:32.154915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:32.267478Z","title":"Mastering the game of go without human knowledge","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:32.267478Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:54120e1df9c232f0ca4e78e717d6d5f46c52eb75dbd90c476a41a4f4fdde173b","observation_id":"5e941aee-f4b8-40f0-af13-b00b557fdda8","resolution":{"observed_at":"2026-08-06T20:42:32.267478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:32.365436Z","title":"Let’s verify step by step","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:32.365436Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:91248d44e52e78fc247113e038ab8eaab99a687c539eab5a1491bac32242176b","observation_id":"01061b29-a12e-47d4-8d7f-cd20eff5e3f2","resolution":{"observed_at":"2026-08-06T20:42:32.365436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:32.496355Z","title":"Implicit generation and modeling with energy based models","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:32.496355Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:b8475ae9cca88066c35f768fef39f90d9cb5b0b3575678bc85546f9cf140a956","observation_id":"82ed70fd-9e40-4087-9165-04cf1f67916c","resolution":{"observed_at":"2026-08-06T20:42:32.496355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.01316","last_updated":"2021-06-11T00:41:30Z","snapshot_observed_at":"2026-07-06T10:20:00.293892Z","submitted_at":"2020-12-02T16:39:49Z","title":"Improved Contrastive Divergence Training of Energy Based Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.01316","snapshot_observed_at":"2026-08-06T20:42:32.583167Z","title":"Improved contrastive divergence training of energy based models","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:32.583167Z"},"links":{"cited_paper":"/paper/2012.01316","citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:cbee531d15caf4e019adf98470955ed3cd28b1421a89023c43dfe0c43139b735","observation_id":"4b3b9699-2254-443f-ac51-421dff239c63","resolution":{"observed_at":"2026-08-06T20:42:32.583167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:32.661452Z","title":"Learning energy-based models in high-dimensional spaces with multiscale denoising-score matching","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:32.661452Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:7606dcc75297d03f67d35a94b77c12923456179f170b48663f08b6b2fcfb73fc","observation_id":"15b6c26c-96b6-4add-acec-1a57e546c871","resolution":{"observed_at":"2026-08-06T20:42:32.661452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2003.05033","last_updated":"2021-12-21T12:02:53Z","snapshot_observed_at":"2026-08-06T18:15:21.339220Z","submitted_at":"2020-03-10T23:22:09Z","title":"Generalized Energy Based Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.05033","snapshot_observed_at":"2026-08-06T20:42:32.751974Z","title":"Generalized energy based models","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:32.751974Z"},"links":{"cited_paper":"/paper/2003.05033","citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:d5ca4305ece7537a299f3955b399baf3e3ba13a86224d3369263afcce6ffe639","observation_id":"7577563f-dd4a-42cc-8148-af4765d2dc87","resolution":{"observed_at":"2026-08-06T20:42:32.751974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:32.794687Z","title":"Improving language understand- ing by generative pre-training","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:32.794687Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:140a08f0ac90d74ea108eace2f3aa2091613bb4c14ebdc5efd3fdc75fef883ba","observation_id":"b1389608-cc49-44b6-b5a4-6fe468f769e3","resolution":{"observed_at":"2026-08-06T20:42:32.794687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:32.928649Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:32.928649Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:e7f7c00448ef0af13e9518b1a6d5b0f16ad3c4db279a8d12ab43dc6811186ccc","observation_id":"77a76a90-740e-492b-9e49-fe3a790f85f7","resolution":{"observed_at":"2026-08-06T20:42:32.928649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:33.044276Z","title":"Visualizing the loss landscape of neural nets","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:33.044276Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:facd9cd3cebb1a0f77c5bf59d84e687effdab92872b4e42a913d30055830bd00","observation_id":"94a2c2a7-26b1-490b-bafc-21467542ba55","resolution":{"observed_at":"2026-08-06T20:42:33.044276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:33.161433Z","title":"The complexity of theorem-proving procedures","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:33.161433Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:6c03e396046d2437b94f0a654dc3e908e05c9623c44d8e8cc1dfd19975ea911a","observation_id":"8a140042-017d-4db9-b43b-16e9a5e2ce6c","resolution":{"observed_at":"2026-08-06T20:42:33.161433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:33.267588Z","title":"The knowledge complexity of interactive proof- systems","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:33.267588Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:54c3d110801f82c0356b67433d666e7204320c07e07ff5c42336cc16da740052","observation_id":"f4b287c5-52a4-4de1-9cad-33c7eef7879b","resolution":{"observed_at":"2026-08-06T20:42:33.267588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:33.352645Z","title":"Letter to john von neumann, 1956","venue":null,"work_id":null,"year":1956},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:33.352645Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:8fd8870e229741067ed1a02e444f7ff35d7a6f8dd05c73ba38944a32a88ec9f1","observation_id":"559112c5-f05d-4e44-9241-67463eaf949b","resolution":{"observed_at":"2026-08-06T20:42:33.352645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00243","last_updated":"2026-04-10T18:51:54Z","snapshot_observed_at":"2026-07-06T18:55:19.894571Z","submitted_at":"2024-08-01T02:47:30Z","title":"A Survey on the Applications of Zero-Knowledge Proofs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00243","snapshot_observed_at":"2026-08-06T20:42:33.473880Z","title":"A survey on the applications of zero-knowledge proofs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:33.473880Z"},"links":{"cited_paper":"/paper/2408.00243","citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:a23ac0b4f2640e287a2f1f86b33c4129c99728a9a6b2a12f5ee627e438432edf","observation_id":"ec6ed2f9-1d88-4dca-b12f-2be3541a6827","resolution":{"observed_at":"2026-08-06T20:42:33.473880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:33.535547Z","title":"A method for obtaining digital signatures and public-key cryptosystems","venue":null,"work_id":null,"year":1978},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:33.535547Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:8c9ca897c8df623505e374742df673200ed3597684ff3f24d4dd1d17aaaf1d20","observation_id":"20a593dc-e042-46ba-9627-a8cc5bd34d53","resolution":{"observed_at":"2026-08-06T20:42:33.535547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:33.625155Z","title":"Alphacode 2 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:33.625155Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:163206b540c209b845afb3098243cb308f68470dae279afca330d34633fa474a","observation_id":"7f0e8c6f-3b52-422a-abf5-a0c656e829de","resolution":{"observed_at":"2026-08-06T20:42:33.625155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:33.707498Z","title":"Griffiths, Yuan Cao, and Karthik Narasimhan","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:33.707498Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:970ed91db415bc19ea6a9806115c822cf656f81bf1f4160358a8eaf6dd2b5d98","observation_id":"768dd99b-21e3-4e3f-9aba-2ab20f6bb9bb","resolution":{"observed_at":"2026-08-06T20:42:33.707498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:33.786601Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:33.786601Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:21df0f9bd8f8d0863728ab2d7ee56d048d0c822aed440dd4bb5c9cd2c3f9883a","observation_id":"afb0c69a-d33c-413b-a078-1cf757642dc8","resolution":{"observed_at":"2026-08-06T20:42:33.786601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:33.870075Z","title":"All roads lead to likelihood: The value of reinforcement learning in fine-tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:33.870075Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:6e32bc3b101a82577320eb2d601e1973a834bcea4cc802bd8b3e1b8484ba030e","observation_id":"46e69b7b-8bbf-4172-a7ed-782d24f6ef67","resolution":{"observed_at":"2026-08-06T20:42:33.870075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11179","last_updated":"2024-06-17T03:36:47Z","snapshot_observed_at":"2026-07-06T18:31:53.591578Z","submitted_at":"2024-06-17T03:36:47Z","title":"Learning Iterative Reasoning through Energy Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11179","snapshot_observed_at":"2026-08-06T20:42:34.008179Z","title":"Learning iterative reasoning through energy diffusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:34.008179Z"},"links":{"cited_paper":"/paper/2406.11179","citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:b675bff7c1d147649aa9b4b884990559863123a919fc2648fde08dcec7c23bb3","observation_id":"11ab7f4d-b8a6-4e9b-9698-8b875689a168","resolution":{"observed_at":"2026-08-06T20:42:34.008179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.00059","last_updated":"2023-10-31T18:07:07Z","snapshot_observed_at":"2026-07-06T16:41:19.189036Z","submitted_at":"2023-10-31T18:07:07Z","title":"The Generative AI Paradox: \"What It Can Create, It May Not Understand\"","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.00059","snapshot_observed_at":"2026-08-06T20:42:34.086763Z","title":"what it can create, it may not understand","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:34.086763Z"},"links":{"cited_paper":"/paper/2311.00059","citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:54f0bea4862e903f3304e763a56e71dadaa41d5a7c4a14da35b7fc690d02e7e8","observation_id":"a061f6be-ffe3-4212-853d-8101b4619921","resolution":{"observed_at":"2026-08-06T20:42:34.086763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:34.184331Z","title":"Commonsense psychology in human infants and machines","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:34.184331Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:2951f505d72fd8f748f1c3a640546b09009dac8206c202ad444d153e21d1a7bc","observation_id":"c38fb9d3-72a9-4066-a8db-c2eac63a55d4","resolution":{"observed_at":"2026-08-06T20:42:34.184331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:34.264398Z","title":"Position: Llms can’t plan, but can help planning in llm-modulo frameworks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:34.264398Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:a86e32460be228729e1ea13c4965d5d52113058853b4106bbb290d690e3f9db8","observation_id":"1e07140c-3c4c-4dc8-a8ad-d2acaf5468c8","resolution":{"observed_at":"2026-08-06T20:42:34.264398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.01384","last_updated":"2023-02-02T19:41:00Z","snapshot_observed_at":"2026-07-06T14:47:52.408734Z","submitted_at":"2023-02-02T19:41:00Z","title":"Energy-Inspired Self-Supervised Pretraining for Vision Models","version":1},"cited_work":{"arxiv_id":"2302.01384","doi":null,"metadata_source":"pith","pith_arxiv_id":"2302.01384","snapshot_observed_at":"2026-08-06T20:42:42.653873Z","title":"Energy-Inspired Self-Supervised Pretraining for Vision Models","venue":"cs.CV","work_id":"cca721c0-8349-4375-a78f-2a1c79fa931f","year":2023},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:34.353007Z"},"links":{"cited_paper":"/paper/2302.01384","citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:330c95e8cedcff892ffe8e63f0af6bc7e7592e3ddaf5d69008a9b93846ad2d38","observation_id":"b022da06-296c-49f9-94e6-013c213d0a80","resolution":{"observed_at":"2026-08-06T20:42:42.701929Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:34.452087Z","title":"A path towards autonomous machine intelligence version 0.9","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:34.452087Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:b03b90640518c5e329e550dd569be0c7dc1f18a6750c44d490ae1f64965dfd74","observation_id":"414175cf-2b52-49e4-abf4-bc886fb2473a","resolution":{"observed_at":"2026-08-06T20:42:34.452087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:34.562610Z","title":"Generative adversarial nets","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:34.562610Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:27e098467c054c54ff63000f6d0e3c7a1355496a0a0d22a2fd5a7caf4537b4fc","observation_id":"873a1416-b6da-4ca0-8d9f-6812393ddf3b","resolution":{"observed_at":"2026-08-06T20:42:34.562610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:34.631041Z","title":"A neural probabilistic language model","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:34.631041Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:5edbf7538ed7d36de3c7c79b58169ca0bbd887c36a5d82d8fe7672212c766457","observation_id":"7c53a24a-7410-4b4c-a398-ba3ff1db27fd","resolution":{"observed_at":"2026-08-06T20:42:34.631041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:34.700666Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:34.700666Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:be7ed22c62d1521689d13c713d294d3b339c2e70dfba36184d9579c1ea282b1e","observation_id":"d8ae396b-51c6-4911-aee0-fc24d70c1975","resolution":{"observed_at":"2026-08-06T20:42:34.700666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:34.765629Z","title":"How to compute hessian-vector products? In ICLR Blogposts 2024, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:34.765629Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:09906f69bcbaa19d1587f145388a60b971cb367c9aeeed16c1dbcb4a69b207bf","observation_id":"075ae49c-bc82-40d2-90e3-2ce23ff9aa47","resolution":{"observed_at":"2026-08-06T20:42:34.765629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:34.828094Z","title":"Learning to summarize with human feedback","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:34.828094Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:ecd45a944906d8fbe8085666dc8c7cf529f991223005de301af3d1c3e4e065c2","observation_id":"02f05fed-2e8d-4210-a785-c4f7d5cd3a88","resolution":{"observed_at":"2026-08-06T20:42:34.828094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:34.925762Z","title":"Gpt-4 technical report, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:34.925762Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:5654155150522ec3d5f07c17462583921de3d0c957114e1db7769c9da4fa36ed","observation_id":"ef35ec80-1bb7-4aba-b311-f561852563ce","resolution":{"observed_at":"2026-08-06T20:42:34.925762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:35.006584Z","title":"Dinov2: Learning robust visual features without supervision, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:35.006584Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:cb695471c19eb3c745e0b1dbbc2a61554019df15e339d2175e215bc952894adc","observation_id":"a0d5cbff-3fec-4dde-98b2-90c2b92dc950","resolution":{"observed_at":"2026-08-06T20:42:35.006584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:35.067979Z","title":"Masked autoencoders are scalable vision learners, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:35.067979Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:22fe15bc4caf3278e4265b03466663460341f127fb35db6ba42a51cd506b422b","observation_id":"36237a5c-f279-41d2-a05d-8b09e6fe5502","resolution":{"observed_at":"2026-08-06T20:42:35.067979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:35.135957Z","title":"Audiolm: a language modeling approach to audio generation, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:35.135957Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:2cbde7e380c029172958d0b7c0a1a1da8ca48d17e3e17788d05f1e19dc39dff2","observation_id":"b223fe79-471e-44cd-8389-c8526b5b20c6","resolution":{"observed_at":"2026-08-06T20:42:35.135957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:35.207395Z","title":"Language models are unsupervised multitask learners","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:35.207395Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:99b4b3deafada0f3ba346b8b45ac6ff396b21024659971b3448fd4464ba4f007","observation_id":"4c13c89c-f5e6-4ca9-9f60-e058e0961c63","resolution":{"observed_at":"2026-08-06T20:42:35.207395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:35.251527Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:35.251527Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:2bc35934f2d2b74a4f5fd961c1691f3cd821bbed2236e72da840833c0297dfde","observation_id":"0575370b-3e6d-45ec-b482-68c5e7ffcab4","resolution":{"observed_at":"2026-08-06T20:42:35.251527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T20:42:35.319402Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:35.319402Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:313b5af706f18bd2aaff5418ed3c92268ab4ab7048c0c44527d2e79185b78158","observation_id":"4a473687-5d2e-424b-a2b3-9fd18ce432ce","resolution":{"observed_at":"2026-08-06T20:42:35.319402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-06T20:42:35.450884Z","title":"Scaling laws for neural language models","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:35.450884Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:93cd44704d9b23f23783bcb0e2d36981a1f5a15560c717fc84abcdb951658264","observation_id":"8c235005-e7d1-493f-9a44-56e12789270f","resolution":{"observed_at":"2026-08-06T20:42:35.450884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18969","last_updated":"2025-02-26T09:27:54Z","snapshot_observed_at":"2026-07-06T20:42:55.911327Z","submitted_at":"2025-02-26T09:27:54Z","title":"(Mis)Fitting: A Survey of Scaling Laws","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18969","snapshot_observed_at":"2026-08-06T20:42:35.541466Z","title":"(mis) fitting: A survey of scaling laws","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:35.541466Z"},"links":{"cited_paper":"/paper/2502.18969","citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:eba5ac437fa98e953e9bfd655d46ad53e9328f1b0b838305c56c7981428c6a9f","observation_id":"3d490c07-6995-4848-8e3e-07d52a97d696","resolution":{"observed_at":"2026-08-06T20:42:35.541466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:35.606202Z","title":"Llama 2: Open foundation and fine-tuned chat models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:35.606202Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:784cfc0972a290ea6f0c300e0c16aad406cbe3ec5810af65d902f33b80797c79","observation_id":"239be76b-5a53-40d2-92a1-62534bbfc5b4","resolution":{"observed_at":"2026-08-06T20:42:35.606202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:35.695173Z","title":"Revisiting neural scaling laws in language and vision","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:35.695173Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:004a031f5cc5e04720214931ba0b009fe4cfe27add14689040ed2eb904e333b1","observation_id":"55a62e46-f355-405c-b337-7eb717f98f76","resolution":{"observed_at":"2026-08-06T20:42:35.695173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.14701","last_updated":"2020-11-06T04:16:36Z","snapshot_observed_at":"2026-07-06T10:09:17.078776Z","submitted_at":"2020-10-28T02:17:24Z","title":"Scaling Laws for Autoregressive Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.14701","snapshot_observed_at":"2026-08-06T20:42:35.778302Z","title":"Scaling laws for autoregressive generative modeling","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:35.778302Z"},"links":{"cited_paper":"/paper/2010.14701","citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:93424be3848e868a8a46d075b10418bbb17a6d98875ee6e8bc51dc7578853d13","observation_id":"0cc151af-d309-43ac-91eb-0371b3636c69","resolution":{"observed_at":"2026-08-06T20:42:35.778302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-07-06T12:54:11.616335Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-06T20:42:35.885430Z","title":"Training compute-optimal large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:35.885430Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:438b5209f7c0016f31b5d78a06e24861997d5a721eb2bd1fc6547fa677f2e259","observation_id":"f764aa79-0c37-43ea-8bca-35bc22ce5393","resolution":{"observed_at":"2026-08-06T20:42:35.885430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:35.973122Z","title":"Neural ordinary differential equations","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:35.973122Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:ff453a5cb2ae7a6eb4092f506b27198c5300d6f7c2682588dc6224a75fed26d8","observation_id":"3ef06e2f-f89e-43ab-a067-790e7c3b817e","resolution":{"observed_at":"2026-08-06T20:42:35.973122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:36.040930Z","title":"Redpajama: an open dataset for training large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:36.040930Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:e06da481b8abbed220e0a1c553c84f2751c136ea2b0212f0d8ae51bd28e2e2f4","observation_id":"a740d04b-eb70-44c9-9aeb-7252390f443c","resolution":{"observed_at":"2026-08-06T20:42:36.040930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:36.083704Z","title":"Redpajama: an open dataset for training large language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:36.083704Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:102a74916c289b8e36a3da69c20c2dba6ce76bd03a35d9c4932d23742e360a6d","observation_id":"00ecd7a6-48b4-44a1-bfe2-1a9d36cd77c4","resolution":{"observed_at":"2026-08-06T20:42:36.083704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06745","last_updated":"2022-04-14T04:00:27Z","snapshot_observed_at":"2026-07-06T13:00:12.148951Z","submitted_at":"2022-04-14T04:00:27Z","title":"GPT-NeoX-20B: An Open-Source Autoregressive Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06745","snapshot_observed_at":"2026-08-06T20:42:36.122729Z","title":"Gpt-neox-20b: An open-source autoregressive language model","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:36.122729Z"},"links":{"cited_paper":"/paper/2204.06745","citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:3b5c08bbee71c838bd8bee1291ab1d3ebd1e3148411adb77e69481b437fc0e69","observation_id":"03016366-1bbf-4b52-b732-77cf3b51bbc6","resolution":{"observed_at":"2026-08-06T20:42:36.122729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04620","last_updated":"2025-08-31T18:32:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-05T16:23:20Z","title":"Learning to (Learn at Test Time): RNNs with Expressive Hidden States","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04620","snapshot_observed_at":"2026-08-06T20:42:36.203029Z","title":"Learning to (learn at test time): Rnns with expressive hidden states","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:36.203029Z"},"links":{"cited_paper":"/paper/2407.04620","citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:573d29035b2302057c7fd6819da9804df853d6bc0297fc1a2cd374547012b6e0","observation_id":"24d925d3-d603-4cfd-a18a-e9945c9595e2","resolution":{"observed_at":"2026-08-06T20:42:36.203029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:36.279692Z","title":"Physics of language models: Part 2.1, grade- school math and the hidden reasoning process","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:36.279692Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:138b0f63c032fade6a03a751f1f6b9bd08acc28ce27eabeed17a377327864d50","observation_id":"3688ee12-d42c-401c-9711-c7b05e16bae3","resolution":{"observed_at":"2026-08-06T20:42:36.279692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-06T20:42:36.404415Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:36.404415Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:46c1910ad14d3af06a9bf8f89fee948e896a4442eca8cc4aae3bedabb493a1aa","observation_id":"4b39c09f-3a08-4864-8434-65d1f3ef63f7","resolution":{"observed_at":"2026-08-06T20:42:36.404415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.05250","last_updated":"2016-10-11T02:42:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-06-16T16:36:00Z","title":"SQuAD: 100,000+ Questions for Machine Comprehension of Text","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.05250","snapshot_observed_at":"2026-08-06T20:42:36.467847Z","title":"Squad: 100,000+ questions for machine comprehension of text","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:36.467847Z"},"links":{"cited_paper":"/paper/1606.05250","citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:86901530379df75af4f466929b4c4f657fc57956cd13fc2c9e6cdbaf77a26894","observation_id":"598cefe2-918e-4e00-920a-e1dd5610ae53","resolution":{"observed_at":"2026-08-06T20:42:36.467847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04615","last_updated":"2023-06-12T17:51:15Z","snapshot_observed_at":"2026-07-06T13:19:12.109592Z","submitted_at":"2022-06-09T17:05:34Z","title":"Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.04615","snapshot_observed_at":"2026-08-06T20:42:36.518813Z","title":"Beyond the imitation game: Quantifying and extrapolating the capabilities of language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:36.518813Z"},"links":{"cited_paper":"/paper/2206.04615","citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:e494429830dfa43c33901e443be09e37043862e49027b991a74a26fb14d287e6","observation_id":"7ebfd7ff-96a9-4f0e-b35c-d731d3037fb5","resolution":{"observed_at":"2026-08-06T20:42:36.518813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:42:36.609859Z","title":"Are emergent abilities of large language models a mirage? Advances in Neural Information Processing Systems, 36:55565–55581, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-06T20:42:36.609859Z"},"links":{"citing_paper":"/paper/2507.02092"},"observation_digest":"sha256:9aeb721a73da4f8c70ec51ba5ee073dd0e2b2d766a064bf2faf650273e07d024","observation_id":"4f7b2363-e926-404f-8547-9cad4022b36f","resolution":{"observed_at":"2026-08-06T20:42:36.609859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.02092","last_updated":"2025-07-02T19:17:29Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-06T20:35:50.241169Z","submitted_at":"2025-07-02T19:17:29Z","title":"Energy-Based Transformers are Scalable Learners and Thinkers"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":97,"verified_exact":3,"verified_fuzzy":0},"total_outbound_references":162},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 100 of 162 outbound references and 16 inbound Pith citation observations for arXiv:2507.02092."}