{"as_of":"2026-08-08T02:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:16159df0197398374611ccd1aa48d8360bc2426ab6e1dd2e8f64149eccd7381c","coverage":[{"denominator":63,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":63,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:40:26.743983Z","state":"measured"},{"denominator":64,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":64,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T19:34:29.377709Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-07T21:48:16.475478Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24147","snapshot_observed_at":"2026-08-04T19:34:29.377709Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09193","last_updated":"2025-09-11T07:09:30Z","snapshot_observed_at":"2026-08-07T07:37:18.552922Z","submitted_at":"2025-09-11T07:09:30Z","title":"AI Reasoning for Wireless Communications and Networking: A Survey and Perspectives","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-04T19:34:29.377709Z"},"links":{"cited_paper":"/paper/2505.24147","citing_paper":"/paper/2509.09193"},"observation_digest":"sha256:3b11a47a4c9e5ef282ebe7dfca7e376808f28d4d3176702bc5d8cfa72b0dec13","observation_id":"b57b68c9-4876-41b3-a345-711e53062310","resolution":{"observed_at":"2026-08-04T19:34:29.377709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.24147/citation-record","integrity":"/paper/2505.24147/integrity","json":"/paper/2505.24147/citation-record.json","paper":"/paper/2505.24147"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1812.01193","last_updated":"2018-12-06T16:11:19Z","snapshot_observed_at":"2026-08-07T18:19:55.650999Z","submitted_at":"2018-12-04T03:15:38Z","title":"e-SNLI: Natural Language Inference with Natural Language Explanations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.01193","snapshot_observed_at":"2026-08-07T12:40:19.931343Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-07T21:48:16.475478Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:19.931343Z"},"links":{"cited_paper":"/paper/1812.01193","citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:8e51dcf437ea2f9d236780ae4541d393c8f40bc5777f8dc9da81f72e2aa6e963","observation_id":"9a44730b-7cb5-4230-966a-77be09148183","resolution":{"observed_at":"2026-08-07T12:40:19.931343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.00071","last_updated":"2022-03-28T19:58:03Z","snapshot_observed_at":"2026-07-06T12:13:53.244607Z","submitted_at":"2021-11-30T20:09:53Z","title":"What to Learn, and How: Toward Effective Learning from Rationales","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.00071","snapshot_observed_at":"2026-08-07T12:40:20.075543Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-07T21:48:16.475478Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:20.075543Z"},"links":{"cited_paper":"/paper/2112.00071","citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:b57c36af39bde37f1979494d8886d3690530c1f41db7888d96e6d4a622356a1d","observation_id":"28d0f066-cc60-472f-9c0d-2ef3ed4c4ee9","resolution":{"observed_at":"2026-08-07T12:40:20.075543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.11416","last_updated":"2022-12-06T21:39:48Z","snapshot_observed_at":"2026-07-06T14:08:18.855958Z","submitted_at":"2022-10-20T16:58:32Z","title":"Scaling Instruction-Finetuned Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.11416","snapshot_observed_at":"2026-08-07T12:40:20.235803Z","title":"Chi, Jeff Dean, Jacob Devlin, Adam Roberts, Denny Zhou, Quoc V","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-07T21:48:16.475478Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:20.235803Z"},"links":{"cited_paper":"/paper/2210.11416","citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:9f9d7197373358851ba9547f77bcadaa49361e0d1a6e31acdd3500ece920f7af","observation_id":"b611289b-cd53-4d9f-a96c-9463267bb6f7","resolution":{"observed_at":"2026-08-07T12:40:20.235803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-07T12:40:20.376449Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-07T21:48:16.475478Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:20.376449Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:398b850c636dfe37348e69fa878ae89b293b0e911759cc18346cefff57f42213","observation_id":"161dc58f-b8ea-435b-a4cf-80d4c290baf4","resolution":{"observed_at":"2026-08-07T12:40:20.376449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T12:40:20.478762Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-07T21:48:16.475478Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:20.478762Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:934ee43fcb79ab5863ccd56466f27fb3a3f7379bd876d8ee00da13a57fbbdd4b","observation_id":"561e22a8-88ba-42ab-b917-6760969e44fa","resolution":{"observed_at":"2026-08-07T12:40:20.478762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:28.937498Z","title":null,"venue":null,"work_id":"1136dc03-180f-4220-9ebd-af85be9794d3","year":1983},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-07T21:48:16.475478Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:20.563230Z"},"links":{"citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:5cf12f633631259cd8f8331ac0d4fbe29e5ee08003d2bdf93af89637b6cb2e69","observation_id":"9b199d19-f52f-4282-bdf3-034b538f339a","resolution":{"observed_at":"2026-08-07T12:40:29.046299Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2003.07892","last_updated":"2020-10-15T17:04:21Z","snapshot_observed_at":"2026-08-06T19:06:14.757553Z","submitted_at":"2020-03-17T18:58:44Z","title":"Calibration of Pre-trained Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.07892","snapshot_observed_at":"2026-08-07T12:40:20.670222Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-07T21:48:16.475478Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:20.670222Z"},"links":{"cited_paper":"/paper/2003.07892","citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:66a2632ad5d94f9ee0c9be8764aeea2db651c54efbd6d3ca9ac4c675d1bd3256","observation_id":"80f18ef8-7ff6-4e65-a87e-96e0cadb69c5","resolution":{"observed_at":"2026-08-07T12:40:20.670222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:20.771006Z","title":null,"venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-07T21:48:16.475478Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:20.771006Z"},"links":{"citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:248a8a911fef6bdf3d1a6d08f635f85e1a3dc52f361ccc6f3daec643ab52b320","observation_id":"c2a9bc4f-3040-4ad6-8cef-9b049892a534","resolution":{"observed_at":"2026-08-07T12:40:20.771006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:28.748756Z","title":null,"venue":null,"work_id":"f0a96414-351c-4c96-8b31-3450060abbe5","year":2020},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-07T21:48:16.475478Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:20.902134Z"},"links":{"citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:6ae912a132568313d18a1ae3b10af4f05978662442702e46d53b520b1fedf94e","observation_id":"38c17928-dfe3-4ca3-a413-5c551fbef8a9","resolution":{"observed_at":"2026-08-07T12:40:28.841092Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:28.539729Z","title":null,"venue":null,"work_id":"f40d57e7-3b79-4825-8479-890e6976c7bd","year":2009},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-07T21:48:16.475478Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:21.009144Z"},"links":{"citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:56deae9d3ba9a378e4e3bac710cdc1b334b53548e0ff033e6dbb507731acace6","observation_id":"32f8bb84-2b67-49b2-8150-9fde9ec8e34c","resolution":{"observed_at":"2026-08-07T12:40:28.631722Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.08420","last_updated":"2025-04-27T01:03:12Z","snapshot_observed_at":"2026-08-05T16:28:29.633722Z","submitted_at":"2021-10-16T00:21:42Z","title":"Understanding Dataset Difficulty with $\\mathcal{V}$-Usable Information","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.08420","snapshot_observed_at":"2026-08-07T12:40:21.067613Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-07T21:48:16.475478Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:21.067613Z"},"links":{"cited_paper":"/paper/2110.08420","citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:1315bad895576d38a5025f70a98b3cea823cc3a27e61c67cf6c5d24e1e969cec","observation_id":"a69755ad-827a-4e21-8dd7-3121394fd948","resolution":{"observed_at":"2026-08-07T12:40:21.067613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12726","last_updated":"2023-01-30T08:51:19Z","snapshot_observed_at":"2026-07-06T14:45:55.345502Z","submitted_at":"2023-01-30T08:51:19Z","title":"Specializing Smaller Language Models towards Multi-Step Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12726","snapshot_observed_at":"2026-08-07T12:40:21.135948Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-07T21:48:16.475478Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:21.135948Z"},"links":{"cited_paper":"/paper/2301.12726","citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:6fabf24fefa3a0af1e431a77cc448c09d628583be164068ef92f5305d548569b","observation_id":"55d64ad1-a4c2-4cb8-8a2a-f7342e66b8b9","resolution":{"observed_at":"2026-08-07T12:40:21.135948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:28.412510Z","title":null,"venue":null,"work_id":"61836b57-fb14-4585-aec6-d9404c230fe3","year":null},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-07T21:48:16.475478Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:21.202033Z"},"links":{"citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:b380960cafe19515318af89c981ef8c0059ea2787cfa8c0897219a1a53a09004","observation_id":"5b86da8c-5c8e-4bef-aadb-2c20b1c4aaef","resolution":{"observed_at":"2026-08-07T12:40:28.468282Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.04599","last_updated":"2017-08-03T13:29:46Z","snapshot_observed_at":"2026-08-07T08:05:23.979918Z","submitted_at":"2017-06-14T17:33:50Z","title":"On Calibration of Modern Neural Networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.04599","snapshot_observed_at":"2026-08-07T12:40:21.277381Z","title":"Weinberger","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-07T21:48:16.475478Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:21.277381Z"},"links":{"cited_paper":"/paper/1706.04599","citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:ef0f76969a2b6137456ef69de08792622825aa2279ddf26f7f113036c9d88ff3","observation_id":"e4d1d33d-c773-4b3c-ba0d-be347a81914f","resolution":{"observed_at":"2026-08-07T12:40:21.277381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:21.377227Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-07T21:48:16.475478Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:21.377227Z"},"links":{"citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:5187a059a140e50a7cb5a7c8b08f3f6ecee2953fac3901d23dd37f81f53de421","observation_id":"f0f9e274-45f8-477e-8f7d-b3b34bb95c2b","resolution":{"observed_at":"2026-08-07T12:40:21.377227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.19249","last_updated":"2023-05-30T17:35:31Z","snapshot_observed_at":"2026-07-06T15:35:33.952097Z","submitted_at":"2023-05-30T17:35:31Z","title":"Preserving Pre-trained Features Helps Calibrate Fine-tuned Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.19249","snapshot_observed_at":"2026-08-07T12:40:21.446432Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-07T21:48:16.475478Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:21.446432Z"},"links":{"cited_paper":"/paper/2305.19249","citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:5ebf045039db7a95fd99df1ae1182c305ce52b713a38e0bec5d3f5d3abf754e6","observation_id":"6a428f17-441c-4495-b920-10589e7e418f","resolution":{"observed_at":"2026-08-07T12:40:21.446432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1610.02136","last_updated":"2018-10-03T07:32:57Z","snapshot_observed_at":"2026-08-02T06:41:33.803920Z","submitted_at":"2016-10-07T04:06:01Z","title":"A Baseline for Detecting Misclassified and Out-of-Distribution Examples in Neural Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1610.02136","snapshot_observed_at":"2026-08-07T12:40:21.542866Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-07T21:48:16.475478Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:21.542866Z"},"links":{"cited_paper":"/paper/1610.02136","citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:7b21afa39b4ddb98f9a0601fe2e2a547f19807fe8abd1d0e33204de4a70de58b","observation_id":"ff5be32c-c1b9-40da-9360-ab046edb059c","resolution":{"observed_at":"2026-08-07T12:40:21.542866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09553","last_updated":"2023-11-16T04:17:49Z","snapshot_observed_at":"2026-08-01T12:13:47.941909Z","submitted_at":"2023-11-16T04:17:49Z","title":"Program-Aided Reasoners (better) Know What They Know","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09553","snapshot_observed_at":"2026-08-07T12:40:21.641954Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-07T21:48:16.475478Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:21.641954Z"},"links":{"cited_paper":"/paper/2311.09553","citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:497c6cbbdff14d31ed927422202f5478a1084fcd14f290cda56d2fdcda90caad","observation_id":"5c778750-e0b3-429c-859e-0ff7ba174de0","resolution":{"observed_at":"2026-08-07T12:40:21.641954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.05221","last_updated":"2022-11-21T16:38:35Z","snapshot_observed_at":"2026-08-06T08:34:11.887259Z","submitted_at":"2022-07-11T22:59:39Z","title":"Language Models (Mostly) Know What They Know","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.05221","snapshot_observed_at":"2026-08-07T12:40:21.763925Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-07T21:48:16.475478Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:21.763925Z"},"links":{"cited_paper":"/paper/2207.05221","citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:33a220a6139bd1f39fe12209eef04c926c2f3b624f1e35fb429207e4c5ea1e7c","observation_id":"87bba128-4d09-42ba-9549-726fc78a78b1","resolution":{"observed_at":"2026-08-07T12:40:21.763925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:21.915046Z","title":null,"venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-07T21:48:16.475478Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:21.915046Z"},"links":{"citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:42cd2e1d5ab377c3a6f50a3dbde588bab95af3b65c9dc5b7f3d34fb39ba7f2ed","observation_id":"40c41778-a9c3-439d-a34e-ef9f44e289e7","resolution":{"observed_at":"2026-08-07T12:40:21.915046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.11916","last_updated":"2023-01-29T05:14:17Z","snapshot_observed_at":"2026-08-07T04:02:08.445660Z","submitted_at":"2022-05-24T09:22:26Z","title":"Large Language Models are Zero-Shot Reasoners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.11916","snapshot_observed_at":"2026-08-07T12:40:22.060387Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-07T21:48:16.475478Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:22.060387Z"},"links":{"cited_paper":"/paper/2205.11916","citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:601bc7cc2bc8dc816be81b15fff8307160225480a238bcdbed969756a1c5263d","observation_id":"e9521933-7c8e-4969-844a-3c985b928b30","resolution":{"observed_at":"2026-08-07T12:40:22.060387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:22.139969Z","title":null,"venue":null,"work_id":null,"year":1985},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-07T21:48:16.475478Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:22.139969Z"},"links":{"citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:c22dbeaec786312a7750b935f6f358e1be9385019c39a90e135b242c9bcdeb6f","observation_id":"b1324cd2-e53e-4e28-a639-d7ba67a5c294","resolution":{"observed_at":"2026-08-07T12:40:22.139969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14050","last_updated":"2024-04-15T21:58:27Z","snapshot_observed_at":"2026-07-06T15:46:21.260261Z","submitted_at":"2023-06-24T20:15:07Z","title":"Symbolic Chain-of-Thought Distillation: Small Models Can Also \"Think\" Step-by-Step","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14050","snapshot_observed_at":"2026-08-07T12:40:22.199178Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-07T21:48:16.475478Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:22.199178Z"},"links":{"cited_paper":"/paper/2306.14050","citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:f39f9c825f2e8e806eab53116962b413d40185c6d524a4d6d8e2a94f0db5d8da","observation_id":"f999883d-599e-44fc-b4ce-a812673cec89","resolution":{"observed_at":"2026-08-07T12:40:22.199178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.06726","last_updated":"2022-10-13T04:50:02Z","snapshot_observed_at":"2026-07-06T14:04:32.971017Z","submitted_at":"2022-10-13T04:50:02Z","title":"Explanations from Large Language Models Make Small Reasoners Better","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.06726","snapshot_observed_at":"2026-08-07T12:40:22.245302Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-07T21:48:16.475478Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:22.245302Z"},"links":{"cited_paper":"/paper/2210.06726","citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:68810d768b74814c7e454a888ea1a646371b20dbcec493410c167f4f9c934bb8","observation_id":"24ab85c0-e912-44e2-93c3-5e39193b1ccd","resolution":{"observed_at":"2026-08-07T12:40:22.245302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:22.296911Z","title":null,"venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-07T21:48:16.475478Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:22.296911Z"},"links":{"citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:4c61a4251e75a04b947d5e2f4b962d9f2c1ad1f2e74336f65416c5666ec2e3a5","observation_id":"0396449b-6fd5-4a27-b5a3-2a55086dec67","resolution":{"observed_at":"2026-08-07T12:40:22.296911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08410","last_updated":"2023-06-01T12:17:01Z","snapshot_observed_at":"2026-07-06T14:31:38.001143Z","submitted_at":"2022-12-16T11:24:42Z","title":"Teaching Small Language Models to Reason","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08410","snapshot_observed_at":"2026-08-07T12:40:22.360176Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-07T21:48:16.475478Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:22.360176Z"},"links":{"cited_paper":"/paper/2212.08410","citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:634480c5e34b7d69b93acbede074af1c033758d0d70c30b285185553b1c53fc1","observation_id":"6d6a7199-fcda-42f4-99fb-77b23b6d8f91","resolution":{"observed_at":"2026-08-07T12:40:22.360176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:22.447045Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-07T21:48:16.475478Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:22.447045Z"},"links":{"citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:0f5e7b614e0f7cb46606d3d245be6cb3a4a2cb9936b782852adf361df046a79d","observation_id":"e86b44f5-654f-4c75-96ba-7f0641dd71f3","resolution":{"observed_at":"2026-08-07T12:40:22.447045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:28.242371Z","title":null,"venue":null,"work_id":"d0778a1b-b78e-4ebb-9803-16f6aeca1c64","year":1962},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-07T21:48:16.475478Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:22.511386Z"},"links":{"citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:70d4524aab2cc365fd8a32e6c94a0723a3d374d2cc1f1fbd1e7537ba1506cc32","observation_id":"c3a1828e-e532-4e12-b819-1f19d0b3e3fc","resolution":{"observed_at":"2026-08-07T12:40:28.323483Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.11045","last_updated":"2023-11-21T19:43:31Z","snapshot_observed_at":"2026-07-06T16:49:25.400974Z","submitted_at":"2023-11-18T11:44:52Z","title":"Orca 2: Teaching Small Language Models How to Reason","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.11045","snapshot_observed_at":"2026-08-07T12:40:22.619372Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-07T21:48:16.475478Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:22.619372Z"},"links":{"cited_paper":"/paper/2311.11045","citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:6a097715f210b8f0088200931615be9fa10287c492d9fbcdc635caf3b97f458d","observation_id":"ac63deaf-e776-4267-8881-5356e894b10f","resolution":{"observed_at":"2026-08-07T12:40:22.619372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02707","last_updated":"2023-06-05T08:58:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-05T08:58:39Z","title":"Orca: Progressive Learning from Complex Explanation Traces of GPT-4","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02707","snapshot_observed_at":"2026-08-07T12:40:22.734629Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-07T21:48:16.475478Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:22.734629Z"},"links":{"cited_paper":"/paper/2306.02707","citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:6653096860e0a4543e286b2276274fbac5176edc89ca2c257cb92a98c80355ba","observation_id":"d5280896-2f0b-4ca6-afa9-c0a13888ff92","resolution":{"observed_at":"2026-08-07T12:40:22.734629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:28.014418Z","title":null,"venue":null,"work_id":"8b19f679-b21e-4212-a9fa-8b313530ea94","year":1973},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-07T21:48:16.475478Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:22.855226Z"},"links":{"citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:04acd94b411306b92ce2a585728cbfb80650b17ec37762f11b13089c95a2d1fa","observation_id":"60471de3-a638-4f6a-b7ac-bade45924015","resolution":{"observed_at":"2026-08-07T12:40:28.117433Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:23.005069Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-07T21:48:16.475478Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:23.005069Z"},"links":{"citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:d9def16bae4160997b4c9b953dd6dea3d26ea5836a21faabea3ea784d7dcce2b","observation_id":"4429db8d-9897-4509-ac80-c4e8c2f14e0e","resolution":{"observed_at":"2026-08-07T12:40:23.005069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1508.05154","last_updated":"2015-09-02T17:26:24Z","snapshot_observed_at":"2026-08-04T10:21:55.040801Z","submitted_at":"2015-08-21T00:25:51Z","title":"Posterior calibration and exploratory analysis for natural language processing models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1508.05154","snapshot_observed_at":"2026-08-07T12:40:23.140874Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-07T21:48:16.475478Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:23.140874Z"},"links":{"cited_paper":"/paper/1508.05154","citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:b214feeca4cc17ceb8936591bb33e0c49791183b494238fd30a5f72b24a688ea","observation_id":"fca23586-df35-4a81-a7b0-d268fe3008de","resolution":{"observed_at":"2026-08-07T12:40:23.140874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.14599","last_updated":"2020-05-06T17:01:56Z","snapshot_observed_at":"2026-08-06T16:34:26.983423Z","submitted_at":"2019-10-31T16:50:43Z","title":"Adversarial NLI: A New Benchmark for Natural Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.14599","snapshot_observed_at":"2026-08-07T12:40:23.231514Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-07T21:48:16.475478Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:23.231514Z"},"links":{"cited_paper":"/paper/1910.14599","citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:bbe55ce7f33853d404319e666f0ee738836dfb0f45d9c24f4c8e67e5f115ceda","observation_id":"cdcb8956-cdec-48cc-9ecf-5808c8df91cc","resolution":{"observed_at":"2026-08-07T12:40:23.231514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:27.787863Z","title":null,"venue":null,"work_id":"3fd916ff-21d0-438b-828f-62074b76c689","year":2019},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-07T21:48:16.475478Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:23.314380Z"},"links":{"citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:b755d4ca6a3f12e66bc092734d2c3a953985b7bfc43b6c585aeb579a18b0be4a","observation_id":"79fd8426-6614-4db8-bae0-9f1c6b8b9c99","resolution":{"observed_at":"2026-08-07T12:40:27.897090Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.00114","last_updated":"2021-11-30T21:32:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-11-30T21:32:46Z","title":"Show Your Work: Scratchpads for Intermediate Computation with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.00114","snapshot_observed_at":"2026-08-07T12:40:23.408330Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-07T21:48:16.475478Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:23.408330Z"},"links":{"cited_paper":"/paper/2112.00114","citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:67baed5acd3f9ff148468978f164bf629d4590b9aefdf1b1c682ae50dee00b1a","observation_id":"1daaaa3f-9a28-40db-8c6b-1d23294a8688","resolution":{"observed_at":"2026-08-07T12:40:23.408330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.01653","last_updated":"2021-09-03T17:56:40Z","snapshot_observed_at":"2026-08-04T08:05:07.544242Z","submitted_at":"2021-09-03T17:56:40Z","title":"CREAK: A Dataset for Commonsense Reasoning over Entity Knowledge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.01653","snapshot_observed_at":"2026-08-07T12:40:23.494889Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-07T21:48:16.475478Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:23.494889Z"},"links":{"cited_paper":"/paper/2109.01653","citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:44dfabe1d58f6a4cc69cef7413051d66659097992ac3dd8040eabce0a0ac2c5a","observation_id":"aee1e717-c13b-424d-9560-f2696fb8047d","resolution":{"observed_at":"2026-08-07T12:40:23.494889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T12:40:23.653922Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-07T21:48:16.475478Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:23.653922Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:e326b580ed23593c5d6c43b7c204220ac2070f0acf7b5a8210e2ca97832214f5","observation_id":"9c942df4-bfc7-49a0-960f-2d0900d8cf93","resolution":{"observed_at":"2026-08-07T12:40:23.653922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:27.614748Z","title":null,"venue":null,"work_id":"cea3d5cd-1264-4e6d-8bda-14b9eaf95e56","year":2008},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-07T21:48:16.475478Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:23.774847Z"},"links":{"citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:a3c7248ebe0ed51323e092f5b9949fc21c0d6d180a746588b4261d02e14143d8","observation_id":"38047f34-8511-4af7-a79c-3aa3e0647524","resolution":{"observed_at":"2026-08-07T12:40:27.665972Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:23.909309Z","title":null,"venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-07T21:48:16.475478Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:23.909309Z"},"links":{"citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:3159d137d315da4f3d8ab2487948aad93d20e30bfc5f2f0fe2a06c272a3a021a","observation_id":"78315454-865e-47d5-85c2-8a506a3bdceb","resolution":{"observed_at":"2026-08-07T12:40:23.909309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.07191","last_updated":"2021-04-15T06:11:12Z","snapshot_observed_at":"2026-08-07T13:11:17.300265Z","submitted_at":"2021-03-12T10:23:47Z","title":"Are NLP Models really able to Solve Simple Math Word Problems?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.07191","snapshot_observed_at":"2026-08-07T12:40:24.048605Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-07T21:48:16.475478Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:24.048605Z"},"links":{"cited_paper":"/paper/2103.07191","citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:1f492e8ffca06353f0fe395ed4cf187085d020f03706a4c8c01c5b003daf45c7","observation_id":"b02de5f7-6bdf-4022-bd79-3fc8e6f1fc5d","resolution":{"observed_at":"2026-08-07T12:40:24.048605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1808.09121","last_updated":"2019-04-27T09:31:59Z","snapshot_observed_at":"2026-07-06T06:57:46.546190Z","submitted_at":"2018-08-28T05:16:35Z","title":"WiC: the Word-in-Context Dataset for Evaluating Context-Sensitive Meaning Representations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.09121","snapshot_observed_at":"2026-08-07T12:40:24.207704Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-07T21:48:16.475478Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:24.207704Z"},"links":{"cited_paper":"/paper/1808.09121","citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:30c6a7862a1a87d997150d143584613b274e2289367036d3299efd32b92da8a3","observation_id":"4bafe963-8524-44d5-8505-30bc59749d11","resolution":{"observed_at":"2026-08-07T12:40:24.207704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:24.416142Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-07T21:48:16.475478Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:24.416142Z"},"links":{"citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:e41052a2471d8cac0210f7440abdd2551054942848509b1fa719f2feb6f7adb4","observation_id":"65f43137-fc52-4c53-bd1e-8a217e64d890","resolution":{"observed_at":"2026-08-07T12:40:24.416142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.10641","last_updated":"2019-11-21T19:01:32Z","snapshot_observed_at":"2026-07-06T08:09:59.842324Z","submitted_at":"2019-07-24T18:11:59Z","title":"WinoGrande: An Adversarial Winograd Schema Challenge at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.10641","snapshot_observed_at":"2026-08-07T12:40:24.573184Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-07T21:48:16.475478Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:24.573184Z"},"links":{"cited_paper":"/paper/1907.10641","citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:c50df96fb9310a97984b5f189403b2cc39ed34457720a86eeb46425607493b99","observation_id":"54cbe89a-4503-4799-96db-12f820cdfc4e","resolution":{"observed_at":"2026-08-07T12:40:24.573184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.00193","last_updated":"2023-05-18T04:44:51Z","snapshot_observed_at":"2026-07-06T14:25:24.844889Z","submitted_at":"2022-12-01T00:39:56Z","title":"Distilling Reasoning Capabilities into Smaller Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.00193","snapshot_observed_at":"2026-08-07T12:40:24.689688Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-07T21:48:16.475478Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:24.689688Z"},"links":{"cited_paper":"/paper/2212.00193","citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:94a16e8ee071de6d194b8b02b16a845b17b7a65958eedec5416477ba62ad512b","observation_id":"257dc47b-fe8a-44c9-a2f9-2b9ff886e6f3","resolution":{"observed_at":"2026-08-07T12:40:24.689688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-07T12:40:24.830152Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-07T21:48:16.475478Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:24.830152Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:3808303f1bffe1fea3f663bda29ff90762e938fbcc95bfaba5ee22da634fb86d","observation_id":"a5c47a0b-e2c9-4d6b-8fec-911624b38379","resolution":{"observed_at":"2026-08-07T12:40:24.830152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:24.930772Z","title":"Manning, Andrew Ng, and Christopher Potts","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-07T21:48:16.475478Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:24.930772Z"},"links":{"citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:59f815fcae171d9408aa68b04215facf3bf2d5a4fae2ff3793540085b729f433","observation_id":"00570187-611f-4a24-8219-5899ed7363f1","resolution":{"observed_at":"2026-08-07T12:40:24.930772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1612.03975","last_updated":"2018-12-11T16:27:17Z","snapshot_observed_at":"2026-07-06T05:22:25.273447Z","submitted_at":"2016-12-12T23:54:52Z","title":"ConceptNet 5.5: An Open Multilingual Graph of General Knowledge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1612.03975","snapshot_observed_at":"2026-08-07T12:40:25.039599Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-07T21:48:16.475478Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:25.039599Z"},"links":{"cited_paper":"/paper/1612.03975","citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:0354d88ad02484172a316102d038d5bb7c55b024d14d1595de2882b3775deaaa","observation_id":"095d3917-8746-411d-af70-811b98c2edc7","resolution":{"observed_at":"2026-08-07T12:40:25.039599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12183","last_updated":"2025-05-07T18:00:45Z","snapshot_observed_at":"2026-08-01T16:38:42.947080Z","submitted_at":"2024-09-18T17:55:00Z","title":"To CoT or not to CoT? Chain-of-thought helps mainly on math and symbolic reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12183","snapshot_observed_at":"2026-08-07T12:40:25.116324Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-07T21:48:16.475478Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:25.116324Z"},"links":{"cited_paper":"/paper/2409.12183","citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:2e7539b708027b4eca93dcdb8ea57219c44b5f59640016879b8bed44bf0af97f","observation_id":"12763add-803e-4d01-b0af-2d0cc0ac8fa8","resolution":{"observed_at":"2026-08-07T12:40:25.116324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.00937","last_updated":"2019-03-15T18:02:58Z","snapshot_observed_at":"2026-08-04T21:50:24.483867Z","submitted_at":"2018-11-02T15:34:29Z","title":"CommonsenseQA: A Question Answering Challenge Targeting Commonsense Knowledge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.00937","snapshot_observed_at":"2026-08-07T12:40:25.216295Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-07T21:48:16.475478Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:25.216295Z"},"links":{"cited_paper":"/paper/1811.00937","citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:e79ffe2cc37c8179bfcde5df78b88f0e1f34f754f4cd94ef0d40df34b02ca2c7","observation_id":"b27329ce-cb66-49f2-9255-abf8fc2f0679","resolution":{"observed_at":"2026-08-07T12:40:25.216295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T12:40:25.323189Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-07T21:48:16.475478Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:25.323189Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:f9094887cb16d61eb03ee11044128e07b68fa4c20d88f8f05e9214ba07ee6a9a","observation_id":"2d2074c2-1477-4ada-9528-de233adf634f","resolution":{"observed_at":"2026-08-07T12:40:25.323189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.00537","last_updated":"2020-02-13T00:28:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-05-02T00:41:50Z","title":"SuperGLUE: A Stickier Benchmark for General-Purpose Language Understanding Systems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.00537","snapshot_observed_at":"2026-08-07T12:40:25.533618Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-07T21:48:16.475478Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:25.533618Z"},"links":{"cited_paper":"/paper/1905.00537","citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:b581adebda16a2ae3070eb4c3e9990514ea9c0cebe13c1df0099efe5d01ecb9a","observation_id":"4dcbe3fe-33e6-4846-9bad-65b86dd06fa6","resolution":{"observed_at":"2026-08-07T12:40:25.533618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01562","last_updated":"2023-04-06T23:49:35Z","snapshot_observed_at":"2026-08-03T08:21:21.325360Z","submitted_at":"2022-11-03T02:55:54Z","title":"PINTO: Faithful Language Reasoning Using Prompt-Generated Rationales","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01562","snapshot_observed_at":"2026-08-07T12:40:25.631368Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-07T21:48:16.475478Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:25.631368Z"},"links":{"cited_paper":"/paper/2211.01562","citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:bfcefdf981e6d5dd4737d84fde0a447c78161f38d92ffd32c57224662180bb00","observation_id":"462cfb3a-0f95-4934-9d1a-ff179df4481a","resolution":{"observed_at":"2026-08-07T12:40:25.631368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-07-06T12:50:22.773056Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-07T12:40:25.760065Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-07T21:48:16.475478Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:25.760065Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:e783f4faab14f9728c9433f3e02a3cc78be3c79561b324baf6482cac404d1b5d","observation_id":"dcc9c0e4-4c24-4f64-a5d2-4dd864de52b9","resolution":{"observed_at":"2026-08-07T12:40:25.760065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11903","last_updated":"2023-01-10T23:07:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-01-28T02:33:07Z","title":"Chain-of-Thought Prompting Elicits Reasoning in Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.11903","snapshot_observed_at":"2026-08-07T12:40:25.907355Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-07T21:48:16.475478Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:25.907355Z"},"links":{"cited_paper":"/paper/2201.11903","citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:fa41484c0ef664b8c43b8f32e1e051936f249d02b8a8194629519f5b17a3cb16","observation_id":"7ecdca65-0108-400a-b15a-f9b1e5d7e4c8","resolution":{"observed_at":"2026-08-07T12:40:25.907355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.03117","last_updated":"2023-05-22T05:20:04Z","snapshot_observed_at":"2026-07-06T15:23:29.240615Z","submitted_at":"2023-05-04T19:31:50Z","title":"Are Human Explanations Always Helpful? Towards Objective Evaluation of Human Natural Language Explanations","version":2},"cited_work":{"arxiv_id":"2305.03117","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.03117","snapshot_observed_at":"2026-08-07T12:40:26.945839Z","title":"Are Human Explanations Always Helpful? Towards Objective Evaluation of Human Natural Language Explanations","venue":"cs.CL","work_id":"3c1c0be8-c662-4a57-9177-fb450c03b1f7","year":2023},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-07T21:48:16.475478Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:25.997416Z"},"links":{"cited_paper":"/paper/2305.03117","citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:c86b95daf0b9e7dd9b1f088c806113e979809dc701cf4506c261dac261309aeb","observation_id":"40dd2405-2a69-490a-b677-efd1ac8a51fc","resolution":{"observed_at":"2026-08-07T12:40:27.015667Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:26.067413Z","title":null,"venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-07T21:48:16.475478Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:26.067413Z"},"links":{"citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:c7e80cc4eb13600218464cc8f9eeea35e5c9268d2546ed239c6584cb1659ca91","observation_id":"b536e245-d0fa-497e-adb3-06c316f44fdd","resolution":{"observed_at":"2026-08-07T12:40:26.067413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:26.195150Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-07T21:48:16.475478Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:26.195150Z"},"links":{"citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:d243d49af83746c019cc5b30b1e3336da769e0b967806e43feb2ff616662b438","observation_id":"6690da1f-68b7-4a73-892a-147b45a4e27e","resolution":{"observed_at":"2026-08-07T12:40:26.195150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:26.350229Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-07T21:48:16.475478Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:26.350229Z"},"links":{"citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:2896d9652ef3e3911b27918b7053f7f13fb743b05b0379ac1596cefbc9164194","observation_id":"d0dbb333-3f45-44e5-b7b9-b5790291ec42","resolution":{"observed_at":"2026-08-07T12:40:26.350229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.01130","last_updated":"2019-04-01T22:21:14Z","snapshot_observed_at":"2026-07-06T07:43:12.012344Z","submitted_at":"2019-04-01T22:21:14Z","title":"PAWS: Paraphrase Adversaries from Word Scrambling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.01130","snapshot_observed_at":"2026-08-07T12:40:26.482188Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-07T21:48:16.475478Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:26.482188Z"},"links":{"cited_paper":"/paper/1904.01130","citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:67dbf3d188025ac2c6ca0ad300190a814fec841a4e1e76b7dc42e0b1e8449837","observation_id":"d0fb600b-51b0-4f95-a85a-c1f343441d17","resolution":{"observed_at":"2026-08-07T12:40:26.482188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:26.595287Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-07T21:48:16.475478Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:26.595287Z"},"links":{"citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:e760358090abc407603c5b01b143edf02866f894ec82bb6fa4fc8e3c6ffa71f2","observation_id":"fab1b627-0bfa-4555-9478-4047dc0cb1a6","resolution":{"observed_at":"2026-08-07T12:40:26.595287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:26.667293Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-07T21:48:16.475478Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:26.667293Z"},"links":{"citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:24949c5edc8abd8fca46add6b5cd9467bedc79ac04eebd907b71555a802303df","observation_id":"0be44cce-6a99-4ae4-8fb1-142526a1010d","resolution":{"observed_at":"2026-08-07T12:40:26.667293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:26.743983Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","snapshot_observed_at":"2026-08-07T21:48:16.475478Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:26.743983Z"},"links":{"citing_paper":"/paper/2505.24147"},"observation_digest":"sha256:51991613e1717b384778ad344a93cf8d254daf17d8e124798e052b1fb5c56384","observation_id":"d084c7b1-cc74-4273-b5d3-a193c4244004","resolution":{"observed_at":"2026-08-07T12:40:26.743983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.24147","last_updated":"2025-05-30T02:39:37Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T21:48:16.475478Z","submitted_at":"2025-05-30T02:39:37Z","title":"Rationales Are Not Silver Bullets: Measuring the Impact of Rationales on Model Performance and Reliability"},"reference_resolution":{"displayed":63,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":62,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":63},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 63 of 63 outbound references and 1 inbound Pith citation observation for arXiv:2505.24147."}