{"as_of":"2026-08-08T01:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8752ff3671f883dc96105ef36a2217701ac4e897ea93a2f9b703bb59095b5a46","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:32:33.493899Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.02204/citation-record","integrity":"/paper/2506.02204/integrity","json":"/paper/2506.02204/citation-record.json","paper":"/paper/2506.02204"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2001.09977","last_updated":"2020-02-27T07:36:47Z","snapshot_observed_at":"2026-08-04T13:03:06.820772Z","submitted_at":"2020-01-27T18:53:15Z","title":"Towards a Human-like Open-Domain Chatbot","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.09977","snapshot_observed_at":"2026-08-07T11:32:30.387732Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.02204","last_updated":"2025-06-09T23:17:27Z","snapshot_observed_at":"2026-08-07T11:26:19.883314Z","submitted_at":"2025-06-02T19:44:06Z","title":"BehaviorBox: Automated Discovery of Fine-Grained Performance Differences Between Language Models","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:30.387732Z"},"links":{"cited_paper":"/paper/2001.09977","citing_paper":"/paper/2506.02204"},"observation_digest":"sha256:b5dd6a0be3702d3f9c87515648486569299ab3423e4e43add27a7f7e2eadc386","observation_id":"b90793ed-24ab-4917-8a99-217bcf350a10","resolution":{"observed_at":"2026-08-07T11:32:30.387732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.08375","last_updated":"2026-04-14T12:21:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-22T14:30:17Z","title":"Deep Learning using Rectified Linear Units (ReLU)","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.08375","snapshot_observed_at":"2026-08-07T11:32:30.455420Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.02204","last_updated":"2025-06-09T23:17:27Z","snapshot_observed_at":"2026-08-07T11:26:19.883314Z","submitted_at":"2025-06-02T19:44:06Z","title":"BehaviorBox: Automated Discovery of Fine-Grained Performance Differences Between Language Models","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:30.455420Z"},"links":{"cited_paper":"/paper/1803.08375","citing_paper":"/paper/2506.02204"},"observation_digest":"sha256:fba370d67912517b69accb8528d9aa1f12be556d9ec1c4108ce4c29506f64f2e","observation_id":"5ca4bc87-a907-4082-8d4f-d66e771a238a","resolution":{"observed_at":"2026-08-07T11:32:30.455420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:30.509887Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02204","last_updated":"2025-06-09T23:17:27Z","snapshot_observed_at":"2026-08-07T11:26:19.883314Z","submitted_at":"2025-06-02T19:44:06Z","title":"BehaviorBox: Automated Discovery of Fine-Grained Performance Differences Between Language Models","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:30.509887Z"},"links":{"citing_paper":"/paper/2506.02204"},"observation_digest":"sha256:9a14bdc22361535dde125e3ef5c82048c70e90a74e277556bcbac9bbe63fefeb","observation_id":"6a5507af-5736-479d-8989-2b5039181798","resolution":{"observed_at":"2026-08-07T11:32:30.509887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:35.630923Z","title":null,"venue":null,"work_id":"dcb58a34-6524-45ce-968e-65a35f44a715","year":2022},"citing_paper":{"arxiv_id":"2506.02204","last_updated":"2025-06-09T23:17:27Z","snapshot_observed_at":"2026-08-07T11:26:19.883314Z","submitted_at":"2025-06-02T19:44:06Z","title":"BehaviorBox: Automated Discovery of Fine-Grained Performance Differences Between Language Models","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:30.576646Z"},"links":{"citing_paper":"/paper/2506.02204"},"observation_digest":"sha256:900ad515b901ed9ce42dfdeb650c4edf79ef81127fd645a92802e221351a7a19","observation_id":"9c9effec-752e-41ff-b8ca-4e86bc3f5c03","resolution":{"observed_at":"2026-08-07T11:32:35.720342Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-07T11:32:30.646154Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.02204","last_updated":"2025-06-09T23:17:27Z","snapshot_observed_at":"2026-08-07T11:26:19.883314Z","submitted_at":"2025-06-02T19:44:06Z","title":"BehaviorBox: Automated Discovery of Fine-Grained Performance Differences Between Language Models","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:30.646154Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2506.02204"},"observation_digest":"sha256:4c7277638a26a5c91c976cbde08f8d5cc6faff52412612b72a2f1d91e70c0476","observation_id":"b6faf503-bc86-4292-8c59-28f7bcbff349","resolution":{"observed_at":"2026-08-07T11:32:30.646154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:30.729007Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02204","last_updated":"2025-06-09T23:17:27Z","snapshot_observed_at":"2026-08-07T11:26:19.883314Z","submitted_at":"2025-06-02T19:44:06Z","title":"BehaviorBox: Automated Discovery of Fine-Grained Performance Differences Between Language Models","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:30.729007Z"},"links":{"citing_paper":"/paper/2506.02204"},"observation_digest":"sha256:78e83f7688bb96a1d071da52690229083618d2f8a6f91b65aabe90201210f2ae","observation_id":"2c9f37c8-11f3-4e93-a8a5-a72c350a845d","resolution":{"observed_at":"2026-08-07T11:32:30.729007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:30.796810Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02204","last_updated":"2025-06-09T23:17:27Z","snapshot_observed_at":"2026-08-07T11:26:19.883314Z","submitted_at":"2025-06-02T19:44:06Z","title":"BehaviorBox: Automated Discovery of Fine-Grained Performance Differences Between Language Models","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:30.796810Z"},"links":{"citing_paper":"/paper/2506.02204"},"observation_digest":"sha256:4bce8cded42a45ef6cdde3c3f30e1e31baf5e5cf5afcc023fc2c75050dc303f5","observation_id":"d6d454d3-a0ed-4d90-9b7c-d361db7b2ac0","resolution":{"observed_at":"2026-08-07T11:32:30.796810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:35.347079Z","title":null,"venue":null,"work_id":"6067c050-0283-46c9-867e-a97a713da519","year":2016},"citing_paper":{"arxiv_id":"2506.02204","last_updated":"2025-06-09T23:17:27Z","snapshot_observed_at":"2026-08-07T11:26:19.883314Z","submitted_at":"2025-06-02T19:44:06Z","title":"BehaviorBox: Automated Discovery of Fine-Grained Performance Differences Between Language Models","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:30.871280Z"},"links":{"citing_paper":"/paper/2506.02204"},"observation_digest":"sha256:77814e7a3fdc0869b63957de59891b02dd3ffcca05b9d3ed33e4bb023c4355c4","observation_id":"a4d4c44b-623a-45b9-97a3-34b36e511d73","resolution":{"observed_at":"2026-08-07T11:32:35.496121Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:34.937316Z","title":null,"venue":null,"work_id":"cc97eb0e-b3a9-491b-b802-b69121a2059b","year":2018},"citing_paper":{"arxiv_id":"2506.02204","last_updated":"2025-06-09T23:17:27Z","snapshot_observed_at":"2026-08-07T11:26:19.883314Z","submitted_at":"2025-06-02T19:44:06Z","title":"BehaviorBox: Automated Discovery of Fine-Grained Performance Differences Between Language Models","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:30.983742Z"},"links":{"citing_paper":"/paper/2506.02204"},"observation_digest":"sha256:7bb505c3696a9cf2a3121cbe22e945eb5ad0a5673f8aedbf50761e0870124063","observation_id":"00a006ad-9958-457f-9968-40686622c1fd","resolution":{"observed_at":"2026-08-07T11:32:35.144336Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.08600","last_updated":"2023-10-04T13:17:38Z","snapshot_observed_at":"2026-07-06T16:19:05.495349Z","submitted_at":"2023-09-15T17:56:55Z","title":"Sparse Autoencoders Find Highly Interpretable Features in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.08600","snapshot_observed_at":"2026-08-07T11:32:31.101286Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02204","last_updated":"2025-06-09T23:17:27Z","snapshot_observed_at":"2026-08-07T11:26:19.883314Z","submitted_at":"2025-06-02T19:44:06Z","title":"BehaviorBox: Automated Discovery of Fine-Grained Performance Differences Between Language Models","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:31.101286Z"},"links":{"cited_paper":"/paper/2309.08600","citing_paper":"/paper/2506.02204"},"observation_digest":"sha256:c002f1b4da570ea0c7f55e7948214c9c2e1056bce4921cc3c60a9d173e813540","observation_id":"9356aa0c-0fee-42e6-94c6-bfbb2286f6f7","resolution":{"observed_at":"2026-08-07T11:32:31.101286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:31.174897Z","title":"Wright, and Kevin Leyton-Brown","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02204","last_updated":"2025-06-09T23:17:27Z","snapshot_observed_at":"2026-08-07T11:26:19.883314Z","submitted_at":"2025-06-02T19:44:06Z","title":"BehaviorBox: Automated Discovery of Fine-Grained Performance Differences Between Language Models","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:31.174897Z"},"links":{"citing_paper":"/paper/2506.02204"},"observation_digest":"sha256:77c770324e68894f336a24ce49e5773399c1a26e411fd6934a393a774169b863","observation_id":"3c54bee8-b03c-4552-9f7a-20877cfb7a98","resolution":{"observed_at":"2026-08-07T11:32:31.174897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:34.713677Z","title":null,"venue":null,"work_id":"5c9c6af1-f51f-456d-a595-376ef4544734","year":2022},"citing_paper":{"arxiv_id":"2506.02204","last_updated":"2025-06-09T23:17:27Z","snapshot_observed_at":"2026-08-07T11:26:19.883314Z","submitted_at":"2025-06-02T19:44:06Z","title":"BehaviorBox: Automated Discovery of Fine-Grained Performance Differences Between Language Models","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:31.257042Z"},"links":{"citing_paper":"/paper/2506.02204"},"observation_digest":"sha256:6a98809d55faffd7c897aee3278040ce59090662d79d53dccbfe3d0e133ed7af","observation_id":"e959c9fa-49a5-4842-ac69-b31d7f666ad1","resolution":{"observed_at":"2026-08-07T11:32:34.775043Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23771","last_updated":"2025-07-27T14:45:02Z","snapshot_observed_at":"2026-08-03T10:49:26.615197Z","submitted_at":"2024-10-31T09:39:28Z","title":"What is Wrong with Perplexity for Long-context Language Modeling?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.23771","snapshot_observed_at":"2026-08-07T11:32:31.325398Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02204","last_updated":"2025-06-09T23:17:27Z","snapshot_observed_at":"2026-08-07T11:26:19.883314Z","submitted_at":"2025-06-02T19:44:06Z","title":"BehaviorBox: Automated Discovery of Fine-Grained Performance Differences Between Language Models","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:31.325398Z"},"links":{"cited_paper":"/paper/2410.23771","citing_paper":"/paper/2506.02204"},"observation_digest":"sha256:b6cd7c1e2cd4e36510df206ae425ffdbce0d37301d83e579e72d3761d89f4724","observation_id":"d806dfbb-19a7-441a-be91-e5c89c88849a","resolution":{"observed_at":"2026-08-07T11:32:31.325398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:31.404461Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.02204","last_updated":"2025-06-09T23:17:27Z","snapshot_observed_at":"2026-08-07T11:26:19.883314Z","submitted_at":"2025-06-02T19:44:06Z","title":"BehaviorBox: Automated Discovery of Fine-Grained Performance Differences Between Language Models","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:31.404461Z"},"links":{"citing_paper":"/paper/2506.02204"},"observation_digest":"sha256:773591c7828a2a7d14e11c8b8f909ef119c07169bf97d089f23f851d38e478ac","observation_id":"26498bb1-f496-4ee5-981c-a2d2327ca820","resolution":{"observed_at":"2026-08-07T11:32:31.404461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12892","last_updated":"2025-05-23T18:07:04Z","snapshot_observed_at":"2026-08-07T18:08:33.531583Z","submitted_at":"2025-02-18T14:29:11Z","title":"Archetypal SAE: Adaptive and Stable Dictionary Learning for Concept Extraction in Large Vision Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12892","snapshot_observed_at":"2026-08-07T11:32:31.498469Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02204","last_updated":"2025-06-09T23:17:27Z","snapshot_observed_at":"2026-08-07T11:26:19.883314Z","submitted_at":"2025-06-02T19:44:06Z","title":"BehaviorBox: Automated Discovery of Fine-Grained Performance Differences Between Language Models","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:31.498469Z"},"links":{"cited_paper":"/paper/2502.12892","citing_paper":"/paper/2506.02204"},"observation_digest":"sha256:215bfeed209a55a23737fdd6f8b9e2fbf8cbd3d662cd6474ad5448421221993c","observation_id":"f9e1d120-f8d1-4482-a32e-79b58df81d98","resolution":{"observed_at":"2026-08-07T11:32:31.498469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04093","last_updated":"2024-06-06T14:10:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-06T14:10:12Z","title":"Scaling and evaluating sparse autoencoders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04093","snapshot_observed_at":"2026-08-07T11:32:31.556480Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02204","last_updated":"2025-06-09T23:17:27Z","snapshot_observed_at":"2026-08-07T11:26:19.883314Z","submitted_at":"2025-06-02T19:44:06Z","title":"BehaviorBox: Automated Discovery of Fine-Grained Performance Differences Between Language Models","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:31.556480Z"},"links":{"cited_paper":"/paper/2406.04093","citing_paper":"/paper/2506.02204"},"observation_digest":"sha256:7a7d648c0f37d205dd69a199baf7cec16ae2aa702fb21162e6692bd1b5c2a784","observation_id":"6196930f-9655-4357-a026-9770a3a04c75","resolution":{"observed_at":"2026-08-07T11:32:31.556480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:31.651541Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02204","last_updated":"2025-06-09T23:17:27Z","snapshot_observed_at":"2026-08-07T11:26:19.883314Z","submitted_at":"2025-06-02T19:44:06Z","title":"BehaviorBox: Automated Discovery of Fine-Grained Performance Differences Between Language Models","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:31.651541Z"},"links":{"citing_paper":"/paper/2506.02204"},"observation_digest":"sha256:41e9c5b063b1c4656896d6a0d04d9b1d37660aaba3a939d07e3bf92c267c5024","observation_id":"c8a86e46-b4af-4838-8164-e2365af67d82","resolution":{"observed_at":"2026-08-07T11:32:31.651541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:31.735392Z","title":null,"venue":null,"work_id":null,"year":1977},"citing_paper":{"arxiv_id":"2506.02204","last_updated":"2025-06-09T23:17:27Z","snapshot_observed_at":"2026-08-07T11:26:19.883314Z","submitted_at":"2025-06-02T19:44:06Z","title":"BehaviorBox: Automated Discovery of Fine-Grained Performance Differences Between Language Models","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:31.735392Z"},"links":{"citing_paper":"/paper/2506.02204"},"observation_digest":"sha256:c9698f8f666f7058d3472f058a265f8ece155207bd8917f2863ec1f00f429c44","observation_id":"f6a23c9b-4852-4a83-ae16-3458b8fdfe07","resolution":{"observed_at":"2026-08-07T11:32:31.735392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-07T11:32:31.820709Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.02204","last_updated":"2025-06-09T23:17:27Z","snapshot_observed_at":"2026-08-07T11:26:19.883314Z","submitted_at":"2025-06-02T19:44:06Z","title":"BehaviorBox: Automated Discovery of Fine-Grained Performance Differences Between Language Models","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:31.820709Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2506.02204"},"observation_digest":"sha256:1b72cf0a2221ad0f96d43d7080acfeaa39afd9d1518083a506cf0907dbada2b0","observation_id":"1ae42265-3bfd-41aa-985f-1fe4ef20f8ce","resolution":{"observed_at":"2026-08-07T11:32:31.820709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02446","last_updated":"2024-07-02T17:22:54Z","snapshot_observed_at":"2026-07-06T18:40:27.299063Z","submitted_at":"2024-07-02T17:22:54Z","title":"Predicting vs. Acting: A Trade-off Between World Modeling & Agent Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02446","snapshot_observed_at":"2026-08-07T11:32:31.856755Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02204","last_updated":"2025-06-09T23:17:27Z","snapshot_observed_at":"2026-08-07T11:26:19.883314Z","submitted_at":"2025-06-02T19:44:06Z","title":"BehaviorBox: Automated Discovery of Fine-Grained Performance Differences Between Language Models","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:31.856755Z"},"links":{"cited_paper":"/paper/2407.02446","citing_paper":"/paper/2506.02204"},"observation_digest":"sha256:587414b7175859bfd5682b86310b87102185c8aaacc5146bb66a2e79f39d8b88","observation_id":"6a208eac-a134-4e61-a5bc-8d5cfb523b6d","resolution":{"observed_at":"2026-08-07T11:32:31.856755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05147","last_updated":"2024-08-19T07:51:05Z","snapshot_observed_at":"2026-08-04T11:44:14.524984Z","submitted_at":"2024-08-09T16:06:42Z","title":"Gemma Scope: Open Sparse Autoencoders Everywhere All At Once on Gemma 2","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.05147","snapshot_observed_at":"2026-08-07T11:32:31.922004Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02204","last_updated":"2025-06-09T23:17:27Z","snapshot_observed_at":"2026-08-07T11:26:19.883314Z","submitted_at":"2025-06-02T19:44:06Z","title":"BehaviorBox: Automated Discovery of Fine-Grained Performance Differences Between Language Models","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:31.922004Z"},"links":{"cited_paper":"/paper/2408.05147","citing_paper":"/paper/2506.02204"},"observation_digest":"sha256:40b15de1318076bd18707a663b064b200ef5bd9cbcd9374bb3b824e2989ecc24","observation_id":"6190e1b7-d4ce-4800-9123-c51396bdc8d4","resolution":{"observed_at":"2026-08-07T11:32:31.922004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:32.042089Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.02204","last_updated":"2025-06-09T23:17:27Z","snapshot_observed_at":"2026-08-07T11:26:19.883314Z","submitted_at":"2025-06-02T19:44:06Z","title":"BehaviorBox: Automated Discovery of Fine-Grained Performance Differences Between Language Models","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:32.042089Z"},"links":{"citing_paper":"/paper/2506.02204"},"observation_digest":"sha256:116c767be600945b5f0cdcbeb36dd95d5497c9c6c5387ef6507905421ffb3f60","observation_id":"98fc0440-1658-44ca-8762-45935ceaeb53","resolution":{"observed_at":"2026-08-07T11:32:32.042089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:32.093503Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02204","last_updated":"2025-06-09T23:17:27Z","snapshot_observed_at":"2026-08-07T11:26:19.883314Z","submitted_at":"2025-06-02T19:44:06Z","title":"BehaviorBox: Automated Discovery of Fine-Grained Performance Differences Between Language Models","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:32.093503Z"},"links":{"citing_paper":"/paper/2506.02204"},"observation_digest":"sha256:fc134a1b046ccc59914a3a93ecbad64e232d2d80897aa7355e56c4da9e76f9b4","observation_id":"bd29ee27-c979-46cb-8dc3-1a381cc3d306","resolution":{"observed_at":"2026-08-07T11:32:32.093503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:32.177010Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.02204","last_updated":"2025-06-09T23:17:27Z","snapshot_observed_at":"2026-08-07T11:26:19.883314Z","submitted_at":"2025-06-02T19:44:06Z","title":"BehaviorBox: Automated Discovery of Fine-Grained Performance Differences Between Language Models","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:32.177010Z"},"links":{"citing_paper":"/paper/2506.02204"},"observation_digest":"sha256:ed7c5fe6721e1c0e0ce5982ddc4ab2b6cb7ed79bde6767cade6c1944ae8d1419","observation_id":"750abd68-540b-4a14-ae58-d1f175e64271","resolution":{"observed_at":"2026-08-07T11:32:32.177010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:32.220045Z","title":"Lundberg and Su-In Lee","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.02204","last_updated":"2025-06-09T23:17:27Z","snapshot_observed_at":"2026-08-07T11:26:19.883314Z","submitted_at":"2025-06-02T19:44:06Z","title":"BehaviorBox: Automated Discovery of Fine-Grained Performance Differences Between Language Models","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:32.220045Z"},"links":{"citing_paper":"/paper/2506.02204"},"observation_digest":"sha256:a0952e1044e3bc1dd2ea42b4098d51b0dfc2ec6e3e9d803637d6d98f9fedaece","observation_id":"b198a365-d1f6-4e0e-9268-6049902c26d3","resolution":{"observed_at":"2026-08-07T11:32:32.220045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:34.561486Z","title":null,"venue":null,"work_id":"fd610d61-a015-4c29-9771-e58b55f97777","year":1967},"citing_paper":{"arxiv_id":"2506.02204","last_updated":"2025-06-09T23:17:27Z","snapshot_observed_at":"2026-08-07T11:26:19.883314Z","submitted_at":"2025-06-02T19:44:06Z","title":"BehaviorBox: Automated Discovery of Fine-Grained Performance Differences Between Language Models","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:32.290285Z"},"links":{"citing_paper":"/paper/2506.02204"},"observation_digest":"sha256:2a432aa7483c3d4aef0fd58cfc2db471362ec9f914af19feebe6270174297f13","observation_id":"fa239c2d-0b86-47f0-b1d6-4e605b1c1684","resolution":{"observed_at":"2026-08-07T11:32:34.603654Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10523","last_updated":"2024-12-07T20:22:22Z","snapshot_observed_at":"2026-07-06T17:04:05.327440Z","submitted_at":"2023-12-16T19:12:45Z","title":"Paloma: A Benchmark for Evaluating Language Model Fit","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10523","snapshot_observed_at":"2026-08-07T11:32:32.328243Z","title":"Jha, Oyvind Tafjord, Dustin Schwenk, Pete Walsh, Yanai Elazar, Kyle Lo, Dirk Groeneveld, Iz Beltagy, Hanna Hajishirzi, Noah A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02204","last_updated":"2025-06-09T23:17:27Z","snapshot_observed_at":"2026-08-07T11:26:19.883314Z","submitted_at":"2025-06-02T19:44:06Z","title":"BehaviorBox: Automated Discovery of Fine-Grained Performance Differences Between Language Models","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:32.328243Z"},"links":{"cited_paper":"/paper/2312.10523","citing_paper":"/paper/2506.02204"},"observation_digest":"sha256:9cfa8339b1efdd945a0f1eb87c4aa6c19ec56988c11a96b8e760932c59a4b067","observation_id":"b4c218e1-c0d2-44ec-9db0-abb429d0eee4","resolution":{"observed_at":"2026-08-07T11:32:32.328243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.5663","last_updated":"2014-03-22T17:12:07Z","snapshot_observed_at":"2026-08-01T16:20:01.675800Z","submitted_at":"2013-12-19T17:46:46Z","title":"k-Sparse Autoencoders","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.5663","snapshot_observed_at":"2026-08-07T11:32:32.372507Z","title":null,"venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2506.02204","last_updated":"2025-06-09T23:17:27Z","snapshot_observed_at":"2026-08-07T11:26:19.883314Z","submitted_at":"2025-06-02T19:44:06Z","title":"BehaviorBox: Automated Discovery of Fine-Grained Performance Differences Between Language Models","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:32.372507Z"},"links":{"cited_paper":"/paper/1312.5663","citing_paper":"/paper/2506.02204"},"observation_digest":"sha256:9b5dfccbc1d3c823308deb9b089c9d5ad3840cc1707ae3e75df9dc90ff23f373","observation_id":"9e1387f9-073c-4dbe-99c5-90fb34390349","resolution":{"observed_at":"2026-08-07T11:32:32.372507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:32.456061Z","title":null,"venue":null,"work_id":null,"year":1947},"citing_paper":{"arxiv_id":"2506.02204","last_updated":"2025-06-09T23:17:27Z","snapshot_observed_at":"2026-08-07T11:26:19.883314Z","submitted_at":"2025-06-02T19:44:06Z","title":"BehaviorBox: Automated Discovery of Fine-Grained Performance Differences Between Language Models","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:32.456061Z"},"links":{"citing_paper":"/paper/2506.02204"},"observation_digest":"sha256:a20c5cf30f04a48e9b4d88307685653e9d21056581c1deb84a0701f02e6ebea5","observation_id":"22fe38ca-521a-46cb-a6db-f839eb501990","resolution":{"observed_at":"2026-08-07T11:32:32.456061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04382","last_updated":"2025-06-06T18:34:19Z","snapshot_observed_at":"2026-07-06T20:32:28.465641Z","submitted_at":"2025-02-05T18:58:02Z","title":"Sparse Autoencoders for Hypothesis Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04382","snapshot_observed_at":"2026-08-07T11:32:32.518082Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02204","last_updated":"2025-06-09T23:17:27Z","snapshot_observed_at":"2026-08-07T11:26:19.883314Z","submitted_at":"2025-06-02T19:44:06Z","title":"BehaviorBox: Automated Discovery of Fine-Grained Performance Differences Between Language Models","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:32.518082Z"},"links":{"cited_paper":"/paper/2502.04382","citing_paper":"/paper/2506.02204"},"observation_digest":"sha256:6b2dd08a8c330147793644a542032b1acb6fbdc5b9a4c3d3305a9c39953b4145","observation_id":"e22996ef-1270-4ae0-b499-f0af8c9bc356","resolution":{"observed_at":"2026-08-07T11:32:32.518082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00656","last_updated":"2025-10-08T07:50:45Z","snapshot_observed_at":"2026-07-06T20:15:22.511263Z","submitted_at":"2024-12-31T21:55:10Z","title":"2 OLMo 2 Furious","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00656","snapshot_observed_at":"2026-08-07T11:32:32.586962Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02204","last_updated":"2025-06-09T23:17:27Z","snapshot_observed_at":"2026-08-07T11:26:19.883314Z","submitted_at":"2025-06-02T19:44:06Z","title":"BehaviorBox: Automated Discovery of Fine-Grained Performance Differences Between Language Models","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:32.586962Z"},"links":{"cited_paper":"/paper/2501.00656","citing_paper":"/paper/2506.02204"},"observation_digest":"sha256:5534390117b88130b0fafe5d66c11c44fbda456ab66eadd90fc410a40685c2ef","observation_id":"c7a97efb-ba89-43b4-8c69-c294a59ce2a4","resolution":{"observed_at":"2026-08-07T11:32:32.586962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:32.697869Z","title":"why should i trust you?","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.02204","last_updated":"2025-06-09T23:17:27Z","snapshot_observed_at":"2026-08-07T11:26:19.883314Z","submitted_at":"2025-06-02T19:44:06Z","title":"BehaviorBox: Automated Discovery of Fine-Grained Performance Differences Between Language Models","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:32.697869Z"},"links":{"citing_paper":"/paper/2506.02204"},"observation_digest":"sha256:ddb249cac4d5e425350980f2ea6a45061e99fcaf711a181c06c70ca619081195","observation_id":"e03158a7-45b2-4d6a-ad1b-3507f75dfb40","resolution":{"observed_at":"2026-08-07T11:32:32.697869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:32.773068Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.02204","last_updated":"2025-06-09T23:17:27Z","snapshot_observed_at":"2026-08-07T11:26:19.883314Z","submitted_at":"2025-06-02T19:44:06Z","title":"BehaviorBox: Automated Discovery of Fine-Grained Performance Differences Between Language Models","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:32.773068Z"},"links":{"citing_paper":"/paper/2506.02204"},"observation_digest":"sha256:e91e31724fc8b6d3fe1cba1bcfe451218703531cdff6b76d76c56f51742fc6ba","observation_id":"9295b773-42d0-48fa-b5a9-a1ee5ab6dd1b","resolution":{"observed_at":"2026-08-07T11:32:32.773068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:34.403728Z","title":null,"venue":null,"work_id":"34ddd604-a496-4daf-bbe5-c7845d9a7581","year":2023},"citing_paper":{"arxiv_id":"2506.02204","last_updated":"2025-06-09T23:17:27Z","snapshot_observed_at":"2026-08-07T11:26:19.883314Z","submitted_at":"2025-06-02T19:44:06Z","title":"BehaviorBox: Automated Discovery of Fine-Grained Performance Differences Between Language Models","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:32.849107Z"},"links":{"citing_paper":"/paper/2506.02204"},"observation_digest":"sha256:6a345dfdc7f48283af7895f215391898033f17373247bedbedd951f4252161b1","observation_id":"ac1fba95-4f9c-4244-b2a3-b67759ad9fd6","resolution":{"observed_at":"2026-08-07T11:32:34.464013Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:34.230452Z","title":null,"venue":null,"work_id":"e0a31916-801d-44ef-a3ce-704500b4a8a6","year":2020},"citing_paper":{"arxiv_id":"2506.02204","last_updated":"2025-06-09T23:17:27Z","snapshot_observed_at":"2026-08-07T11:26:19.883314Z","submitted_at":"2025-06-02T19:44:06Z","title":"BehaviorBox: Automated Discovery of Fine-Grained Performance Differences Between Language Models","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:32.894663Z"},"links":{"citing_paper":"/paper/2506.02204"},"observation_digest":"sha256:968aa3d733428b22a7299a04841d23e0fdfa4f4cc4a7808e71335cfe48caf67a","observation_id":"91270226-2f16-490a-b4f7-755027990324","resolution":{"observed_at":"2026-08-07T11:32:34.341292Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00159","last_updated":"2024-06-06T18:46:40Z","snapshot_observed_at":"2026-07-06T17:23:22.706195Z","submitted_at":"2024-01-31T20:29:50Z","title":"Dolma: an Open Corpus of Three Trillion Tokens for Language Model Pretraining Research","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00159","snapshot_observed_at":"2026-08-07T11:32:32.979857Z","title":"Peters, Abhilasha Ravichander, Kyle Richardson, Zejiang Shen, Emma Strubell, Nishant Subramani, Oyvind Tafjord, Pete Walsh, Luke Zettlemoyer, Noah A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02204","last_updated":"2025-06-09T23:17:27Z","snapshot_observed_at":"2026-08-07T11:26:19.883314Z","submitted_at":"2025-06-02T19:44:06Z","title":"BehaviorBox: Automated Discovery of Fine-Grained Performance Differences Between Language Models","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:32.979857Z"},"links":{"cited_paper":"/paper/2402.00159","citing_paper":"/paper/2506.02204"},"observation_digest":"sha256:ceefe783779150f5d137676d05eb090eb92eaf6216d8384c230964408605c2e9","observation_id":"89ed208d-bbd8-4b75-9185-b47e5c119f9b","resolution":{"observed_at":"2026-08-07T11:32:32.979857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T11:32:33.048665Z","title":"Stone, Peter Albert, Amjad Almahairi, Yasmine Babaei, Nikolay Bashlykov, Soumya Batra, Prajjwal Bhargava, Shruti Bhosale, Daniel M","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02204","last_updated":"2025-06-09T23:17:27Z","snapshot_observed_at":"2026-08-07T11:26:19.883314Z","submitted_at":"2025-06-02T19:44:06Z","title":"BehaviorBox: Automated Discovery of Fine-Grained Performance Differences Between Language Models","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:33.048665Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2506.02204"},"observation_digest":"sha256:92ab5680d1537f691d99f4c66bd60925cf6bc8072b939f84d6ce53da594f8cc4","observation_id":"05657507-bd86-4d91-b910-a2ef2ca5cdfe","resolution":{"observed_at":"2026-08-07T11:32:33.048665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:33.107245Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.02204","last_updated":"2025-06-09T23:17:27Z","snapshot_observed_at":"2026-08-07T11:26:19.883314Z","submitted_at":"2025-06-02T19:44:06Z","title":"BehaviorBox: Automated Discovery of Fine-Grained Performance Differences Between Language Models","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:33.107245Z"},"links":{"citing_paper":"/paper/2506.02204"},"observation_digest":"sha256:552240ba2498793c4053a5c0a14a3d4fd7a6e6d737d79d53099b340f1dd021cb","observation_id":"69591c4d-718a-48fb-8ae1-0dbb3a51e0d2","resolution":{"observed_at":"2026-08-07T11:32:33.107245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:33.232385Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02204","last_updated":"2025-06-09T23:17:27Z","snapshot_observed_at":"2026-08-07T11:26:19.883314Z","submitted_at":"2025-06-02T19:44:06Z","title":"BehaviorBox: Automated Discovery of Fine-Grained Performance Differences Between Language Models","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:33.232385Z"},"links":{"citing_paper":"/paper/2506.02204"},"observation_digest":"sha256:c8659b67ee1c68e7383dd815541a2f8297128407dfdcee205f315c03fd76501f","observation_id":"a11d6189-b3e3-425a-a0a6-163d507857ca","resolution":{"observed_at":"2026-08-07T11:32:33.232385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:33.439872Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02204","last_updated":"2025-06-09T23:17:27Z","snapshot_observed_at":"2026-08-07T11:26:19.883314Z","submitted_at":"2025-06-02T19:44:06Z","title":"BehaviorBox: Automated Discovery of Fine-Grained Performance Differences Between Language Models","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:33.439872Z"},"links":{"citing_paper":"/paper/2506.02204"},"observation_digest":"sha256:df995d557c3e11bc987e5d8477f4a5ee6fc6d634ca1f1d5c1bf020170b155ce5","observation_id":"fce78916-08af-43fc-aed4-34a5549a9bb4","resolution":{"observed_at":"2026-08-07T11:32:33.439872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:32:33.493899Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02204","last_updated":"2025-06-09T23:17:27Z","snapshot_observed_at":"2026-08-07T11:26:19.883314Z","submitted_at":"2025-06-02T19:44:06Z","title":"BehaviorBox: Automated Discovery of Fine-Grained Performance Differences Between Language Models","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T11:32:33.493899Z"},"links":{"citing_paper":"/paper/2506.02204"},"observation_digest":"sha256:7b52bc46e559215785a703b0260e51528334d2dd3220bbb60ceed8a5b0aeec9f","observation_id":"e704057e-cc5c-4f8d-b668-4e84aac29bd9","resolution":{"observed_at":"2026-08-07T11:32:33.493899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.02204","last_updated":"2025-06-09T23:17:27Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T11:26:19.883314Z","submitted_at":"2025-06-02T19:44:06Z","title":"BehaviorBox: Automated Discovery of Fine-Grained Performance Differences Between Language Models"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":41,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 0 inbound Pith citation observations for arXiv:2506.02204."}