{"as_of":"2026-08-07T16:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c699ecfa8540c6307bece6c548e58abaab9b95b7bb5fa3fda62586093d9fbdd1","coverage":[{"denominator":20,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":20,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T06:05:51.822157Z","state":"measured"},{"denominator":21,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":21,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T11:55:28.165189Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T11:55:28.599019Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2607.22043","last_updated":"2026-07-24T07:13:52Z","snapshot_observed_at":"2026-08-07T14:08:17.400557Z","submitted_at":"2026-07-24T07:13:52Z","title":"Scaling Native Multimodal Pre-Training From Scratch","version":1},"cited_work":{"arxiv_id":"2607.22043","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.22043","snapshot_observed_at":"2026-08-06T11:55:28.599019Z","title":"Scaling Native Multimodal Pre-Training From Scratch","venue":"cs.CL","work_id":"c45bc376-7111-4477-b135-5e362f469216","year":2026},"citing_paper":{"arxiv_id":"2608.05000","last_updated":"2026-08-06T17:18:02Z","snapshot_observed_at":"2026-08-07T15:31:00.572516Z","submitted_at":"2026-08-05T16:09:25Z","title":"Towards Physics of Multimodal Pretraining: Knowledge Flow, Modality Synergy, Early Unification, and Recipes","version":1},"reference_index":137,"source":"pdf_text","source_observed_at":"2026-08-06T11:55:28.165189Z"},"links":{"cited_paper":"/paper/2607.22043","citing_paper":"/paper/2608.05000"},"observation_digest":"sha256:baf70f363ef40631abd1326224447847dabb5d3ba88c7c695656e9f980f39e6d","observation_id":"41f0d0e1-821b-4096-8db3-3eb8253c53e9","resolution":{"observed_at":"2026-08-06T11:55:28.602138Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2607.22043/citation-record","integrity":"/paper/2607.22043/integrity","json":"/paper/2607.22043/citation-record.json","paper":"/paper/2607.22043"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:05:51.822157Z","title":"B Experiment Results This section details the comprehensive per-benchmark results supporting the analyses presented in Section 4, organized into three primary categories","venue":null,"work_id":null,"year":2048},"citing_paper":{"arxiv_id":"2607.22043","last_updated":"2026-07-24T07:13:52Z","snapshot_observed_at":"2026-08-07T14:08:17.400557Z","submitted_at":"2026-07-24T07:13:52Z","title":"Scaling Native Multimodal Pre-Training From Scratch","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T06:05:51.822157Z"},"links":{"citing_paper":"/paper/2607.22043"},"observation_digest":"sha256:57f0ee75009056e7504af51b2ff9162eab3d96c5e2cd47352589285c18cd935b","observation_id":"856c3335-7f7d-4384-b7a3-a456a6083ad4","resolution":{"observed_at":"2026-08-01T06:05:51.822157Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14739","last_updated":"2025-03-28T15:21:44Z","snapshot_observed_at":"2026-07-29T21:41:16.650188Z","submitted_at":"2025-02-20T17:05:58Z","title":"SuperGPQA: Scaling LLM Evaluation across 285 Graduate Disciplines","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14739","snapshot_observed_at":"2026-08-01T06:05:50.162416Z","title":"SuperGPQA: Scaling LLM Evaluation Across 285 Graduate Disciplines.arXiv preprint arXiv:2502.14739,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22043","last_updated":"2026-07-24T07:13:52Z","snapshot_observed_at":"2026-08-07T14:08:17.400557Z","submitted_at":"2026-07-24T07:13:52Z","title":"Scaling Native Multimodal Pre-Training From Scratch","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T06:05:50.162416Z"},"links":{"cited_paper":"/paper/2502.14739","citing_paper":"/paper/2607.22043"},"observation_digest":"sha256:9a3e75bb64be17825a614152b81d0b3f0fe4ed68c5bed3266fe19c6a17664d06","observation_id":"ead061e3-8709-4d91-b02a-fdde4282e2bf","resolution":{"observed_at":"2026-08-01T06:05:50.162416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.03551","last_updated":"2017-05-13T21:12:37Z","snapshot_observed_at":"2026-08-02T11:13:42.401488Z","submitted_at":"2017-05-09T21:35:07Z","title":"TriviaQA: A Large Scale Distantly Supervised Challenge Dataset for Reading Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.03551","snapshot_observed_at":"2026-08-01T06:05:50.526418Z","title":"TriviaQA: A Large Scale Distantly Supervised Challenge Dataset for Reading Comprehension.arXiv preprint arXiv:1705.03551,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22043","last_updated":"2026-07-24T07:13:52Z","snapshot_observed_at":"2026-08-07T14:08:17.400557Z","submitted_at":"2026-07-24T07:13:52Z","title":"Scaling Native Multimodal Pre-Training From Scratch","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T06:05:50.526418Z"},"links":{"cited_paper":"/paper/1705.03551","citing_paper":"/paper/2607.22043"},"observation_digest":"sha256:369b659f7eafd8123bdfb8f7baa19e2753de0906c31e1775ca5cfe8425af0c35","observation_id":"e85c9bb8-a03c-4297-808f-ef5efe7d45ef","resolution":{"observed_at":"2026-08-01T06:05:50.526418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09728","last_updated":"2019-09-09T17:29:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-04-22T05:36:37Z","title":"SocialIQA: Commonsense Reasoning about Social Interactions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09728","snapshot_observed_at":"2026-08-01T06:05:50.965502Z","title":"SocialiQA: Commonsense Reasoning about Social Interactions.arXiv preprint arXiv:1904.09728,","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2607.22043","last_updated":"2026-07-24T07:13:52Z","snapshot_observed_at":"2026-08-07T14:08:17.400557Z","submitted_at":"2026-07-24T07:13:52Z","title":"Scaling Native Multimodal Pre-Training From Scratch","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T06:05:50.965502Z"},"links":{"cited_paper":"/paper/1904.09728","citing_paper":"/paper/2607.22043"},"observation_digest":"sha256:e75dbe31b5f118ba994b61bee0a74d09fbbab5a69637c1ff882ab01b68449b48","observation_id":"bbd9c77e-1b29-4b8a-90f5-239837ed3207","resolution":{"observed_at":"2026-08-01T06:05:50.965502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06585","last_updated":"2025-09-09T04:46:37Z","snapshot_observed_at":"2026-08-05T23:02:46.819592Z","submitted_at":"2025-08-08T04:23:04Z","title":"CountQA: How Well Do MLLMs Count in the Wild?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.06585","snapshot_observed_at":"2026-08-01T06:05:51.176081Z","title":"CountQA: How Well Do MLLMs Count in the Wild?arXiv preprint arXiv:2508.06585,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22043","last_updated":"2026-07-24T07:13:52Z","snapshot_observed_at":"2026-08-07T14:08:17.400557Z","submitted_at":"2026-07-24T07:13:52Z","title":"Scaling Native Multimodal Pre-Training From Scratch","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T06:05:51.176081Z"},"links":{"cited_paper":"/paper/2508.06585","citing_paper":"/paper/2607.22043"},"observation_digest":"sha256:a63687790dae4612c7ff7283853694b2646da261e790e859731f98e112ab705d","observation_id":"84f1ed92-845b-42d2-b20c-d7589845fe0d","resolution":{"observed_at":"2026-08-01T06:05:51.176081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:05:51.300505Z","title":"Beyond Language Modeling: An Exploration of Multimodal Pretraining","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22043","last_updated":"2026-07-24T07:13:52Z","snapshot_observed_at":"2026-08-07T14:08:17.400557Z","submitted_at":"2026-07-24T07:13:52Z","title":"Scaling Native Multimodal Pre-Training From Scratch","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T06:05:51.300505Z"},"links":{"citing_paper":"/paper/2607.22043"},"observation_digest":"sha256:bc5830b443f1ca4d9ab530e5d86fcdfcfb11bc3c10dc429af12302a12e854456","observation_id":"614566c2-0175-4d9a-aa16-8704f6bdfed6","resolution":{"observed_at":"2026-08-01T06:05:51.300505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-08-01T06:05:51.388385Z","title":"SigLIP 2: Multilingual Vision- Language Encoders with Improved Semantic Understanding, Localization, and Dense Features.arXiv preprint arXiv:2502.14786,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22043","last_updated":"2026-07-24T07:13:52Z","snapshot_observed_at":"2026-08-07T14:08:17.400557Z","submitted_at":"2026-07-24T07:13:52Z","title":"Scaling Native Multimodal Pre-Training From Scratch","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T06:05:51.388385Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2607.22043"},"observation_digest":"sha256:8b9335795e338130021afb4bc01e85904404c379938bf703ca4fd7b1943f5342","observation_id":"be91083e-1d09-4308-a721-39023b8eb3ee","resolution":{"observed_at":"2026-08-01T06:05:51.388385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04973","last_updated":"2024-07-06T06:48:16Z","snapshot_observed_at":"2026-07-06T18:42:18.289966Z","submitted_at":"2024-07-06T06:48:16Z","title":"LogicVista: Multimodal LLM Logical Reasoning Benchmark in Visual Contexts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04973","snapshot_observed_at":"2026-08-01T06:05:51.483271Z","title":"Logicvista: Multimodal LLM Logical Reasoning Benchmark in Visual Contexts.arXiv preprint arXiv:2407.04973,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22043","last_updated":"2026-07-24T07:13:52Z","snapshot_observed_at":"2026-08-07T14:08:17.400557Z","submitted_at":"2026-07-24T07:13:52Z","title":"Scaling Native Multimodal Pre-Training From Scratch","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T06:05:51.483271Z"},"links":{"cited_paper":"/paper/2407.04973","citing_paper":"/paper/2607.22043"},"observation_digest":"sha256:484187d7b880b2a811773998452aff30ac0fdcdb0c5a0fc3ba4dff6f58f03cd2","observation_id":"37482601-c0a9-4281-8423-757addebef24","resolution":{"observed_at":"2026-08-01T06:05:51.483271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.07830","last_updated":"2019-05-19T23:57:23Z","snapshot_observed_at":"2026-07-31T00:09:56.948833Z","submitted_at":"2019-05-19T23:57:23Z","title":"HellaSwag: Can a Machine Really Finish Your Sentence?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.07830","snapshot_observed_at":"2026-08-01T06:05:51.578252Z","title":"Hellaswag: Can A Machine Really Finish Your Sentence?arXiv preprint arXiv:1905.07830,","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2607.22043","last_updated":"2026-07-24T07:13:52Z","snapshot_observed_at":"2026-08-07T14:08:17.400557Z","submitted_at":"2026-07-24T07:13:52Z","title":"Scaling Native Multimodal Pre-Training From Scratch","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T06:05:51.578252Z"},"links":{"cited_paper":"/paper/1905.07830","citing_paper":"/paper/2607.22043"},"observation_digest":"sha256:91ba1b7090d20d83cbf8e71649d71b4eca4832635474ad9b71a11b36f54e6176","observation_id":"0cbdd42e-40b8-47ee-b422-847ec4b20f7f","resolution":{"observed_at":"2026-08-01T06:05:51.578252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-08-07T12:51:50.861720Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06364","snapshot_observed_at":"2026-08-01T06:05:51.646144Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models.arXiv preprint arXiv:2304.06364,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22043","last_updated":"2026-07-24T07:13:52Z","snapshot_observed_at":"2026-08-07T14:08:17.400557Z","submitted_at":"2026-07-24T07:13:52Z","title":"Scaling Native Multimodal Pre-Training From Scratch","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T06:05:51.646144Z"},"links":{"cited_paper":"/paper/2304.06364","citing_paper":"/paper/2607.22043"},"observation_digest":"sha256:1c149e7d4147d85e2539930bee7f6ee00e6e57c21197e42b04495dddc3b7704b","observation_id":"0299e798-3028-48b6-9547-ec7c6453b70c","resolution":{"observed_at":"2026-08-01T06:05:51.646144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.02276","last_updated":"2026-02-02T16:17:38Z","snapshot_observed_at":"2026-07-06T22:44:09.804048Z","submitted_at":"2026-02-02T16:17:38Z","title":"Kimi K2.5: Visual Agentic Intelligence","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.02276","snapshot_observed_at":"2026-08-01T06:05:50.744535Z","title":"Kimi K2.5: Visual Agentic Intelligence.arXiv preprint arXiv:2602.02276,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22043","last_updated":"2026-07-24T07:13:52Z","snapshot_observed_at":"2026-08-07T14:08:17.400557Z","submitted_at":"2026-07-24T07:13:52Z","title":"Scaling Native Multimodal Pre-Training From Scratch","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-01T06:05:50.744535Z"},"links":{"cited_paper":"/paper/2602.02276","citing_paper":"/paper/2607.22043"},"observation_digest":"sha256:3fac58d6cf4f25d255a1d7134ecd63bd900fffa4dbf8810bd00f6ada9297f793","observation_id":"4e62a012-efbd-40a0-969e-fc653e72f039","resolution":{"observed_at":"2026-08-01T06:05:50.744535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-01T06:05:50.633139Z","title":"Scaling Laws for Neural Language Models.arXiv preprint arXiv:2001.08361,","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2607.22043","last_updated":"2026-07-24T07:13:52Z","snapshot_observed_at":"2026-08-07T14:08:17.400557Z","submitted_at":"2026-07-24T07:13:52Z","title":"Scaling Native Multimodal Pre-Training From Scratch","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-01T06:05:50.633139Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2607.22043"},"observation_digest":"sha256:d7d14ad6d1a51b6df0d6b3f6724d6eb5e896d7768a1790c910c4797e8e801fed","observation_id":"6c65647e-5163-42cb-9a4d-fc7daf5f8f56","resolution":{"observed_at":"2026-08-01T06:05:50.633139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09261","last_updated":"2022-10-17T17:08:26Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-17T17:08:26Z","title":"Challenging BIG-Bench Tasks and Whether Chain-of-Thought Can Solve Them","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.09261","snapshot_observed_at":"2026-08-01T06:05:51.077650Z","title":"Challenging Big-Bench Tasks and Whether Chain-of- Thought Can Solve Them.arXiv preprint arXiv:2210.09261,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22043","last_updated":"2026-07-24T07:13:52Z","snapshot_observed_at":"2026-08-07T14:08:17.400557Z","submitted_at":"2026-07-24T07:13:52Z","title":"Scaling Native Multimodal Pre-Training From Scratch","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-01T06:05:51.077650Z"},"links":{"cited_paper":"/paper/2210.09261","citing_paper":"/paper/2607.22043"},"observation_digest":"sha256:ce6d3a828bf293c914aa737f71550a0af291f08f0b24386a05adce744f6e44c0","observation_id":"c06469c9-7efd-4bf6-bd39-c9338a0f66c5","resolution":{"observed_at":"2026-08-01T06:05:51.077650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-07-06T12:54:11.616335Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-01T06:05:50.323293Z","title":"Training Compute-Optimal Large Language Models.arXiv preprint arXiv:2203.15556,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22043","last_updated":"2026-07-24T07:13:52Z","snapshot_observed_at":"2026-08-07T14:08:17.400557Z","submitted_at":"2026-07-24T07:13:52Z","title":"Scaling Native Multimodal Pre-Training From Scratch","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-01T06:05:50.323293Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2607.22043"},"observation_digest":"sha256:a9801fa3e35f3c1429a87755cbfe0e8c6795ed1bd3cbb56f98451566b3eaa41e","observation_id":"eca071a0-9487-4488-8b9e-a93547fca486","resolution":{"observed_at":"2026-08-01T06:05:50.323293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26583","last_updated":"2025-10-30T15:11:16Z","snapshot_observed_at":"2026-08-07T15:13:13.622286Z","submitted_at":"2025-10-30T15:11:16Z","title":"Emu3.5: Native Multimodal Models are World Learners","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.26583","snapshot_observed_at":"2026-08-01T06:05:50.098846Z","title":"Emu3.5: Native Multimodal Models are World Learners.arXiv preprint arXiv:2510.26583,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22043","last_updated":"2026-07-24T07:13:52Z","snapshot_observed_at":"2026-08-07T14:08:17.400557Z","submitted_at":"2026-07-24T07:13:52Z","title":"Scaling Native Multimodal Pre-Training From Scratch","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-01T06:05:50.098846Z"},"links":{"cited_paper":"/paper/2510.26583","citing_paper":"/paper/2607.22043"},"observation_digest":"sha256:dc49af1648b02cf20662fc6043be175390462da8822b27699be36329ed7334e7","observation_id":"72283a80-6ac1-414d-989d-5a71c8d3f60f","resolution":{"observed_at":"2026-08-01T06:05:50.098846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:05:50.428860Z","title":"OmniS- patial: Towards Comprehensive Spatial Reasoning Benchmark for Vision Language Models.arXiv preprint arXiv:2506.03135,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22043","last_updated":"2026-07-24T07:13:52Z","snapshot_observed_at":"2026-08-07T14:08:17.400557Z","submitted_at":"2026-07-24T07:13:52Z","title":"Scaling Native Multimodal Pre-Training From Scratch","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-01T06:05:50.428860Z"},"links":{"citing_paper":"/paper/2607.22043"},"observation_digest":"sha256:65f66e92ad18439b0542bbbddf471336d3a099c82e79c5ea1622e798b4a5fee5","observation_id":"0024aedb-602f-46ae-9c12-c734a14323da","resolution":{"observed_at":"2026-08-01T06:05:50.428860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-01T06:05:50.263534Z","title":"Measuring Massive Multitask Language Understanding.arXiv preprint arXiv:2009.03300,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2607.22043","last_updated":"2026-07-24T07:13:52Z","snapshot_observed_at":"2026-08-07T14:08:17.400557Z","submitted_at":"2026-07-24T07:13:52Z","title":"Scaling Native Multimodal Pre-Training From Scratch","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-01T06:05:50.263534Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2607.22043"},"observation_digest":"sha256:7e09e05a9e12936d4095e7f41484e2577257b9882830639c746ee23ced27deef","observation_id":"4d8c3356-65c3-4221-bd68-e3cb80d0dd06","resolution":{"observed_at":"2026-08-01T06:05:50.263534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-01T06:05:50.023614Z","title":"Training Verifiers to Solve Math Word Problems.arXiv preprint arXiv:2110.14168,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22043","last_updated":"2026-07-24T07:13:52Z","snapshot_observed_at":"2026-08-07T14:08:17.400557Z","submitted_at":"2026-07-24T07:13:52Z","title":"Scaling Native Multimodal Pre-Training From Scratch","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-01T06:05:50.023614Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2607.22043"},"observation_digest":"sha256:ce163de138852de42816518295e6829be761e75c18267fd1e13720089c8f3e4b","observation_id":"9cd0fced-9622-4c04-9a67-8736f94141b9","resolution":{"observed_at":"2026-08-01T06:05:50.023614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-01T06:05:50.854597Z","title":"DeepSeek-V3 Technical Report.arXiv preprint arXiv:2412.19437, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22043","last_updated":"2026-07-24T07:13:52Z","snapshot_observed_at":"2026-08-07T14:08:17.400557Z","submitted_at":"2026-07-24T07:13:52Z","title":"Scaling Native Multimodal Pre-Training From Scratch","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-01T06:05:50.854597Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2607.22043"},"observation_digest":"sha256:cb5ef959791b1bfca3731685e40a37d257133be44b6b30cb6940cfb6b39ca754","observation_id":"f40d8a51-4782-428a-9029-7ee9b258ee8e","resolution":{"observed_at":"2026-08-01T06:05:50.854597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:05:51.724178Z","title":"We detail the specific architecture configurations and training settings in Table","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.22043","last_updated":"2026-07-24T07:13:52Z","snapshot_observed_at":"2026-08-07T14:08:17.400557Z","submitted_at":"2026-07-24T07:13:52Z","title":"Scaling Native Multimodal Pre-Training From Scratch","version":1},"reference_index":4096,"source":"pdf_text","source_observed_at":"2026-08-01T06:05:51.724178Z"},"links":{"citing_paper":"/paper/2607.22043"},"observation_digest":"sha256:9002f4a1d1f090b1f2082726de73f4eb61a8af76152cfab5527a742820d42499","observation_id":"d57737de-fe33-415e-896e-4766186d75d6","resolution":{"observed_at":"2026-08-01T06:05:51.724178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.22043","last_updated":"2026-07-24T07:13:52Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T14:08:17.400557Z","submitted_at":"2026-07-24T07:13:52Z","title":"Scaling Native Multimodal Pre-Training From Scratch"},"reference_resolution":{"displayed":20,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":19,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":20},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 20 of 20 outbound references and 1 inbound Pith citation observation for arXiv:2607.22043."}