{"as_of":"2026-08-15T19:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ab8080e5147473f9e994c3963755e8c21f2b180dec27317f9ba3ad0fbd382b19","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":27,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T10:10:38.185094Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":3,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.11832","last_updated":"2024-10-29T06:44:36Z","snapshot_observed_at":"2026-08-15T18:23:57.996411Z","submitted_at":"2024-06-17T17:59:44Z","title":"Unveiling Encoder-Free Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2406.11832","doi":"10.48550/arxiv.2406.11832","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.11832","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pixart-sigma: Weak-to-strong training of diffusion transformer for 4k text-to-image generation","venue":"arXiv (Cornell University)","work_id":"89919d42-8c59-4aa5-8229-9d3bed0670e3","year":2024},"citing_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-08T07:16:45.596308Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-11T13:10:19.972353Z"},"links":{"cited_paper":"/paper/2406.11832","citing_paper":"/paper/2407.07726"},"observation_digest":"sha256:321f0be1c225bac3bef73ba11074d9c79d3476cc817a733d4a393083c99e8028","observation_id":"b1462b5b-21a8-4213-ba81-c3c614305d62","resolution":{"observed_at":"2026-05-11T13:10:20.790119Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11832","last_updated":"2024-10-29T06:44:36Z","snapshot_observed_at":"2026-08-15T18:23:57.996411Z","submitted_at":"2024-06-17T17:59:44Z","title":"Unveiling Encoder-Free Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2406.11832","doi":"10.48550/arxiv.2406.11832","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.11832","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pixart-sigma: Weak-to-strong training of diffusion transformer for 4k text-to-image generation","venue":"arXiv (Cornell University)","work_id":"89919d42-8c59-4aa5-8229-9d3bed0670e3","year":2024},"citing_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-11T10:56:06.418360Z"},"links":{"cited_paper":"/paper/2406.11832","citing_paper":"/paper/2409.18869"},"observation_digest":"sha256:f315f958a5b4a26afaa229abd423375a58e7e33f972fa3a83909eb964aa6257d","observation_id":"66838fd0-dab7-475e-b7dd-0ad5dc33381b","resolution":{"observed_at":"2026-05-11T10:56:07.501418Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11832","last_updated":"2024-10-29T06:44:36Z","snapshot_observed_at":"2026-08-15T18:23:57.996411Z","submitted_at":"2024-06-17T17:59:44Z","title":"Unveiling Encoder-Free Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11832","snapshot_observed_at":"2026-08-12T10:10:38.185094Z","title":"Unveiling encoder-free vision-language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.19488","last_updated":"2025-03-17T09:01:38Z","snapshot_observed_at":"2026-08-12T21:26:33.151349Z","submitted_at":"2024-11-29T06:06:35Z","title":"Interleaved-Modal Chain-of-Thought","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T10:10:38.185094Z"},"links":{"cited_paper":"/paper/2406.11832","citing_paper":"/paper/2411.19488"},"observation_digest":"sha256:8abab79668cd7ce6f1ee16d6139c000019751b78e93fb9556d09ebf823b30e6f","observation_id":"81d5e71b-6d5f-4eef-9a8a-2c6473d63b89","resolution":{"observed_at":"2026-08-12T10:10:38.185094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11832","last_updated":"2024-10-29T06:44:36Z","snapshot_observed_at":"2026-08-15T18:23:57.996411Z","submitted_at":"2024-06-17T17:59:44Z","title":"Unveiling Encoder-Free Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11832","snapshot_observed_at":"2026-08-11T17:00:08.661560Z","title":"Unveiling encoder-free vision-language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.09604","last_updated":"2024-12-12T18:59:26Z","snapshot_observed_at":"2026-08-13T21:41:53.471697Z","submitted_at":"2024-12-12T18:59:26Z","title":"SynerGen-VL: Towards Synergistic Image Understanding and Generation with Vision Experts and Token Folding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T17:00:08.661560Z"},"links":{"cited_paper":"/paper/2406.11832","citing_paper":"/paper/2412.09604"},"observation_digest":"sha256:e129dd7df05425dd629a4890748292c8339daa9137e29081581a2dbb843c512c","observation_id":"16ee3840-c0b6-4cfc-b6cd-a81b11080e4d","resolution":{"observed_at":"2026-08-11T17:00:08.661560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11832","last_updated":"2024-10-29T06:44:36Z","snapshot_observed_at":"2026-08-15T18:23:57.996411Z","submitted_at":"2024-06-17T17:59:44Z","title":"Unveiling Encoder-Free Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11832","snapshot_observed_at":"2026-08-11T15:41:07.405342Z","title":"Unveili ng encoder-free vision-language models,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10758","last_updated":"2024-12-14T09:04:32Z","snapshot_observed_at":"2026-08-14T23:38:29.329686Z","submitted_at":"2024-12-14T09:04:32Z","title":"Optimizing Vision-Language Interactions Through Decoder-Only Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:07.405342Z"},"links":{"cited_paper":"/paper/2406.11832","citing_paper":"/paper/2412.10758"},"observation_digest":"sha256:cabfe618310a6b74e6c9e0b04dd41767539ba5405b106d39dee7ceec53fe3e20","observation_id":"de7930ef-f9ba-4cdf-8795-e67183fa8da3","resolution":{"observed_at":"2026-08-11T15:41:07.405342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11832","last_updated":"2024-10-29T06:44:36Z","snapshot_observed_at":"2026-08-15T18:23:57.996411Z","submitted_at":"2024-06-17T17:59:44Z","title":"Unveiling Encoder-Free Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11832","snapshot_observed_at":"2026-08-11T15:41:07.412311Z","title":"Available: https://doi.org/10.48550/ar Xiv.2406.11832","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10758","last_updated":"2024-12-14T09:04:32Z","snapshot_observed_at":"2026-08-14T23:38:29.329686Z","submitted_at":"2024-12-14T09:04:32Z","title":"Optimizing Vision-Language Interactions Through Decoder-Only Models","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-11T15:41:07.412311Z"},"links":{"cited_paper":"/paper/2406.11832","citing_paper":"/paper/2412.10758"},"observation_digest":"sha256:198246d7fd4ba9935fd969df9787c1a5b6bfdcf77ad51e6c395e06d9fb827da4","observation_id":"d9efcc2f-8978-4d23-97a8-97fad21a7f40","resolution":{"observed_at":"2026-08-11T15:41:07.412311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11832","last_updated":"2024-10-29T06:44:36Z","snapshot_observed_at":"2026-08-15T18:23:57.996411Z","submitted_at":"2024-06-17T17:59:44Z","title":"Unveiling Encoder-Free Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11832","snapshot_observed_at":"2026-08-11T14:13:24.448179Z","title":"Unveiling encoder-free vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12359","last_updated":"2025-01-07T15:36:54Z","snapshot_observed_at":"2026-08-13T23:35:02.697596Z","submitted_at":"2024-12-16T21:14:11Z","title":"LLaVA Steering: Visual Instruction Tuning with 500x Fewer Parameters through Modality Linear Representation-Steering","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T14:13:24.448179Z"},"links":{"cited_paper":"/paper/2406.11832","citing_paper":"/paper/2412.12359"},"observation_digest":"sha256:76904ecb985fe64802fbba9f3d0e4c488e611d3c64761705ddb50451d860b6ee","observation_id":"b77644af-4a32-4f32-9ec4-3fc6f4dbf302","resolution":{"observed_at":"2026-08-11T14:13:24.448179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11832","last_updated":"2024-10-29T06:44:36Z","snapshot_observed_at":"2026-08-15T18:23:57.996411Z","submitted_at":"2024-06-17T17:59:44Z","title":"Unveiling Encoder-Free Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11832","snapshot_observed_at":"2026-08-11T13:19:23.160965Z","title":"Unveiling encoder-free vision-language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.13303","last_updated":"2025-05-15T22:00:19Z","snapshot_observed_at":"2026-08-15T01:32:05.414283Z","submitted_at":"2024-12-17T20:09:55Z","title":"FastVLM: Efficient Vision Encoding for Vision Language Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T13:19:23.160965Z"},"links":{"cited_paper":"/paper/2406.11832","citing_paper":"/paper/2412.13303"},"observation_digest":"sha256:39430d88bdc16e0d4cdde38dcba4a26fcfae5f996649ec5eb01c45b97e6685e4","observation_id":"f2eaaa8b-b60f-4334-adcf-1a09a07d5bea","resolution":{"observed_at":"2026-08-11T13:19:23.160965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11832","last_updated":"2024-10-29T06:44:36Z","snapshot_observed_at":"2026-08-15T18:23:57.996411Z","submitted_at":"2024-06-17T17:59:44Z","title":"Unveiling Encoder-Free Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2406.11832","doi":"10.48550/arxiv.2406.11832","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.11832","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pixart-sigma: Weak-to-strong training of diffusion transformer for 4k text-to-image generation","venue":"arXiv (Cornell University)","work_id":"89919d42-8c59-4aa5-8229-9d3bed0670e3","year":2024},"citing_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-08-13T00:09:27.237577Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-17T15:07:39.718555Z"},"links":{"cited_paper":"/paper/2406.11832","citing_paper":"/paper/2412.14169"},"observation_digest":"sha256:4e7a00d9d8ce0595d856754b09c70e83e846250aff511e4bb3dfb8783c626d08","observation_id":"7d57e557-7d78-405d-89fe-b6177df03839","resolution":{"observed_at":"2026-05-17T15:07:39.775119Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11832","last_updated":"2024-10-29T06:44:36Z","snapshot_observed_at":"2026-08-15T18:23:57.996411Z","submitted_at":"2024-06-17T17:59:44Z","title":"Unveiling Encoder-Free Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11832","snapshot_observed_at":"2026-08-11T12:20:25.637117Z","title":"Unveiling encoder-free vision-language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14373","last_updated":"2025-07-29T21:20:14Z","snapshot_observed_at":"2026-08-15T10:32:35.619255Z","submitted_at":"2024-12-18T22:13:21Z","title":"ECG-Byte: A Tokenizer for End-to-End Generative Electrocardiogram Language Modeling","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T12:20:25.637117Z"},"links":{"cited_paper":"/paper/2406.11832","citing_paper":"/paper/2412.14373"},"observation_digest":"sha256:9943db2d0e1fd891b72e3d4049674aa27ef92865feda60826ee7fd3eb5122999","observation_id":"7e1bbfec-005f-4607-b11a-17934885a95c","resolution":{"observed_at":"2026-08-11T12:20:25.637117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11832","last_updated":"2024-10-29T06:44:36Z","snapshot_observed_at":"2026-08-15T18:23:57.996411Z","submitted_at":"2024-06-17T17:59:44Z","title":"Unveiling Encoder-Free Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11832","snapshot_observed_at":"2026-08-11T10:49:08.009009Z","title":"Unveiling encoder-free 13 vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-15T07:37:36.527948Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:08.009009Z"},"links":{"cited_paper":"/paper/2406.11832","citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:a46e39815c547c8e5d92846e27c6d71478c4e6c5a0b4814dce83c2aa0c3bdb70","observation_id":"09609b9d-e3e4-4981-bc3b-3ab8bd6810fa","resolution":{"observed_at":"2026-08-11T10:49:08.009009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11832","last_updated":"2024-10-29T06:44:36Z","snapshot_observed_at":"2026-08-15T18:23:57.996411Z","submitted_at":"2024-06-17T17:59:44Z","title":"Unveiling Encoder-Free Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11832","snapshot_observed_at":"2026-08-11T14:59:01.509004Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-13T14:56:43.704817Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.509004Z"},"links":{"cited_paper":"/paper/2406.11832","citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:966633524230f3ce254dd1df20e16cf5905cea7643382790e4254834a172bc0d","observation_id":"45336d13-7523-4ecb-a115-66b85f1dd4c4","resolution":{"observed_at":"2026-08-11T14:59:01.509004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11832","last_updated":"2024-10-29T06:44:36Z","snapshot_observed_at":"2026-08-15T18:23:57.996411Z","submitted_at":"2024-06-17T17:59:44Z","title":"Unveiling Encoder-Free Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11832","snapshot_observed_at":"2026-08-08T14:25:30.501449Z","title":"Unveiling encoder-free vision-language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06779","last_updated":"2025-02-10T18:56:14Z","snapshot_observed_at":"2026-08-14T22:56:51.692051Z","submitted_at":"2025-02-10T18:56:14Z","title":"KARST: Multi-Kernel Kronecker Adaptation with Re-Scaling Transmission for Visual Classification","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:30.501449Z"},"links":{"cited_paper":"/paper/2406.11832","citing_paper":"/paper/2502.06779"},"observation_digest":"sha256:41dc1026d688c72e0935bdd56e3fd19ffdc05a5f72315d670a757eff38114803","observation_id":"353cc42d-074c-4cc4-a546-351ab013e0d6","resolution":{"observed_at":"2026-08-08T14:25:30.501449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11832","last_updated":"2024-10-29T06:44:36Z","snapshot_observed_at":"2026-08-15T18:23:57.996411Z","submitted_at":"2024-06-17T17:59:44Z","title":"Unveiling Encoder-Free Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11832","snapshot_observed_at":"2026-08-08T14:25:55.616853Z","title":"Unveiling encoder-free vision-language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.616853Z"},"links":{"cited_paper":"/paper/2406.11832","citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:ef8d9923e317d3c40757b5953b795339c6fd481f17c2f5d6e8561f701905e747","observation_id":"ae6bffc1-ee39-4e33-abcb-314b493cca86","resolution":{"observed_at":"2026-08-08T14:25:55.616853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11832","last_updated":"2024-10-29T06:44:36Z","snapshot_observed_at":"2026-08-15T18:23:57.996411Z","submitted_at":"2024-06-17T17:59:44Z","title":"Unveiling Encoder-Free Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2406.11832","doi":"10.48550/arxiv.2406.11832","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.11832","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pixart-sigma: Weak-to-strong training of diffusion transformer for 4k text-to-image generation","venue":"arXiv (Cornell University)","work_id":"89919d42-8c59-4aa5-8229-9d3bed0670e3","year":2024},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"cited_paper":"/paper/2406.11832","citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:3a8f140b0738e01345141686efaead31d09d81965393350a6cfac1a8c9512699","observation_id":"5c81fc57-ac1e-4e04-81bb-c0024add02cb","resolution":{"observed_at":"2026-05-11T05:26:05.462877Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11832","last_updated":"2024-10-29T06:44:36Z","snapshot_observed_at":"2026-08-15T18:23:57.996411Z","submitted_at":"2024-06-17T17:59:44Z","title":"Unveiling Encoder-Free Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2406.11832","doi":"10.48550/arxiv.2406.11832","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.11832","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pixart-sigma: Weak-to-strong training of diffusion transformer for 4k text-to-image generation","venue":"arXiv (Cornell University)","work_id":"89919d42-8c59-4aa5-8229-9d3bed0670e3","year":2024},"citing_paper":{"arxiv_id":"2506.01844","last_updated":"2025-06-02T16:30:19Z","snapshot_observed_at":"2026-08-13T11:17:54.365190Z","submitted_at":"2025-06-02T16:30:19Z","title":"SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-11T21:22:36.902119Z"},"links":{"cited_paper":"/paper/2406.11832","citing_paper":"/paper/2506.01844"},"observation_digest":"sha256:ff217cc4f1ffdd3aa1384af76f264b7a07adf3bdde3f32611d260b7cd62166cb","observation_id":"7778795f-6ccf-4f52-8b8e-cc97d9ed29f7","resolution":{"observed_at":"2026-05-11T21:22:37.309970Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11832","last_updated":"2024-10-29T06:44:36Z","snapshot_observed_at":"2026-08-15T18:23:57.996411Z","submitted_at":"2024-06-17T17:59:44Z","title":"Unveiling Encoder-Free Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11832","snapshot_observed_at":"2026-08-07T11:16:15.700721Z","title":"arXiv:2406.11832 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02975","last_updated":"2025-06-03T15:14:00Z","snapshot_observed_at":"2026-08-14T12:37:41.784002Z","submitted_at":"2025-06-03T15:14:00Z","title":"HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:15.700721Z"},"links":{"cited_paper":"/paper/2406.11832","citing_paper":"/paper/2506.02975"},"observation_digest":"sha256:6de589b2c0a3a66bcf1b32748f2a2b8a6acdaaf6e876dfa0662a5bb373fabc32","observation_id":"9713abf4-f732-4f4c-9f1b-cdedf42b3fbf","resolution":{"observed_at":"2026-08-07T11:16:15.700721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11832","last_updated":"2024-10-29T06:44:36Z","snapshot_observed_at":"2026-08-15T18:23:57.996411Z","submitted_at":"2024-06-17T17:59:44Z","title":"Unveiling Encoder-Free Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11832","snapshot_observed_at":"2026-08-07T00:23:47.368477Z","title":"Unveiling encoder-free vision-language models.arXiv preprint arXiv:2406.11832, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14471","last_updated":"2025-06-17T12:35:23Z","snapshot_observed_at":"2026-08-15T10:12:22.968481Z","submitted_at":"2025-06-17T12:35:23Z","title":"Dense360: Dense Understanding from Omnidirectional Panoramas","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:47.368477Z"},"links":{"cited_paper":"/paper/2406.11832","citing_paper":"/paper/2506.14471"},"observation_digest":"sha256:e9cbf39a137905303a5ffb43c5e8f451f662138486fa880122f15f3a2d33fed9","observation_id":"6a10af03-a77f-46dc-9977-4ebbbfb433b1","resolution":{"observed_at":"2026-08-07T00:23:47.368477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11832","last_updated":"2024-10-29T06:44:36Z","snapshot_observed_at":"2026-08-15T18:23:57.996411Z","submitted_at":"2024-06-17T17:59:44Z","title":"Unveiling Encoder-Free Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2406.11832","doi":"10.48550/arxiv.2406.11832","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.11832","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pixart-sigma: Weak-to-strong training of diffusion transformer for 4k text-to-image generation","venue":"arXiv (Cornell University)","work_id":"89919d42-8c59-4aa5-8229-9d3bed0670e3","year":2024},"citing_paper":{"arxiv_id":"2506.15564","last_updated":"2025-09-22T01:24:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-18T15:39:15Z","title":"Show-o2: Improved Native Unified Multimodal Models","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-12T18:51:15.428692Z"},"links":{"cited_paper":"/paper/2406.11832","citing_paper":"/paper/2506.15564"},"observation_digest":"sha256:1b87dc569d7f8821af9889f19cdcc1e86f7d022964a0bc3ffcec54a5f2f639ed","observation_id":"077632fb-0668-46c5-a881-19e25638e747","resolution":{"observed_at":"2026-05-12T18:51:16.044495Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11832","last_updated":"2024-10-29T06:44:36Z","snapshot_observed_at":"2026-08-15T18:23:57.996411Z","submitted_at":"2024-06-17T17:59:44Z","title":"Unveiling Encoder-Free Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11832","snapshot_observed_at":"2026-08-06T21:19:44.483409Z","title":"Unveiling encoder-free vision-language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00505","last_updated":"2025-07-04T13:15:34Z","snapshot_observed_at":"2026-08-13T05:55:37.114749Z","submitted_at":"2025-07-01T07:20:11Z","title":"LLaVA-SP: Enhancing Visual Representation with Visual Spatial Tokens for MLLMs","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:44.483409Z"},"links":{"cited_paper":"/paper/2406.11832","citing_paper":"/paper/2507.00505"},"observation_digest":"sha256:4fac9ce0973e758fd78bb8b906f7fceb18c1b214e3f4a5779224a186641df227","observation_id":"e7305b86-daf9-40fe-b4aa-958b5de44d65","resolution":{"observed_at":"2026-08-06T21:19:44.483409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11832","last_updated":"2024-10-29T06:44:36Z","snapshot_observed_at":"2026-08-15T18:23:57.996411Z","submitted_at":"2024-06-17T17:59:44Z","title":"Unveiling Encoder-Free Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11832","snapshot_observed_at":"2026-08-06T19:15:26.468458Z","title":"Unveiling encoder-free vision-language models.arXiv preprint arXiv:2406.11832,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","snapshot_observed_at":"2026-08-08T22:26:24.906449Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:26.468458Z"},"links":{"cited_paper":"/paper/2406.11832","citing_paper":"/paper/2507.06137"},"observation_digest":"sha256:dc6ab2cc459c4b44898ec2db177f2c1383f814a92a1e83d39f70b37cc71b801d","observation_id":"9946d252-2a16-4bd1-a9e0-50e93c74d681","resolution":{"observed_at":"2026-08-06T19:15:26.468458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11832","last_updated":"2024-10-29T06:44:36Z","snapshot_observed_at":"2026-08-15T18:23:57.996411Z","submitted_at":"2024-06-17T17:59:44Z","title":"Unveiling Encoder-Free Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11832","snapshot_observed_at":"2026-08-06T16:49:56.218152Z","title":"Unveiling encoder-free vision-language models,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:56.218152Z"},"links":{"cited_paper":"/paper/2406.11832","citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:17939a2dbf41f9650128b101e61d973013b2d2ebc8acbb41fe86a0add5fa8440","observation_id":"31e4b70e-3842-4761-9ffd-58b30ea63fba","resolution":{"observed_at":"2026-08-06T16:49:56.218152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11832","last_updated":"2024-10-29T06:44:36Z","snapshot_observed_at":"2026-08-15T18:23:57.996411Z","submitted_at":"2024-06-17T17:59:44Z","title":"Unveiling Encoder-Free Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2406.11832","doi":"10.48550/arxiv.2406.11832","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.11832","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pixart-sigma: Weak-to-strong training of diffusion transformer for 4k text-to-image generation","venue":"arXiv (Cornell University)","work_id":"89919d42-8c59-4aa5-8229-9d3bed0670e3","year":2024},"citing_paper":{"arxiv_id":"2604.09088","last_updated":"2026-04-10T08:16:59Z","snapshot_observed_at":"2026-08-11T16:03:30.442738Z","submitted_at":"2026-04-10T08:16:59Z","title":"Memory-Efficient Transfer Learning with Fading Side Networks via Masked Dual Path Distillation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T16:45:36.306400Z"},"links":{"cited_paper":"/paper/2406.11832","citing_paper":"/paper/2604.09088"},"observation_digest":"sha256:8a2203dad347aae082e5a8dd417810a50ff0cfff0caaa60a3d7d6a0adde6a40f","observation_id":"3412c648-d966-4653-9424-1378125f9dd4","resolution":{"observed_at":"2026-05-11T08:15:58.922895Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11832","last_updated":"2024-10-29T06:44:36Z","snapshot_observed_at":"2026-08-15T18:23:57.996411Z","submitted_at":"2024-06-17T17:59:44Z","title":"Unveiling Encoder-Free Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2406.11832","doi":"10.48550/arxiv.2406.11832","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.11832","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pixart-sigma: Weak-to-strong training of diffusion transformer for 4k text-to-image generation","venue":"arXiv (Cornell University)","work_id":"89919d42-8c59-4aa5-8229-9d3bed0670e3","year":2024},"citing_paper":{"arxiv_id":"2605.04058","last_updated":"2026-04-10T08:00:28Z","snapshot_observed_at":"2026-07-06T23:16:54.673178Z","submitted_at":"2026-04-10T08:00:28Z","title":"MP-ISMoE: Mixed-Precision Interactive Side Mixture-of-Experts for Efficient Transfer Learning","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-05-10T17:19:59.247074Z"},"links":{"cited_paper":"/paper/2406.11832","citing_paper":"/paper/2605.04058"},"observation_digest":"sha256:48d9b6432d21d1959847abfce56baf091eb8961f039b23646ded8b764aeed40f","observation_id":"6820083f-b286-49e2-9af7-96923cc49188","resolution":{"observed_at":"2026-05-11T07:01:13.486294Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11832","last_updated":"2024-10-29T06:44:36Z","snapshot_observed_at":"2026-08-15T18:23:57.996411Z","submitted_at":"2024-06-17T17:59:44Z","title":"Unveiling Encoder-Free Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2406.11832","doi":"10.48550/arxiv.2406.11832","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.11832","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pixart-sigma: Weak-to-strong training of diffusion transformer for 4k text-to-image generation","venue":"arXiv (Cornell University)","work_id":"89919d42-8c59-4aa5-8229-9d3bed0670e3","year":2024},"citing_paper":{"arxiv_id":"2605.28820","last_updated":"2026-05-27T17:59:55Z","snapshot_observed_at":"2026-08-13T00:10:15.874365Z","submitted_at":"2026-05-27T17:59:55Z","title":"From Pixels to Words -- Towards Native One-Vision Models at Scale","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-29T13:29:53.006064Z"},"links":{"cited_paper":"/paper/2406.11832","citing_paper":"/paper/2605.28820"},"observation_digest":"sha256:f722491cc83739879c5351ada0f3d88825d3cea5df0d7e4965a86ded18bff75f","observation_id":"3ff67812-984b-4a7f-8fc2-d12182f1d980","resolution":{"observed_at":"2026-06-29T13:33:28.011099Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11832","last_updated":"2024-10-29T06:44:36Z","snapshot_observed_at":"2026-08-15T18:23:57.996411Z","submitted_at":"2024-06-17T17:59:44Z","title":"Unveiling Encoder-Free Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2406.11832","doi":"10.48550/arxiv.2406.11832","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.11832","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pixart-sigma: Weak-to-strong training of diffusion transformer for 4k text-to-image generation","venue":"arXiv (Cornell University)","work_id":"89919d42-8c59-4aa5-8229-9d3bed0670e3","year":2024},"citing_paper":{"arxiv_id":"2606.07604","last_updated":"2026-05-29T09:40:38Z","snapshot_observed_at":"2026-08-03T04:00:50.272221Z","submitted_at":"2026-05-29T09:40:38Z","title":"Contribution Weights: A Geometrical Analysis of Self-Attention Transformers","version":1},"reference_index":125,"source":"arxiv_source","source_observed_at":"2026-06-28T23:29:02.457697Z"},"links":{"cited_paper":"/paper/2406.11832","citing_paper":"/paper/2606.07604"},"observation_digest":"sha256:a9b727f6f2a798a6a33ab1aab35f414fe34c3b207524c590f8684cfec5e6ede7","observation_id":"ba1b7639-e74c-4049-9c4a-0414db2ff596","resolution":{"observed_at":"2026-06-28T23:32:46.758323Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11832","last_updated":"2024-10-29T06:44:36Z","snapshot_observed_at":"2026-08-15T18:23:57.996411Z","submitted_at":"2024-06-17T17:59:44Z","title":"Unveiling Encoder-Free Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11832","snapshot_observed_at":"2026-07-11T16:20:13.303809Z","title":"Unveiling encoder-free vision-language models,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04619","last_updated":"2026-07-06T02:58:47Z","snapshot_observed_at":"2026-08-11T23:49:30.842835Z","submitted_at":"2026-07-06T02:58:47Z","title":"CARD: Cross-component Audio Representation Distillation for Encoder-Free Audio Captioning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-11T16:20:13.303809Z"},"links":{"cited_paper":"/paper/2406.11832","citing_paper":"/paper/2607.04619"},"observation_digest":"sha256:9aa03eb2d3994229a085fbc6579999138fcc0a32078eaf2cf3971e03f9ccc744","observation_id":"cda596e6-7081-46cb-ba46-9774f1433403","resolution":{"observed_at":"2026-07-11T16:20:13.303809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2406.11832/citation-record","integrity":"/paper/2406.11832/integrity","json":"/paper/2406.11832/citation-record.json","paper":"/paper/2406.11832"},"outbound":[],"paper":{"arxiv_id":"2406.11832","last_updated":"2024-10-29T06:44:36Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T18:23:57.996411Z","submitted_at":"2024-06-17T17:59:44Z","title":"Unveiling Encoder-Free Vision-Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 27 inbound Pith citation observations for arXiv:2406.11832."}