{"as_of":"2026-08-05T16:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:43551856f461db6e098f0a5971da338eb183433a6c2522928cdd7cbdd5b67d1c","coverage":[{"denominator":68,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":68,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T01:09:02.214590Z","state":"measured"},{"denominator":71,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":71,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T23:18:25.056705Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.17800","last_updated":"2026-06-16T11:25:37Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:25:37Z","title":"MaineCoon: Pursuing A Real-Time Audio-Visual Social World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.17800","snapshot_observed_at":"2026-07-12T01:53:57.900599Z","title":"Mainecoon: Pursuing a real-time audio-visual social world model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03524","last_updated":"2026-07-03T17:55:01Z","snapshot_observed_at":"2026-07-12T01:53:57.619977Z","submitted_at":"2026-07-03T17:55:01Z","title":"Perceptual Flow Matching for Few-Step Generative Modeling","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-12T01:53:57.900599Z"},"links":{"cited_paper":"/paper/2606.17800","citing_paper":"/paper/2607.03524"},"observation_digest":"sha256:f96ab73731d67dc4bb27e305d868501da29e834cccdcea38deed420fc646d585","observation_id":"e7c80bb1-33a2-44df-80f1-2c273baae2ec","resolution":{"observed_at":"2026-07-12T01:53:57.900599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.17800","last_updated":"2026-06-16T11:25:37Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:25:37Z","title":"MaineCoon: Pursuing A Real-Time Audio-Visual Social World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.17800","snapshot_observed_at":"2026-07-31T23:18:25.056705Z","title":"MaineCoon: Pursuing a real-time audio-visual social world model.arXiv preprint arXiv:2606.17800, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.24027","last_updated":"2026-07-27T05:53:28Z","snapshot_observed_at":"2026-07-31T23:18:23.831798Z","submitted_at":"2026-07-27T05:53:28Z","title":"Sol-Attn: Accelerating Video Generation Inference via On-the-Fly Attention Sparsification","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-31T23:18:25.056705Z"},"links":{"cited_paper":"/paper/2606.17800","citing_paper":"/paper/2607.24027"},"observation_digest":"sha256:5b750e260902231b1b9b4595c0d562cecd171eaeb3c2672d774b8acb8fde3513","observation_id":"de100b1b-32d7-4f31-953b-d86a1aa7ae46","resolution":{"observed_at":"2026-07-31T23:18:25.056705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.17800","last_updated":"2026-06-16T11:25:37Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:25:37Z","title":"MaineCoon: Pursuing A Real-Time Audio-Visual Social World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.17800","snapshot_observed_at":"2026-07-31T17:08:11.387051Z","title":"arXiv preprint arXiv:2606.17800 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24359","last_updated":"2026-07-27T12:35:32Z","snapshot_observed_at":"2026-08-04T19:58:13.639778Z","submitted_at":"2026-07-27T12:35:32Z","title":"TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-07-31T17:08:11.387051Z"},"links":{"cited_paper":"/paper/2606.17800","citing_paper":"/paper/2607.24359"},"observation_digest":"sha256:e8073abf5ec657cd2834bd2052d7421d330f6dc0c5ac19c7dd169d2e183827b0","observation_id":"f3234e59-a1b2-4445-9564-286c13ffc4a2","resolution":{"observed_at":"2026-07-31T17:08:11.387051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2606.17800/citation-record","integrity":"/paper/2606.17800/integrity","json":"/paper/2606.17800/citation-record.json","paper":"/paper/2606.17800"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:09:02.214590Z","title":"On-policy distillation of language models: Learning from self-generated mistakes","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.17800","last_updated":"2026-06-16T11:25:37Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:25:37Z","title":"MaineCoon: Pursuing A Real-Time Audio-Visual Social World Model","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-27T01:09:02.214590Z"},"links":{"citing_paper":"/paper/2606.17800"},"observation_digest":"sha256:8f908a91207a9e2503547d02fabceb4c6281bdde7e6cb70102713e325390bff8","observation_id":"75c27e2e-1861-4d1f-9fdb-4907178bbdad","resolution":{"observed_at":"2026-06-27T01:09:02.214590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09985","last_updated":"2025-06-11T17:57:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-11T17:57:09Z","title":"V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning","version":1},"cited_work":{"arxiv_id":"2506.09985","doi":"10.48550/arxiv.2506.09985","metadata_source":"pith","pith_arxiv_id":"2506.09985","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning","venue":"cs.AI","work_id":"a9c28401-f16a-4933-89f0-788e2f94e52b","year":2025},"citing_paper":{"arxiv_id":"2606.17800","last_updated":"2026-06-16T11:25:37Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:25:37Z","title":"MaineCoon: Pursuing A Real-Time Audio-Visual Social World Model","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-27T01:09:02.214590Z"},"links":{"cited_paper":"/paper/2506.09985","citing_paper":"/paper/2606.17800"},"observation_digest":"sha256:a195b4e4ead9bffbfe0bef58ad888181e20d38f4ab8e435a1af09c5ffe3575e8","observation_id":"cb1b7e1f-1170-42a3-8547-6cbfcaad9416","resolution":{"observed_at":"2026-07-03T20:48:55.726546Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-03T19:08:37.559938+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T19:08:37.559938+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:09:02.214590Z","title":"Optimizing few-step generation with adaptive matching distillation","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.17800","last_updated":"2026-06-16T11:25:37Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:25:37Z","title":"MaineCoon: Pursuing A Real-Time Audio-Visual Social World Model","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-27T01:09:02.214590Z"},"links":{"citing_paper":"/paper/2606.17800"},"observation_digest":"sha256:962a1009d4973fc8954f1daf1ec286a321ee79bc3956a9f8d42bf6609fed8ffe","observation_id":"bc1d0363-c7a1-407f-bb60-0e4ba5766704","resolution":{"observed_at":"2026-06-27T01:09:02.214590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":"2511.22699","doi":"10.48550/arxiv.2511.22699","metadata_source":"pith","pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","venue":"cs.CV","work_id":"f1080a62-48e1-4255-b023-7556be57370d","year":2025},"citing_paper":{"arxiv_id":"2606.17800","last_updated":"2026-06-16T11:25:37Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:25:37Z","title":"MaineCoon: Pursuing A Real-Time Audio-Visual Social World Model","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-27T01:09:02.214590Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2606.17800"},"observation_digest":"sha256:f567db34661f70924fbd2f7245f51e12875c4319678a3331dc5629db697910a9","observation_id":"a1091932-944a-459f-bf77-f2fbfb17fd93","resolution":{"observed_at":"2026-07-03T20:48:55.730050Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:09:02.214590Z","title":"Q-dit: Accurate post-training quantization for diffusion transformers","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.17800","last_updated":"2026-06-16T11:25:37Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:25:37Z","title":"MaineCoon: Pursuing A Real-Time Audio-Visual Social World Model","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-27T01:09:02.214590Z"},"links":{"citing_paper":"/paper/2606.17800"},"observation_digest":"sha256:078111c6fb5804db975ee0cc85273b71dc6e6571550cfb9236b2bcebec435158","observation_id":"f04f1341-9fa0-4264-9662-34c9a5c9b0e2","resolution":{"observed_at":"2026-06-27T01:09:02.214590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:09:02.214590Z","title":"Out of time: automated lip sync in the wild","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2606.17800","last_updated":"2026-06-16T11:25:37Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:25:37Z","title":"MaineCoon: Pursuing A Real-Time Audio-Visual Social World Model","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-27T01:09:02.214590Z"},"links":{"citing_paper":"/paper/2606.17800"},"observation_digest":"sha256:1dcb521e40588221879d7f4aceb5f62f0d7fbbd03c4a006b23c8a94e05a27e5a","observation_id":"0e88e013-b541-46d2-af32-c39862a7bdfd","resolution":{"observed_at":"2026-06-27T01:09:02.214590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:09:02.214590Z","title":"Deepseek-v4: Towards highly efficient million-token context intelligence, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.17800","last_updated":"2026-06-16T11:25:37Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:25:37Z","title":"MaineCoon: Pursuing A Real-Time Audio-Visual Social World Model","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-27T01:09:02.214590Z"},"links":{"citing_paper":"/paper/2606.17800"},"observation_digest":"sha256:ba0d26eaa2c5c28c2d6983a85f31893e89bba1aaf0be54a82319b262003152c6","observation_id":"de2ffeb6-9f00-4801-9fb5-7bf50e4d538e","resolution":{"observed_at":"2026-06-27T01:09:02.214590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.13254","last_updated":"2021-04-28T14:37:48Z","snapshot_observed_at":"2026-07-06T08:40:56.574235Z","submitted_at":"2019-11-27T13:50:45Z","title":"Music Source Separation in the Waveform Domain","version":2},"cited_work":{"arxiv_id":"1911.13254","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1911.13254","snapshot_observed_at":"2026-07-04T18:00:00.505007Z","title":"Music source separation in the waveform domain","venue":null,"work_id":"95f69991-e8a7-4600-ac81-4e73ef03c082","year":2019},"citing_paper":{"arxiv_id":"2606.17800","last_updated":"2026-06-16T11:25:37Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:25:37Z","title":"MaineCoon: Pursuing A Real-Time Audio-Visual Social World Model","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-27T01:09:02.214590Z"},"links":{"cited_paper":"/paper/1911.13254","citing_paper":"/paper/2606.17800"},"observation_digest":"sha256:496c2462b4fde37b064c35de1ee017f8e0c0f97cc9583dc454e2f5b18d3dccf1","observation_id":"c9033706-c690-4373-8671-5c78a9042a14","resolution":{"observed_at":"2026-07-03T20:48:55.750717Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","snapshot_observed_at":"2026-07-06T11:55:04.054344Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization","version":2},"cited_work":{"arxiv_id":"2110.02861","doi":"10.48550/arxiv.2110.02861","metadata_source":"arxiv_reference","pith_arxiv_id":"2110.02861","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dettmers, M","venue":"arXiv (Cornell University)","work_id":"dc9d8ece-f716-493d-89a8-2a30dedcceb4","year":2021},"citing_paper":{"arxiv_id":"2606.17800","last_updated":"2026-06-16T11:25:37Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:25:37Z","title":"MaineCoon: Pursuing A Real-Time Audio-Visual Social World Model","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-27T01:09:02.214590Z"},"links":{"cited_paper":"/paper/2110.02861","citing_paper":"/paper/2606.17800"},"observation_digest":"sha256:a57e441a1ee3821c9e14700b5523f292afc1a8611c53c78299f492af5da06e5b","observation_id":"a8f6dc79-f9db-49f2-b0a0-efad0d2b543e","resolution":{"observed_at":"2026-07-03T20:48:55.723997Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:09:02.214590Z","title":"Scaling rectified flow transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.17800","last_updated":"2026-06-16T11:25:37Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:25:37Z","title":"MaineCoon: Pursuing A Real-Time Audio-Visual Social World Model","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-27T01:09:02.214590Z"},"links":{"citing_paper":"/paper/2606.17800"},"observation_digest":"sha256:f462ef9940537f52d7cec19d42cfac4e2758276d41b7f75fc8c73575e2749545","observation_id":"1c95f4e5-5b87-4a9f-b90e-da4141c7b2fa","resolution":{"observed_at":"2026-06-27T01:09:02.214590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.25562","last_updated":"2026-04-27T06:21:52Z","snapshot_observed_at":"2026-07-06T22:50:41.736941Z","submitted_at":"2026-03-26T15:35:59Z","title":"Revisiting On-Policy Distillation: Empirical Failure Modes and Simple Fixes","version":2},"cited_work":{"arxiv_id":"2603.25562","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.25562","snapshot_observed_at":"2026-07-07T12:33:45.227324Z","title":"Revisiting On-Policy Distillation: Empirical Failure Modes and Simple Fixes","venue":"cs.LG","work_id":"8e059321-d6e4-4359-89eb-83ecbb93b657","year":2026},"citing_paper":{"arxiv_id":"2606.17800","last_updated":"2026-06-16T11:25:37Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:25:37Z","title":"MaineCoon: Pursuing A Real-Time Audio-Visual Social World Model","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-27T01:09:02.214590Z"},"links":{"cited_paper":"/paper/2603.25562","citing_paper":"/paper/2606.17800"},"observation_digest":"sha256:05b7468260b086a03c2247d723bc7990db9fe2f1ab7a980b192e94b49e3402a1","observation_id":"1d529a82-51c7-4862-a7de-4ce607f1a83e","resolution":{"observed_at":"2026-07-03T20:48:55.716162Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:09:02.214590Z","title":"Gemma 4 technical report","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.17800","last_updated":"2026-06-16T11:25:37Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:25:37Z","title":"MaineCoon: Pursuing A Real-Time Audio-Visual Social World Model","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-27T01:09:02.214590Z"},"links":{"citing_paper":"/paper/2606.17800"},"observation_digest":"sha256:d65d815c76cc70297883f3866cf08609052fa2c8107e319b734129815d1b9b53","observation_id":"2e512e04-de91-41ed-a648-8ed6d77fee6d","resolution":{"observed_at":"2026-06-27T01:09:02.214590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:09:02.214590Z","title":"Sample and computation redistribution for efficient face detection","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.17800","last_updated":"2026-06-16T11:25:37Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:25:37Z","title":"MaineCoon: Pursuing A Real-Time Audio-Visual Social World Model","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-27T01:09:02.214590Z"},"links":{"citing_paper":"/paper/2606.17800"},"observation_digest":"sha256:d6d6fac52fa01cda5e6f217f036328ec007a74e408bfd48fc86ee50bc0b5adf5","observation_id":"0333484b-48bd-4a34-bc88-4fc2f1d6c2cd","resolution":{"observed_at":"2026-06-27T01:09:02.214590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15702","last_updated":"2026-07-01T03:39:09Z","snapshot_observed_at":"2026-08-03T15:46:03.731716Z","submitted_at":"2025-12-17T18:53:29Z","title":"End-to-End Training for Autoregressive Video Diffusion via Self-Resampling","version":2},"cited_work":{"arxiv_id":"2512.15702","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.15702","snapshot_observed_at":"2026-07-10T01:46:41.136211Z","title":"End-to-end training for autoregressive video diffusion via self-resampling.arXiv preprint arXiv:2512.15702","venue":"cs.CV","work_id":"2c6453d6-0b89-4a86-b325-43ecf40d49aa","year":2025},"citing_paper":{"arxiv_id":"2606.17800","last_updated":"2026-06-16T11:25:37Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:25:37Z","title":"MaineCoon: Pursuing A Real-Time Audio-Visual Social World Model","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-27T01:09:02.214590Z"},"links":{"cited_paper":"/paper/2512.15702","citing_paper":"/paper/2606.17800"},"observation_digest":"sha256:77e76cb02475ec4f0a37335c22105d3bf3ce7a26ebfb14d30b837f7a3c992fb1","observation_id":"48bc9efe-aa3b-4cd4-9666-f731eca95f54","resolution":{"observed_at":"2026-07-03T20:48:55.713615Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.03233","last_updated":"2026-01-06T18:24:41Z","snapshot_observed_at":"2026-07-06T22:40:51.136169Z","submitted_at":"2026-01-06T18:24:41Z","title":"LTX-2: Efficient Joint Audio-Visual Foundation Model","version":1},"cited_work":{"arxiv_id":"2601.03233","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.03233","snapshot_observed_at":"2026-07-10T01:46:41.047035Z","title":"LTX-2: Efficient Joint Audio-Visual Foundation Model","venue":"cs.CV","work_id":"1334671f-ee98-4c53-a1d4-0805281f8d2b","year":2026},"citing_paper":{"arxiv_id":"2606.17800","last_updated":"2026-06-16T11:25:37Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:25:37Z","title":"MaineCoon: Pursuing A Real-Time Audio-Visual Social World Model","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-27T01:09:02.214590Z"},"links":{"cited_paper":"/paper/2601.03233","citing_paper":"/paper/2606.17800"},"observation_digest":"sha256:c9dd9e3350ffa338fb6cfe0e8b4d26f918fb683954113b8715c5e56cfc6527b1","observation_id":"26e2f9da-c686-4f28-9605-e9788da2feac","resolution":{"observed_at":"2026-07-03T20:48:55.732603Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.15868","last_updated":"2022-05-29T19:02:15Z","snapshot_observed_at":"2026-07-06T13:15:58.303738Z","submitted_at":"2022-05-29T19:02:15Z","title":"CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers","version":1},"cited_work":{"arxiv_id":"2205.15868","doi":"10.48550/arxiv.2205.15868","metadata_source":"pith","pith_arxiv_id":"2205.15868","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers","venue":"cs.CV","work_id":"2dbd6bcd-fc98-4fbf-b586-f6d94fe1abd2","year":2022},"citing_paper":{"arxiv_id":"2606.17800","last_updated":"2026-06-16T11:25:37Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:25:37Z","title":"MaineCoon: Pursuing A Real-Time Audio-Visual Social World Model","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-27T01:09:02.214590Z"},"links":{"cited_paper":"/paper/2205.15868","citing_paper":"/paper/2606.17800"},"observation_digest":"sha256:6f460c3e61a77297ac99f29c3949f0012b7d7402bafec372071f11048829b7d6","observation_id":"a05d971b-789d-4742-8f82-390a37df3c99","resolution":{"observed_at":"2026-07-03T20:48:55.721396Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:09:02.214590Z","title":"Self forcing: Bridging the train-test gap in autoregressive video diffusion.Advancesin Neural Information Processing Systems, 38:167283–167308, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.17800","last_updated":"2026-06-16T11:25:37Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:25:37Z","title":"MaineCoon: Pursuing A Real-Time Audio-Visual Social World Model","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-27T01:09:02.214590Z"},"links":{"citing_paper":"/paper/2606.17800"},"observation_digest":"sha256:7089a77818c94a82f15a61bdd830d3082002ccd96b5a9f6b453530346ba837db","observation_id":"009317f0-85ea-47ae-acd8-d7a4a9cd9a34","resolution":{"observed_at":"2026-06-27T01:09:02.214590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-05T15:09:20.961011Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":6},"cited_work":{"arxiv_id":"2512.04677","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.04677","snapshot_observed_at":"2026-07-04T20:00:07.549832Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","venue":"cs.CV","work_id":"6162e20b-7f90-4812-8c9b-a2423c67be80","year":2025},"citing_paper":{"arxiv_id":"2606.17800","last_updated":"2026-06-16T11:25:37Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:25:37Z","title":"MaineCoon: Pursuing A Real-Time Audio-Visual Social World Model","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-27T01:09:02.214590Z"},"links":{"cited_paper":"/paper/2512.04677","citing_paper":"/paper/2606.17800"},"observation_digest":"sha256:216829d3f0a6c448b99c68561175cd6b0b2fb88213ec1cc4df57efa27ec8573a","observation_id":"d644cd62-1d19-40a8-b50e-07e65f48a20f","resolution":{"observed_at":"2026-07-03T20:48:55.732426Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:09:02.214590Z","title":"Vbench: Comprehensive benchmark suite for video generative models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.17800","last_updated":"2026-06-16T11:25:37Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:25:37Z","title":"MaineCoon: Pursuing A Real-Time Audio-Visual Social World Model","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-27T01:09:02.214590Z"},"links":{"citing_paper":"/paper/2606.17800"},"observation_digest":"sha256:5c9f16e49fdca523783d8a68e0f270054fd1bd284a0d20aae5172a813ffd56d1","observation_id":"e4a9914f-049c-428d-892d-d20e9821ebef","resolution":{"observed_at":"2026-06-27T01:09:02.214590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:09:02.214590Z","title":"EasyOCR: Ready-to-use OCR with 80+ supported languages, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.17800","last_updated":"2026-06-16T11:25:37Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:25:37Z","title":"MaineCoon: Pursuing A Real-Time Audio-Visual Social World Model","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-27T01:09:02.214590Z"},"links":{"citing_paper":"/paper/2606.17800"},"observation_digest":"sha256:76da5ea081ad5e61c271f2cb75baac22849e649a63cab295a35c500d9fe99094","observation_id":"091d319d-7938-4772-86fb-a18d882f950c","resolution":{"observed_at":"2026-06-27T01:09:02.214590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17725","last_updated":"2024-10-23T09:55:22Z","snapshot_observed_at":"2026-07-06T19:38:22.461739Z","submitted_at":"2024-10-23T09:55:22Z","title":"YOLOv11: An Overview of the Key Architectural Enhancements","version":1},"cited_work":{"arxiv_id":"2410.17725","doi":"10.48550/arxiv.2410.17725","metadata_source":"pith","pith_arxiv_id":"2410.17725","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"YOLOv11: An Overview of the Key Architectural Enhancements","venue":"cs.CV","work_id":"17e84c13-a2a4-4b25-9b05-ca4ca212abfa","year":2024},"citing_paper":{"arxiv_id":"2606.17800","last_updated":"2026-06-16T11:25:37Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:25:37Z","title":"MaineCoon: Pursuing A Real-Time Audio-Visual Social World Model","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-27T01:09:02.214590Z"},"links":{"cited_paper":"/paper/2410.17725","citing_paper":"/paper/2606.17800"},"observation_digest":"sha256:c1eee3b637f808ca9ab5bb85e67bff6f4aaa8e80dde63a6936a03055e1d33664","observation_id":"878d4231-038b-4749-8217-d0e2e158bf9d","resolution":{"observed_at":"2026-07-03T20:48:55.734947Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-16T22:51:55.782635+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-16T22:51:55.782635+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":"1412.6980","doi":"10.1002/mrm.28086","metadata_source":"pith","pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Adam: A Method for Stochastic Optimization","venue":"cs.LG","work_id":"1910796d-9b52-4683-bf5c-de9632c1028b","year":2014},"citing_paper":{"arxiv_id":"2606.17800","last_updated":"2026-06-16T11:25:37Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:25:37Z","title":"MaineCoon: Pursuing A Real-Time Audio-Visual Social World Model","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-27T01:09:02.214590Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2606.17800"},"observation_digest":"sha256:529d8c1d0b1f12709c5d0b360baf97f89f98d99203f3b55efc820d14a4fa7732","observation_id":"491f773d-d92d-43d7-9962-6c495bff7273","resolution":{"observed_at":"2026-07-03T20:48:55.752888Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.01077","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T08:49:41.586816Z","title":"Pisa: Piecewise sparse attention is wiser for efficient diffusion transformers","venue":null,"work_id":"2b54676e-ec01-4f41-a01a-aab8df9f813a","year":2026},"citing_paper":{"arxiv_id":"2606.17800","last_updated":"2026-06-16T11:25:37Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:25:37Z","title":"MaineCoon: Pursuing A Real-Time Audio-Visual Social World Model","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-27T01:09:02.214590Z"},"links":{"citing_paper":"/paper/2606.17800"},"observation_digest":"sha256:9afbaf07ff9c2e5929bb322f5bb3e58bb8d8b39cdb4d35415da4e62a1898e131","observation_id":"0fefe8df-5672-49e5-90b2-3b5add8a1019","resolution":{"observed_at":"2026-07-03T20:48:55.714071Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:09:02.214590Z","title":"Joyai-echo: Pushing the frontier of long audio-visual generation","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.17800","last_updated":"2026-06-16T11:25:37Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:25:37Z","title":"MaineCoon: Pursuing A Real-Time Audio-Visual Social World Model","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-27T01:09:02.214590Z"},"links":{"citing_paper":"/paper/2606.17800"},"observation_digest":"sha256:59cd72dd8d2c8b3c76454c25e7b3e61f386adc6bda47d34c189aa784a8130c49","observation_id":"6a98142c-d505-444b-9493-adab73c25454","resolution":{"observed_at":"2026-06-27T01:09:02.214590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.15055","last_updated":"2026-05-14T16:49:09Z","snapshot_observed_at":"2026-08-01T03:43:04.469611Z","submitted_at":"2026-05-14T16:49:09Z","title":"DiffusionOPD: A Unified Perspective of On-Policy Distillation in Diffusion Models","version":1},"cited_work":{"arxiv_id":"2605.15055","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.15055","snapshot_observed_at":"2026-07-04T13:49:51.437520Z","title":"DiffusionOPD: A Unified Perspective of On-Policy Distillation in Diffusion Models","venue":"cs.LG","work_id":"2fb0ab5c-4873-4aeb-8ff4-085b4c77a41c","year":2026},"citing_paper":{"arxiv_id":"2606.17800","last_updated":"2026-06-16T11:25:37Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:25:37Z","title":"MaineCoon: Pursuing A Real-Time Audio-Visual Social World Model","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-27T01:09:02.214590Z"},"links":{"cited_paper":"/paper/2605.15055","citing_paper":"/paper/2606.17800"},"observation_digest":"sha256:86b6ce8995c7a6135c615893d2bdb473478dfecd99328e41af4e02961f04396e","observation_id":"c5880588-4c6a-4a29-8c18-babfafbf871d","resolution":{"observed_at":"2026-07-03T20:48:55.694810Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:09:02.214590Z","title":"Alignment of diffusion models: Fundamentals, challenges, and future.ACM Computing Surveys, 58(9):1–37, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.17800","last_updated":"2026-06-16T11:25:37Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:25:37Z","title":"MaineCoon: Pursuing A Real-Time Audio-Visual Social World Model","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-27T01:09:02.214590Z"},"links":{"citing_paper":"/paper/2606.17800"},"observation_digest":"sha256:231990ee122624a7d20c48a8289b82c2932b5af3f2755592f296571167a3757a","observation_id":"aebee43d-4aa6-4ddc-986f-f15f8ce2d036","resolution":{"observed_at":"2026-06-27T01:09:02.214590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:09:02.214590Z","title":"Timestep embedding tells: It’s time to cache for video diffusion model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.17800","last_updated":"2026-06-16T11:25:37Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:25:37Z","title":"MaineCoon: Pursuing A Real-Time Audio-Visual Social World Model","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-27T01:09:02.214590Z"},"links":{"citing_paper":"/paper/2606.17800"},"observation_digest":"sha256:aad26d299c16b01543061d441541329c064abc97f2ac455cb19b98ccc35fe9d4","observation_id":"9e8b5f29-9729-47aa-b534-0ad718dd6260","resolution":{"observed_at":"2026-06-27T01:09:02.214590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:09:02.214590Z","title":"Flow-grpo: Training flow matching models via online rl.Advances in neural information processing systems, 38:40783–40818, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.17800","last_updated":"2026-06-16T11:25:37Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:25:37Z","title":"MaineCoon: Pursuing A Real-Time Audio-Visual Social World Model","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-27T01:09:02.214590Z"},"links":{"citing_paper":"/paper/2606.17800"},"observation_digest":"sha256:c6eba8bbecf915a3322422320423f2a6ac7c6fe35b0f0214dc273bdb1349f7f0","observation_id":"d0b0c9e9-1d3d-445c-9102-a984054956e4","resolution":{"observed_at":"2026-06-27T01:09:02.214590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.23377","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T12:41:04.381869Z","title":"JavisDiT: Joint audio-video diffusion transformer with hierarchical spatio-temporal prior synchronization","venue":null,"work_id":"3b03d007-725f-4692-9648-a2785e1e2398","year":2025},"citing_paper":{"arxiv_id":"2606.17800","last_updated":"2026-06-16T11:25:37Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:25:37Z","title":"MaineCoon: Pursuing A Real-Time Audio-Visual Social World Model","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-27T01:09:02.214590Z"},"links":{"citing_paper":"/paper/2606.17800"},"observation_digest":"sha256:a4a6440ae267c410103be5cff0d4e0447c6e2bd9327a84d2024a94917935bcc5","observation_id":"f1610008-edf4-404e-b4b4-bc6cea6525ec","resolution":{"observed_at":"2026-07-03T20:48:55.697492Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.19163","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T20:48:55.709500Z","title":"Ilya Loshchilov and Frank Hutter","venue":null,"work_id":"59aaef1a-efc0-4078-b139-ac7e5a7c58f9","year":2026},"citing_paper":{"arxiv_id":"2606.17800","last_updated":"2026-06-16T11:25:37Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:25:37Z","title":"MaineCoon: Pursuing A Real-Time Audio-Visual Social World Model","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-27T01:09:02.214590Z"},"links":{"citing_paper":"/paper/2606.17800"},"observation_digest":"sha256:82051b9cf0aede8beb6aba59fb082f3153ba1999649d92160c38b35489a39aea","observation_id":"60f84432-e8de-45cf-aa1a-e99349ae27f1","resolution":{"observed_at":"2026-07-03T20:48:55.711049Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.25161","last_updated":"2025-09-29T17:57:14Z","snapshot_observed_at":"2026-07-06T22:31:10.099674Z","submitted_at":"2025-09-29T17:57:14Z","title":"Rolling Forcing: Autoregressive Long Video Diffusion in Real Time","version":1},"cited_work":{"arxiv_id":"2509.25161","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.25161","snapshot_observed_at":"2026-07-08T10:54:49.169100Z","title":"Rolling Forcing: Autoregressive Long Video Diffusion in Real Time","venue":"cs.CV","work_id":"e44fcf99-6683-4319-a07d-0db4c89ff93c","year":2025},"citing_paper":{"arxiv_id":"2606.17800","last_updated":"2026-06-16T11:25:37Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:25:37Z","title":"MaineCoon: Pursuing A Real-Time Audio-Visual Social World Model","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-27T01:09:02.214590Z"},"links":{"cited_paper":"/paper/2509.25161","citing_paper":"/paper/2606.17800"},"observation_digest":"sha256:c8e4a3be4123bc3f3a0f297f3335b188da823e5104b4d815634fd38e52116c2c","observation_id":"035dbc88-a657-4a14-9e78-4c3926a71000","resolution":{"observed_at":"2026-07-03T20:48:55.692199Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:09:02.214590Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.17800","last_updated":"2026-06-16T11:25:37Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:25:37Z","title":"MaineCoon: Pursuing A Real-Time Audio-Visual Social World Model","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-27T01:09:02.214590Z"},"links":{"citing_paper":"/paper/2606.17800"},"observation_digest":"sha256:e0a2c385236cc0f1f6f771aa0bd2078763383f70062e9bcb8ac19ba992f48674","observation_id":"70ed78ee-6b3f-40d3-a518-924dd840dc03","resolution":{"observed_at":"2026-06-27T01:09:02.214590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.01284","last_updated":"2025-09-30T21:03:50Z","snapshot_observed_at":"2026-08-04T22:22:45.362136Z","submitted_at":"2025-09-30T21:03:50Z","title":"Ovi: Twin Backbone Cross-Modal Fusion for Audio-Video Generation","version":1},"cited_work":{"arxiv_id":"2510.01284","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.01284","snapshot_observed_at":"2026-07-05T12:41:04.361399Z","title":"Ovi: Twin Backbone Cross-Modal Fusion for Audio-Video Generation","venue":"cs.MM","work_id":"4ea3b1fc-d272-47f2-88a8-36cbeaa92448","year":2025},"citing_paper":{"arxiv_id":"2606.17800","last_updated":"2026-06-16T11:25:37Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:25:37Z","title":"MaineCoon: Pursuing A Real-Time Audio-Visual Social World Model","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-27T01:09:02.214590Z"},"links":{"cited_paper":"/paper/2510.01284","citing_paper":"/paper/2606.17800"},"observation_digest":"sha256:18f3d6655c146042a9d1cedf46661cd2c7a74bee86d9fd503875164fe5815f5e","observation_id":"1ec2a4f5-740c-462b-a6d6-27fdab4168d8","resolution":{"observed_at":"2026-07-03T20:48:55.730338Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:09:02.214590Z","title":"Krea realtime 14b: Real-time video generation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.17800","last_updated":"2026-06-16T11:25:37Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:25:37Z","title":"MaineCoon: Pursuing A Real-Time Audio-Visual Social World Model","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-27T01:09:02.214590Z"},"links":{"citing_paper":"/paper/2606.17800"},"observation_digest":"sha256:0660f3ba36a2aba6ab53c4f21427c436f4dfdda8ff5b0eb113f7f46f27278854","observation_id":"4125ae60-ca8a-4f86-aa00-8cdb46688c59","resolution":{"observed_at":"2026-06-27T01:09:02.214590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:09:02.214590Z","title":"Robust speech recognition via large-scale weak supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.17800","last_updated":"2026-06-16T11:25:37Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:25:37Z","title":"MaineCoon: Pursuing A Real-Time Audio-Visual Social World Model","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-27T01:09:02.214590Z"},"links":{"citing_paper":"/paper/2606.17800"},"observation_digest":"sha256:df606f88f92f1eabe8b5aba3393981a8750ab7d616b2e9db77ef905a3fc42518","observation_id":"1a6e5ca9-1d58-45b9-8a21-7bbae1ebf267","resolution":{"observed_at":"2026-06-27T01:09:02.214590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13319","last_updated":"2025-03-31T11:03:18Z","snapshot_observed_at":"2026-07-06T20:54:00.272496Z","submitted_at":"2025-03-17T15:58:27Z","title":"MagicDistillation: Weak-to-Strong Video Distillation for Large-Scale Few-Step Synthesis","version":2},"cited_work":{"arxiv_id":"2503.13319","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.13319","snapshot_observed_at":"2026-07-03T20:48:55.720483Z","title":"Magicdistillation: Weak-to-strong video distillation for large-scale few-step synthesis","venue":null,"work_id":"bb8a052f-d70e-4522-91df-4a5c570391e5","year":2025},"citing_paper":{"arxiv_id":"2606.17800","last_updated":"2026-06-16T11:25:37Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:25:37Z","title":"MaineCoon: Pursuing A Real-Time Audio-Visual Social World Model","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-27T01:09:02.214590Z"},"links":{"cited_paper":"/paper/2503.13319","citing_paper":"/paper/2606.17800"},"observation_digest":"sha256:f0d71e1feda5ca98952678d65c9e4bb8af5da5b8e70a7eb3ae528f5f26cd588f","observation_id":"20e6b02d-a125-4907-bf4b-56e732136e98","resolution":{"observed_at":"2026-07-03T20:48:55.722024Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.15911","last_updated":"2026-04-17T10:11:39Z","snapshot_observed_at":"2026-07-06T23:03:21.422544Z","submitted_at":"2026-04-17T10:11:39Z","title":"Efficient Video Diffusion Models: Advancements and Challenges","version":1},"cited_work":{"arxiv_id":"2604.15911","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.15911","snapshot_observed_at":"2026-07-08T14:44:59.784480Z","title":"Efficient Video Diffusion Models: Advancements and Challenges","venue":"cs.CV","work_id":"9a3b894d-552a-4b04-9f5e-762cbcca4de2","year":2026},"citing_paper":{"arxiv_id":"2606.17800","last_updated":"2026-06-16T11:25:37Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:25:37Z","title":"MaineCoon: Pursuing A Real-Time Audio-Visual Social World Model","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-27T01:09:02.214590Z"},"links":{"cited_paper":"/paper/2604.15911","citing_paper":"/paper/2606.17800"},"observation_digest":"sha256:e9ee3cb7d4216f4da4f400e156c519804e37871028a03ca47faaaa380001e8b3","observation_id":"e670727a-1949-46f3-b617-4c777b83d4e4","resolution":{"observed_at":"2026-07-03T20:48:55.745991Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:09:02.214590Z","title":"Fastlightgen: Fast and light video generation with fewer steps and parameters","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.17800","last_updated":"2026-06-16T11:25:37Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:25:37Z","title":"MaineCoon: Pursuing A Real-Time Audio-Visual Social World Model","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-27T01:09:02.214590Z"},"links":{"citing_paper":"/paper/2606.17800"},"observation_digest":"sha256:0e8ae05db5b45547ebc6a5401787dbf5c55397c8eeb7a28fc0e527672cb6639c","observation_id":"4dd845c9-dc2b-411f-9d80-ee4e96e18c7d","resolution":{"observed_at":"2026-06-27T01:09:02.214590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:09:02.214590Z","title":"Liveditor-14b: Lightning unified video editing via in-context sparse attention","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.17800","last_updated":"2026-06-16T11:25:37Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:25:37Z","title":"MaineCoon: Pursuing A Real-Time Audio-Visual Social World Model","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-27T01:09:02.214590Z"},"links":{"citing_paper":"/paper/2606.17800"},"observation_digest":"sha256:960cfd840c22452badc95f4ab0ef0a3f2f34e731b64176069cc680c6eba921d4","observation_id":"382c8f9c-95c6-4f64-bced-79e63b815a04","resolution":{"observed_at":"2026-06-27T01:09:02.214590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:09:02.214590Z","title":"Silero VAD: pre-trained enterprise-grade voice activity detector, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.17800","last_updated":"2026-06-16T11:25:37Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:25:37Z","title":"MaineCoon: Pursuing A Real-Time Audio-Visual Social World Model","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-27T01:09:02.214590Z"},"links":{"citing_paper":"/paper/2606.17800"},"observation_digest":"sha256:75d85fec6404e02fff6aa67b7e78b73c5530433da2b2f38a8f2547b28fe2a5c0","observation_id":"abd2b0b6-0f17-4010-a688-107281f5edd4","resolution":{"observed_at":"2026-06-27T01:09:02.214590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.00626","last_updated":"2026-06-18T17:00:51Z","snapshot_observed_at":"2026-07-13T14:57:31.836214Z","submitted_at":"2026-04-01T08:32:34Z","title":"A Survey of On-Policy Distillation for Large Language Models","version":4},"cited_work":{"arxiv_id":"2604.00626","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.00626","snapshot_observed_at":"2026-07-10T00:26:39.257599Z","title":"A Survey of On-Policy Distillation for Large Language Models","venue":"cs.LG","work_id":"f6aaea8e-1f0d-43e3-b28f-6066d3e0a66b","year":2026},"citing_paper":{"arxiv_id":"2606.17800","last_updated":"2026-06-16T11:25:37Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:25:37Z","title":"MaineCoon: Pursuing A Real-Time Audio-Visual Social World Model","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-27T01:09:02.214590Z"},"links":{"cited_paper":"/paper/2604.00626","citing_paper":"/paper/2606.17800"},"observation_digest":"sha256:d5abe5371119e44dec20010147efeed54abda3d768191c4871c0ec340831e74d","observation_id":"dc4d459e-c848-4167-99c6-bccd753b2a3f","resolution":{"observed_at":"2026-07-03T20:48:55.681098Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2008.04838","last_updated":"2020-08-11T16:37:59Z","snapshot_observed_at":"2026-08-03T19:11:12.569454Z","submitted_at":"2020-08-11T16:37:59Z","title":"TransNet V2: An effective deep network architecture for fast shot transition detection","version":1},"cited_work":{"arxiv_id":"2008.04838","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2008.04838","snapshot_observed_at":"2026-07-04T06:29:36.931995Z","title":"arXiv preprint arXiv:2008.04838 (2020)","venue":null,"work_id":"16ef49be-5783-4e0a-a993-09cdb1ab77c3","year":2008},"citing_paper":{"arxiv_id":"2606.17800","last_updated":"2026-06-16T11:25:37Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:25:37Z","title":"MaineCoon: Pursuing A Real-Time Audio-Visual Social World Model","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-27T01:09:02.214590Z"},"links":{"cited_paper":"/paper/2008.04838","citing_paper":"/paper/2606.17800"},"observation_digest":"sha256:6d323f09bb30fd4d35f95d94032f9375d1dd4815a9dde5430723f851ff4b6706","observation_id":"73c0f837-14a9-40fd-995e-b5d72a304157","resolution":{"observed_at":"2026-07-03T20:48:55.750550Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.11647","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T16:49:57.649224Z","title":"Omniforcing: Unleashing real-time joint audio-visual generation","venue":null,"work_id":"10078c6b-bb46-407a-9aa3-312d149e6d74","year":2026},"citing_paper":{"arxiv_id":"2606.17800","last_updated":"2026-06-16T11:25:37Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:25:37Z","title":"MaineCoon: Pursuing A Real-Time Audio-Visual Social World Model","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-27T01:09:02.214590Z"},"links":{"citing_paper":"/paper/2606.17800"},"observation_digest":"sha256:1dcc2e4bf0facdfadd51ef1bb4285c29c91cb0fef5ed1bf7148d4093199664c7","observation_id":"088ea716-3d70-4593-8868-ba82ab46e464","resolution":{"observed_at":"2026-07-03T20:48:55.755568Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.23429","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T13:14:53.166628Z","title":"Hunyuan-gamecraft-2: Instruction-following interactive game world model","venue":null,"work_id":"49842da5-5896-4a8d-a8df-fe0f89b249d6","year":2025},"citing_paper":{"arxiv_id":"2606.17800","last_updated":"2026-06-16T11:25:37Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:25:37Z","title":"MaineCoon: Pursuing A Real-Time Audio-Visual Social World Model","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-27T01:09:02.214590Z"},"links":{"citing_paper":"/paper/2606.17800"},"observation_digest":"sha256:474c57e9684d25186d786097a330ef3a58586c7433acc386294a184ea9b5d16f","observation_id":"bfc2bc9a-e6a9-4949-a7ce-da972c6b29fd","resolution":{"observed_at":"2026-07-03T20:48:55.740819Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":"2312.11805","doi":"10.1038/nrn2888","metadata_source":"pith","pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemini: A Family of Highly Capable Multimodal Models","venue":"cs.CL","work_id":"83f7c85b-3f11-450f-ac0c-64d9745220b2","year":2023},"citing_paper":{"arxiv_id":"2606.17800","last_updated":"2026-06-16T11:25:37Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:25:37Z","title":"MaineCoon: Pursuing A Real-Time Audio-Visual Social World Model","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-27T01:09:02.214590Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2606.17800"},"observation_digest":"sha256:79524edaa56472ac85a26b3dc35eff689920bb5256ec1b4d7869722aab170ae5","observation_id":"bde9766a-a6fe-4e29-a38f-d7faac39b441","resolution":{"observed_at":"2026-07-03T20:48:55.667113Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.08794","doi":"10.48550/arxiv.2602.08794","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mova: Towards scalable and synchronized video-audio generation","venue":"Open MIND","work_id":"1ec90ca8-482d-433a-94ad-2005f2c6fe8f","year":2026},"citing_paper":{"arxiv_id":"2606.17800","last_updated":"2026-06-16T11:25:37Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:25:37Z","title":"MaineCoon: Pursuing A Real-Time Audio-Visual Social World Model","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-27T01:09:02.214590Z"},"links":{"citing_paper":"/paper/2606.17800"},"observation_digest":"sha256:d2c3d596df60a32b81aeef36e35a9132e12f491ee57c286ea479b5e41caa0b70","observation_id":"b58486d8-8e1c-4d07-b2d8-70f5cb60de2f","resolution":{"observed_at":"2026-07-03T20:48:55.743399Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:09:02.214590Z","title":"Diffusion model alignment using direct preference optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.17800","last_updated":"2026-06-16T11:25:37Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:25:37Z","title":"MaineCoon: Pursuing A Real-Time Audio-Visual Social World Model","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-27T01:09:02.214590Z"},"links":{"citing_paper":"/paper/2606.17800"},"observation_digest":"sha256:d7c88dfc044fc6096125deacb75fc442e7855549f7a7534a3420973d75b042bd","observation_id":"1f136815-40fe-4e67-89da-ddc3b2d5acf7","resolution":{"observed_at":"2026-06-27T01:09:02.214590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":"2503.20314","doi":"10.1109/19.492748","metadata_source":"pith","pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","venue":"cs.CV","work_id":"ad3ebc3b-4224-46c9-b61d-bcf135da0a7c","year":2025},"citing_paper":{"arxiv_id":"2606.17800","last_updated":"2026-06-16T11:25:37Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:25:37Z","title":"MaineCoon: Pursuing A Real-Time Audio-Visual Social World Model","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-27T01:09:02.214590Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2606.17800"},"observation_digest":"sha256:25d71194351c4fd06a577cb168df55482111e22b95f54076cbb40907ee9b0b67","observation_id":"6f371491-9900-4d09-91f9-f309d81ce86c","resolution":{"observed_at":"2026-07-03T20:48:55.737672Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2511.18870","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-10T01:46:40.932396Z","title":"HunyuanVideo 1.5 Technical Report","venue":"cs.CV","work_id":"ed898a38-b053-407c-bbce-41561510c1de","year":2025},"citing_paper":{"arxiv_id":"2606.17800","last_updated":"2026-06-16T11:25:37Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:25:37Z","title":"MaineCoon: Pursuing A Real-Time Audio-Visual Social World Model","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-27T01:09:02.214590Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2606.17800"},"observation_digest":"sha256:6b7e62265db3fd5bf6d12e4a6debbec140bc5c52419e356603c74595ac32e273","observation_id":"a1900dbd-2862-4953-90ca-7f747d6346cb","resolution":{"observed_at":"2026-07-03T20:48:55.745718Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.02324","last_updated":"2025-08-04T11:49:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-04T11:49:20Z","title":"Qwen-Image Technical Report","version":1},"cited_work":{"arxiv_id":"2508.02324","doi":"10.48550/arxiv.2508.02324","metadata_source":"pith","pith_arxiv_id":"2508.02324","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen-Image Technical Report","venue":"cs.CV","work_id":"d06d7ecc-7579-4f89-a60b-4278a0f3c562","year":2025},"citing_paper":{"arxiv_id":"2606.17800","last_updated":"2026-06-16T11:25:37Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:25:37Z","title":"MaineCoon: Pursuing A Real-Time Audio-Visual Social World Model","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-27T01:09:02.214590Z"},"links":{"cited_paper":"/paper/2508.02324","citing_paper":"/paper/2606.17800"},"observation_digest":"sha256:d6d41921e3ddc1d1e559f8b71cadc13dc2d9544c656c6284d39a6407c69774d6","observation_id":"9fa2a114-21ab-4175-b7f8-480f72ab12cb","resolution":{"observed_at":"2026-07-03T20:48:55.748232Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-21T15:23:05.016381+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T15:23:05.016381+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:09:02.214590Z","title":"Longvideobench: A benchmark for long-context interleaved video-language understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.17800","last_updated":"2026-06-16T11:25:37Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:25:37Z","title":"MaineCoon: Pursuing A Real-Time Audio-Visual Social World Model","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-27T01:09:02.214590Z"},"links":{"citing_paper":"/paper/2606.17800"},"observation_digest":"sha256:38ec2dca7638523e0143b9d735cebe89dbfcbcd3fd5ed296c47ac1a6cdc0a6cc","observation_id":"cfd8da29-7b24-4233-9b19-7a127a3b6f40","resolution":{"observed_at":"2026-06-27T01:09:02.214590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.22622","last_updated":"2025-10-13T22:41:26Z","snapshot_observed_at":"2026-07-06T22:30:55.313733Z","submitted_at":"2025-09-26T17:48:24Z","title":"LongLive: Real-time Interactive Long Video Generation","version":2},"cited_work":{"arxiv_id":"2509.22622","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.22622","snapshot_observed_at":"2026-07-09T07:56:04.670863Z","title":"LongLive: Real-time Interactive Long Video Generation","venue":"cs.CV","work_id":"29ec6550-6ac1-4cc6-8aae-b4206f1d5b38","year":2025},"citing_paper":{"arxiv_id":"2606.17800","last_updated":"2026-06-16T11:25:37Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:25:37Z","title":"MaineCoon: Pursuing A Real-Time Audio-Visual Social World Model","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-27T01:09:02.214590Z"},"links":{"cited_paper":"/paper/2509.22622","citing_paper":"/paper/2606.17800"},"observation_digest":"sha256:4d0cdefdfbd07b047d87ff31b24236082a6fba4189d33754c987fa904bfc8336","observation_id":"ccfe6001-d7b6-4452-a446-b7504c6998a8","resolution":{"observed_at":"2026-07-03T20:48:55.683621Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:09:02.214590Z","title":"Sparse videogen2: Accelerate video generation with sparse attention via semantic-aware permutation","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.17800","last_updated":"2026-06-16T11:25:37Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:25:37Z","title":"MaineCoon: Pursuing A Real-Time Audio-Visual Social World Model","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-27T01:09:02.214590Z"},"links":{"citing_paper":"/paper/2606.17800"},"observation_digest":"sha256:95790879c7d1cd9a0fa5824a81d3325f10bb9bde1779bf3ae01a191a99b21932","observation_id":"9b55799b-a8e6-4398-9b97-70f9563e9d45","resolution":{"observed_at":"2026-06-27T01:09:02.214590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:09:02.214590Z","title":"Improved distribution matching distillation for fast image synthesis.Advancesin neural information processing systems, 37:47455–47487, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.17800","last_updated":"2026-06-16T11:25:37Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:25:37Z","title":"MaineCoon: Pursuing A Real-Time Audio-Visual Social World Model","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-27T01:09:02.214590Z"},"links":{"citing_paper":"/paper/2606.17800"},"observation_digest":"sha256:15bcb206c3e6e381d0591e6825821a2414f4205cc60230cafa7b1db2612e8c60","observation_id":"87466778-c3a0-4d69-93cf-dda94dcc9c0d","resolution":{"observed_at":"2026-06-27T01:09:02.214590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:09:02.214590Z","title":"One-step diffusion with distribution matching distillation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.17800","last_updated":"2026-06-16T11:25:37Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:25:37Z","title":"MaineCoon: Pursuing A Real-Time Audio-Visual Social World Model","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-27T01:09:02.214590Z"},"links":{"citing_paper":"/paper/2606.17800"},"observation_digest":"sha256:599b2d0207495741790c5b53990fda968001a4fe601f4707a59dc2e4b01797bc","observation_id":"d3e7385c-6734-4025-b70e-ab9d31c3cce4","resolution":{"observed_at":"2026-06-27T01:09:02.214590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:09:02.214590Z","title":"From slow bidirectional to fast autoregressive video diffusion models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.17800","last_updated":"2026-06-16T11:25:37Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:25:37Z","title":"MaineCoon: Pursuing A Real-Time Audio-Visual Social World Model","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-27T01:09:02.214590Z"},"links":{"citing_paper":"/paper/2606.17800"},"observation_digest":"sha256:f3a642b2f318afffdca07f9fe3aea7eb51974a38687d55faf58b57738ea9c23a","observation_id":"d325a953-9702-456d-95e9-581c5f88c07b","resolution":{"observed_at":"2026-06-27T01:09:02.214590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06940","last_updated":"2025-06-18T04:35:42Z","snapshot_observed_at":"2026-07-06T19:30:26.233621Z","submitted_at":"2024-10-09T14:34:53Z","title":"Representation Alignment for Generation: Training Diffusion Transformers Is Easier Than You Think","version":4},"cited_work":{"arxiv_id":"2410.06940","doi":"10.48550/arxiv.2410.06940","metadata_source":"pith","pith_arxiv_id":"2410.06940","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Representation Alignment for Generation: Training Diffusion Transformers Is Easier Than You Think","venue":"cs.CV","work_id":"1aff8ef8-079b-4afe-9e6a-148e6fd08e6a","year":2024},"citing_paper":{"arxiv_id":"2606.17800","last_updated":"2026-06-16T11:25:37Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:25:37Z","title":"MaineCoon: Pursuing A Real-Time Audio-Visual Social World Model","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-06-27T01:09:02.214590Z"},"links":{"cited_paper":"/paper/2410.06940","citing_paper":"/paper/2606.17800"},"observation_digest":"sha256:f4aed8d175b5ee090176193aa4ff23f892a6c517563aab40556db96868db0c81","observation_id":"47a33905-e682-4d50-8ee9-3217b0333256","resolution":{"observed_at":"2026-07-03T20:48:55.698823Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:09:02.214590Z","title":"Soulx-flashtalk: Real-time infinite streaming of audio-driven avatars via self-correcting bidirectional distillation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.17800","last_updated":"2026-06-16T11:25:37Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:25:37Z","title":"MaineCoon: Pursuing A Real-Time Audio-Visual Social World Model","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-06-27T01:09:02.214590Z"},"links":{"citing_paper":"/paper/2606.17800"},"observation_digest":"sha256:816e6cffced78a50c7070408b7bda5e3d0ed43368462abced79109963bc39018","observation_id":"11538768-8a02-43ff-b5c1-8d920cbdc22d","resolution":{"observed_at":"2026-06-27T01:09:02.214590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.04379","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T13:14:53.244905Z","title":"Improved distribution matching distillation for fast image synthesis.Advances in neural information processing systems, 37:47455–47487, 2024a","venue":null,"work_id":"005eb8db-424f-4973-a65a-d7f9c23eac02","year":2026},"citing_paper":{"arxiv_id":"2606.17800","last_updated":"2026-06-16T11:25:37Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:25:37Z","title":"MaineCoon: Pursuing A Real-Time Audio-Visual Social World Model","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-06-27T01:09:02.214590Z"},"links":{"citing_paper":"/paper/2606.17800"},"observation_digest":"sha256:5ab90bab4cb5b97a25bd5b144dd8898b922d56046532e331b56bf7b5eeb83d84","observation_id":"12d65a8f-9490-460a-b98a-c693b6f49064","resolution":{"observed_at":"2026-07-03T20:48:55.724760Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.16666","last_updated":"2026-03-23T05:41:14Z","snapshot_observed_at":"2026-07-06T22:49:23.750692Z","submitted_at":"2026-03-17T15:33:43Z","title":"Fast-WAM: Do World Action Models Need Test-time Future Imagination?","version":2},"cited_work":{"arxiv_id":"2603.16666","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.16666","snapshot_observed_at":"2026-07-10T18:47:31.580281Z","title":"Fast-WAM: Do World Action Models Need Test-time Future Imagination?","venue":"cs.CV","work_id":"772d0226-9ad6-42c0-9c79-d36d37edbbe4","year":2026},"citing_paper":{"arxiv_id":"2606.17800","last_updated":"2026-06-16T11:25:37Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:25:37Z","title":"MaineCoon: Pursuing A Real-Time Audio-Visual Social World Model","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-06-27T01:09:02.214590Z"},"links":{"cited_paper":"/paper/2603.16666","citing_paper":"/paper/2606.17800"},"observation_digest":"sha256:5c73d7ec4197d37d46d3cb59ca8db6fee6ef9bf02217e9d5d2489fde573143b3","observation_id":"a0500ec4-14d0-456f-b477-7315172c247a","resolution":{"observed_at":"2026-07-03T20:48:55.716418Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:09:02.214590Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.17800","last_updated":"2026-06-16T11:25:37Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:25:37Z","title":"MaineCoon: Pursuing A Real-Time Audio-Visual Social World Model","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-06-27T01:09:02.214590Z"},"links":{"citing_paper":"/paper/2606.17800"},"observation_digest":"sha256:da1c19d3c9b7132fc73abd213117b15ade45e158184af16443d0a7df53a59ad6","observation_id":"b4f63ff8-0c60-4d4c-897c-7c591a3a569c","resolution":{"observed_at":"2026-06-27T01:09:02.214590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:09:02.214590Z","title":"Spargeattention: Accurate and training-free sparse attention accelerating any model inference","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.17800","last_updated":"2026-06-16T11:25:37Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:25:37Z","title":"MaineCoon: Pursuing A Real-Time Audio-Visual Social World Model","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-06-27T01:09:02.214590Z"},"links":{"citing_paper":"/paper/2606.17800"},"observation_digest":"sha256:b763c7b369067b9faed3e362212c377e37a365ce969e1bc1d6c23420d16ed9c7","observation_id":"b0aea86a-5ca9-4b46-b8a0-b25e4fdda32c","resolution":{"observed_at":"2026-06-27T01:09:02.214590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:09:02.214590Z","title":"Faster video diffusion with trainable sparse attention.Advances in Neural Information Processing Systems, 38: 152509–152534, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.17800","last_updated":"2026-06-16T11:25:37Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:25:37Z","title":"MaineCoon: Pursuing A Real-Time Audio-Visual Social World Model","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-06-27T01:09:02.214590Z"},"links":{"citing_paper":"/paper/2606.17800"},"observation_digest":"sha256:c7c80344dd8f0ee1aa1f41d7ac3dbb35f0352f82fecba09583fc3ef04fecf5b8","observation_id":"057113b3-6a28-4199-be9a-8b43b4710ac3","resolution":{"observed_at":"2026-06-27T01:09:02.214590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23656","last_updated":"2025-05-29T17:06:44Z","snapshot_observed_at":"2026-07-06T21:33:02.686798Z","submitted_at":"2025-05-29T17:06:44Z","title":"VideoREPA: Learning Physics for Video Generation through Relational Alignment with Foundation Models","version":1},"cited_work":{"arxiv_id":"2505.23656","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23656","snapshot_observed_at":"2026-07-04T16:59:58.033217Z","title":"arXiv preprint arXiv:2505.23656 (2025)","venue":null,"work_id":"d810b0fc-7ae5-44e9-bd6e-bf39477b57a2","year":2025},"citing_paper":{"arxiv_id":"2606.17800","last_updated":"2026-06-16T11:25:37Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:25:37Z","title":"MaineCoon: Pursuing A Real-Time Audio-Visual Social World Model","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-06-27T01:09:02.214590Z"},"links":{"cited_paper":"/paper/2505.23656","citing_paper":"/paper/2606.17800"},"observation_digest":"sha256:46d001a7b6fb7429391926f31bc7e740c09e38dd4eee340c592381fddf2671ec","observation_id":"fa4e91e3-0bc4-46b1-9ce4-87de4c77cc3e","resolution":{"observed_at":"2026-07-03T20:48:55.711321Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02540","last_updated":"2025-02-22T16:29:03Z","snapshot_observed_at":"2026-07-06T18:25:22.852874Z","submitted_at":"2024-06-04T17:57:10Z","title":"ViDiT-Q: Efficient and Accurate Quantization of Diffusion Transformers for Image and Video Generation","version":3},"cited_work":{"arxiv_id":"2406.02540","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.02540","snapshot_observed_at":"2026-07-03T20:48:55.686449Z","title":"Vidit-q: Efficient and accurate quantization of diffusion transformers for image and video genera- tion","venue":null,"work_id":"e48c18fd-8b2d-4817-8981-60bdc8141677","year":2024},"citing_paper":{"arxiv_id":"2606.17800","last_updated":"2026-06-16T11:25:37Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:25:37Z","title":"MaineCoon: Pursuing A Real-Time Audio-Visual Social World Model","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-06-27T01:09:02.214590Z"},"links":{"cited_paper":"/paper/2406.02540","citing_paper":"/paper/2606.17800"},"observation_digest":"sha256:185d599566753552f6b7dde25aa12e0d9ac919d2e8aa3b0058e60ff4bd166d73","observation_id":"ac6aa09c-3e61-43e6-a0df-5c65c2dffeb4","resolution":{"observed_at":"2026-07-03T20:48:55.688078Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.16117","last_updated":"2026-02-16T17:14:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-19T16:09:33Z","title":"DiffusionNFT: Online Diffusion Reinforcement with Forward Process","version":2},"cited_work":{"arxiv_id":"2509.16117","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.16117","snapshot_observed_at":"2026-07-04T19:50:11.382174Z","title":"DiffusionNFT: Online Diffusion Reinforcement with Forward Process","venue":"cs.LG","work_id":"0ed3cf57-36ba-4962-847e-7a8f5f99901d","year":2025},"citing_paper":{"arxiv_id":"2606.17800","last_updated":"2026-06-16T11:25:37Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:25:37Z","title":"MaineCoon: Pursuing A Real-Time Audio-Visual Social World Model","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-06-27T01:09:02.214590Z"},"links":{"cited_paper":"/paper/2509.16117","citing_paper":"/paper/2606.17800"},"observation_digest":"sha256:6c33e46040de2bfa4c448d4a55b6786a218adc013d374c4765e5017c24ba4b6c","observation_id":"0b5ccfd4-ed3d-4732-9302-09a5573ec089","resolution":{"observed_at":"2026-07-03T20:48:55.696397Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.15178","last_updated":"2026-05-14T17:58:03Z","snapshot_observed_at":"2026-08-01T20:39:32.341477Z","submitted_at":"2026-05-14T17:58:03Z","title":"SANA-WM: Efficient Minute-Scale World Modeling with Hybrid Linear Diffusion Transformer","version":1},"cited_work":{"arxiv_id":"2605.15178","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.15178","snapshot_observed_at":"2026-07-09T07:56:04.735190Z","title":"SANA-WM: Efficient Minute-Scale World Modeling with Hybrid Linear Diffusion Transformer","venue":"cs.CV","work_id":"b70c0ffa-8253-4e56-9c85-95cd2986fd1a","year":2026},"citing_paper":{"arxiv_id":"2606.17800","last_updated":"2026-06-16T11:25:37Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:25:37Z","title":"MaineCoon: Pursuing A Real-Time Audio-Visual Social World Model","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-06-27T01:09:02.214590Z"},"links":{"cited_paper":"/paper/2605.15178","citing_paper":"/paper/2606.17800"},"observation_digest":"sha256:309053bc2175bff60da6d8d8f37ec777ae02d6b15ba4b044e870bf1ed1e6188d","observation_id":"946ddd3c-d0e1-4fb5-bb4b-c4b666eede11","resolution":{"observed_at":"2026-07-03T20:48:55.735119Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.02214","last_updated":"2026-06-01T14:32:37Z","snapshot_observed_at":"2026-08-03T05:30:22.346810Z","submitted_at":"2026-02-02T15:19:22Z","title":"Causal Forcing: Autoregressive Diffusion Distillation Done Right for High-Quality Real-Time Interactive Video Generation","version":5},"cited_work":{"arxiv_id":"2602.02214","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.02214","snapshot_observed_at":"2026-07-10T13:47:05.847304Z","title":"Causal Forcing: Autoregressive Diffusion Distillation Done Right for High-Quality Real-Time Interactive Video Generation","venue":"cs.CV","work_id":"04f67f5b-e79a-4ad9-8e90-763e5e54bd3d","year":2026},"citing_paper":{"arxiv_id":"2606.17800","last_updated":"2026-06-16T11:25:37Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:25:37Z","title":"MaineCoon: Pursuing A Real-Time Audio-Visual Social World Model","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-06-27T01:09:02.214590Z"},"links":{"cited_paper":"/paper/2602.02214","citing_paper":"/paper/2606.17800"},"observation_digest":"sha256:f2462090b2f30675722576f5ab015aba7ae43067275fed29d2bc01a1d6f6a3c0","observation_id":"ee396425-4902-478c-a771-e8d737436aaa","resolution":{"observed_at":"2026-07-03T20:48:55.748077Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2606.17800","last_updated":"2026-06-16T11:25:37Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:25:37Z","title":"MaineCoon: Pursuing A Real-Time Audio-Visual Social World Model"},"reference_resolution":{"displayed":68,"state_counts":{"malformed_identifier":0,"metadata_mismatch":4,"parse_uncertain":0,"unresolved":31,"verified_exact":33,"verified_fuzzy":0},"total_outbound_references":68},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 68 of 68 outbound references and 3 inbound Pith citation observations for arXiv:2606.17800."}