{"as_of":"2026-08-06T02:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:057c439d268099eb9ed3be24c3c6d48550d9d246e93bfcf41473810104dd7c2c","coverage":[{"denominator":131,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-09T02:55:58.018234Z","state":"measured"},{"denominator":104,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":104,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T07:53:39.262642Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T04:16:48.701434Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"cited_work":{"arxiv_id":"2607.07675","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.07675","snapshot_observed_at":"2026-07-10T04:16:48.701434Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","venue":"cs.CV","work_id":"0360ece0-b5b7-409b-802d-e47d5670dbb9","year":2026},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-02T07:53:29.177178Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-07-10T04:12:29.153764Z"},"links":{"cited_paper":"/paper/2607.07675","citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:cdca6caa331a7cd7407f739674578535f8d293ec29b450bc8061cf93398e2131","observation_id":"8aa0e333-3d98-4862-baff-6907f5db724c","resolution":{"observed_at":"2026-07-10T04:16:48.702844Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.07675","snapshot_observed_at":"2026-08-02T07:53:39.262642Z","title":"Scaling mixture-of-experts video pretraining for embodied intelligence.arXiv preprint arXiv:2607.07675, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.08639","last_updated":"2026-07-16T15:02:19Z","snapshot_observed_at":"2026-08-02T07:53:29.177178Z","submitted_at":"2026-07-09T16:15:43Z","title":"Native Video-Action Pretraining for Generalizable Robot Control","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-02T07:53:39.262642Z"},"links":{"cited_paper":"/paper/2607.07675","citing_paper":"/paper/2607.08639"},"observation_digest":"sha256:fe8024aaf57e8dc5aff4327c7f341e54214385c8a3cbecffd286c7b58817359a","observation_id":"a760df59-1c6b-4b7a-b322-088f2b59a3c9","resolution":{"observed_at":"2026-08-02T07:53:39.262642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.07675","snapshot_observed_at":"2026-08-01T07:09:07.343135Z","title":"Scaling mixture-of-experts video pretraining for embodied intelligence.arXiv preprint arXiv:2607.07675, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.21553","last_updated":"2026-07-23T17:36:05Z","snapshot_observed_at":"2026-08-01T22:42:28.999422Z","submitted_at":"2026-07-23T17:36:05Z","title":"SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T07:09:07.343135Z"},"links":{"cited_paper":"/paper/2607.07675","citing_paper":"/paper/2607.21553"},"observation_digest":"sha256:633b9e8a189ce3cf666c033ba896b6769f460983031dc8e85c21b6175cc9ffee","observation_id":"2119e194-4fbd-4a60-b3f8-fc2cb5f98de2","resolution":{"observed_at":"2026-08-01T07:09:07.343135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.07675","snapshot_observed_at":"2026-07-30T12:42:18.533960Z","title":"Scaling mixture-of-experts video pretraining for embodied intelligence","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.23783","last_updated":"2026-07-26T17:58:53Z","snapshot_observed_at":"2026-08-04T19:01:56.946311Z","submitted_at":"2026-07-26T17:58:53Z","title":"$N_0$-TWAM: Scaling Tactile-Native World-Action Model for Contact-Rich Manipulation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-30T12:42:18.533960Z"},"links":{"cited_paper":"/paper/2607.07675","citing_paper":"/paper/2607.23783"},"observation_digest":"sha256:21f6aa5e624fe0895c970f6a1b3c9add1081062ad644739cb6e79b7bbf37a2c2","observation_id":"1c80363e-6ece-424e-95f9-5f98349c3f9f","resolution":{"observed_at":"2026-07-30T12:42:18.533960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2607.07675/citation-record","integrity":"/paper/2607.07675/integrity","json":"/paper/2607.07675/citation-record.json","paper":"/paper/2607.07675"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:eab1c88c1af67c075e9b5022d5b6330778406fa63b1a1f3997b7fc2fc6b31dff","observation_id":"70853329-5a65-4852-a42a-03772111d8dd","resolution":{"observed_at":"2026-07-09T03:05:55.225604Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.02800","last_updated":"2026-06-23T17:33:32Z","snapshot_observed_at":"2026-07-06T23:43:07.940839Z","submitted_at":"2026-06-01T19:12:30Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","version":4},"cited_work":{"arxiv_id":"2606.02800","doi":"10.48550/arxiv.2606.02800","metadata_source":"pith","pith_arxiv_id":"2606.02800","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","venue":"cs.CV","work_id":"ac5e3265-03db-4f0f-a27f-6d9bea03379c","year":2026},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"cited_paper":"/paper/2606.02800","citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:b2242df9e3320e408ca3ac9f1a9db36f6f50b5282d47dd845adca7b9ed4940b1","observation_id":"ad2ace2e-2a21-4fd2-b5d8-120e307a1492","resolution":{"observed_at":"2026-07-09T03:05:55.157813Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:50.194666+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:50.194666+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.725119Z","title":"Pytorch 2: Faster machine learning through dynamic python bytecode transformation and graph compilation","venue":null,"work_id":"4b95e9e3-1502-4c16-8f9e-c8bf24b0937e","year":2024},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:76e14350f19ef207878f995474cdc79239c08a33baae1dca1e69f9c6b2066a6a","observation_id":"00c84fef-d6df-4237-8229-0a35e6d9ae50","resolution":{"observed_at":"2026-07-09T03:05:55.727547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09985","last_updated":"2025-06-11T17:57:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-11T17:57:09Z","title":"V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning","version":1},"cited_work":{"arxiv_id":"2506.09985","doi":"10.48550/arxiv.2506.09985","metadata_source":"pith","pith_arxiv_id":"2506.09985","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning","venue":"cs.AI","work_id":"a9c28401-f16a-4933-89f0-788e2f94e52b","year":2025},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"cited_paper":"/paper/2506.09985","citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:9be30aa13cda53ecb73d0a82fa158d7797255eeb599e9006cb6cb47d157a31a3","observation_id":"96a0c4da-5074-4812-965a-8512c139310b","resolution":{"observed_at":"2026-07-09T03:05:55.138662Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-03T19:08:37.559938+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T19:08:37.559938+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":"2309.16609","doi":"10.48550/arxiv.2309.16609","metadata_source":"pith","pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen Technical Report","venue":"cs.CL","work_id":"bb1fd52f-6b2f-437c-9516-37bdf6eb9be8","year":2023},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:b97017604afe99723d4ba73278d2c9d2bac5cbfc3f68c61afe0d8422c5adb076","observation_id":"790734dc-2f3f-40e6-9758-20a24e3e9b82","resolution":{"observed_at":"2026-07-09T03:05:55.345416Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-15T23:50:15.620681+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T23:50:15.620681+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:3fe4823518823fbd9065f840d364e32a13329b445c9ac4f221bd41611706a764","observation_id":"b2073d22-0f88-49c7-9e87-21da66fe9cdd","resolution":{"observed_at":"2026-07-09T03:05:55.250167Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T01:46:41.708984Z","title":"Lumiere: A space-time diffusion model for video generation","venue":null,"work_id":"f6abe88d-7f0c-49a9-aa0b-1f09e1926d6e","year":2024},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:9ebc34f382741630fa010543457e5aad8143b567360082be9f982f8d17239a4a","observation_id":"81243553-b743-49d7-bb9a-3133304947e3","resolution":{"observed_at":"2026-07-09T03:05:55.764181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02954","last_updated":"2024-01-05T18:59:13Z","snapshot_observed_at":"2026-08-02T13:11:16.882565Z","submitted_at":"2024-01-05T18:59:13Z","title":"DeepSeek LLM: Scaling Open-Source Language Models with Longtermism","version":1},"cited_work":{"arxiv_id":"2401.02954","doi":"10.48550/arxiv.2401.02954","metadata_source":"pith","pith_arxiv_id":"2401.02954","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek LLM: Scaling Open-Source Language Models with Longtermism","venue":"cs.CL","work_id":"01b10587-025b-499d-8ba3-7a538d24c2d6","year":2024},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"cited_paper":"/paper/2401.02954","citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:9ac2902152c8cad7fdee92ad4ae444f2f69bf2bd4f541835c4d2553e76c6cb8f","observation_id":"78e0aa2b-8e95-4a3e-af79-48401eafa4b4","resolution":{"observed_at":"2026-07-09T03:05:55.314557Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":"2311.15127","doi":"10.48550/arxiv.2311.15127","metadata_source":"pith","pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","venue":"cs.CV","work_id":"4f68eada-27e3-437a-a2fe-6e4ca524d0d3","year":2023},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:271e33aa83dade4e813dd922325b62cf46d2693b6894b3548c0ca33e7e7139af","observation_id":"a2a0244b-024c-42ad-a3ed-ae2f800a8981","resolution":{"observed_at":"2026-07-09T03:05:55.206327Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.688891Z","title":"Genie: Generative interactive environments","venue":null,"work_id":"64855e37-e78b-4d7c-88d0-f0efe9dfe0c0","year":2024},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:874a2a9f69c6d4698f61eca8714a9998a235373cb060491b79bf03cf1b15784f","observation_id":"8f3ac1ac-3e91-4896-8cb6-3417118b3c05","resolution":{"observed_at":"2026-07-09T03:05:55.690954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":"2511.22699","doi":"10.48550/arxiv.2511.22699","metadata_source":"pith","pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","venue":"cs.CV","work_id":"f1080a62-48e1-4255-b023-7556be57370d","year":2025},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:bc132c1c64cd7166609d58d76300c4921c0228647988954f8717cc61dc909dd3","observation_id":"95ef248b-fb5e-48f7-91f7-c950704d2ed8","resolution":{"observed_at":"2026-07-09T03:05:55.311053Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.22200","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T01:46:41.030379Z","title":"Longcat-video technical report.arXiv preprint arXiv:2510.22200","venue":null,"work_id":"b1a745e0-8d8e-4399-8d09-047d761f349d","year":2025},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:64fc64820c924d668fbdb69a088638ac4f327e91b57327e4d6958b95079a71dc","observation_id":"d4c12d5c-89ba-4ff0-a00e-4c9cee1c9fce","resolution":{"observed_at":"2026-07-09T03:05:55.255582Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.868146Z","title":"Pixart- alpha: Fast training of diffusion transformer for photorealistic text-to-image synthesis","venue":null,"work_id":"5a518211-760e-40f5-9e88-c6aafe84f2d9","year":2024},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:4ff78cfaac038691328f892b420fa41f4047cc7d1a29c17be39b73de5d8db507","observation_id":"b94d3e9f-2e63-40d2-827b-f1cfcb88fb3b","resolution":{"observed_at":"2026-07-09T03:05:55.869506Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1604.06174","last_updated":"2016-04-22T19:21:36Z","snapshot_observed_at":"2026-08-04T13:01:58.606241Z","submitted_at":"2016-04-21T04:15:27Z","title":"Training Deep Nets with Sublinear Memory Cost","version":2},"cited_work":{"arxiv_id":"1604.06174","doi":"10.48550/arxiv.1604.06174","metadata_source":"pith","pith_arxiv_id":"1604.06174","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Training Deep Nets with Sublinear Memory Cost","venue":"cs.LG","work_id":"f2c5c287-a500-40e4-a136-e7e3172db1d7","year":2016},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"cited_paper":"/paper/1604.06174","citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:1d661fe5dbfa92bc8524b0afb3ee6ec1ff848d258d1461a05ef0dc7b8e2c9618","observation_id":"31900569-fe83-41c8-9184-883a84f9f380","resolution":{"observed_at":"2026-07-09T03:05:55.263611Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-21T12:26:33.666045+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T12:26:33.666045+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.14955","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.252330Z","title":"Realdpo: Real or not real, that is the preference","venue":null,"work_id":"9d39eeb7-0ae7-4088-a0d8-1af284d6fdbd","year":2025},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:33eca352d67fd182fc229e61a4b28d6cf6f658ebfed391fe4444d4ca52345c28","observation_id":"3a7e8a4e-fd38-4800-9a60-48a79854cdf1","resolution":{"observed_at":"2026-07-09T03:05:55.255294Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.870042Z","title":"Local all-pair correspondence for point tracking","venue":null,"work_id":"5f9bef65-d16f-46cb-a44a-bcb3c0118137","year":2024},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:8182d6485b26b00579759729818eccba133bc34c59057bce71562e0b76275023","observation_id":"3d6dec75-acb6-4329-bfd9-ab782929c6f7","resolution":{"observed_at":"2026-07-09T03:05:55.871387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.857932Z","title":"Palm: Scaling language modeling with pathways.Journal of machine learning research, 24(240):1–113","venue":null,"work_id":"0bb8865e-bcb7-46c4-ac90-63714fc6b1ca","year":2023},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:3b94b5613c4c2d7f5a3a88c5ce2b8ec715593a9dd65d753dc868fa37cb146fd6","observation_id":"39e2ad2d-15b6-4305-b0b0-c84e6e515996","resolution":{"observed_at":"2026-07-09T03:05:55.859303Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.852150Z","title":"Deepseekmoe: Towards ultimate expert specialization in mixture-of-experts language models","venue":null,"work_id":"bce26321-e20c-4288-bd57-a7f2b1d4fdcb","year":2024},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:f20dfc11c90e45f9407845369b73d300de021342355fd0501c335f02694ada2c","observation_id":"b7ae041d-9c39-407a-a9fe-696665c95d96","resolution":{"observed_at":"2026-07-09T03:05:55.854259Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.855148Z","title":"Fu, Stefano Ermon, Atri Rudra, and Christopher Ré","venue":null,"work_id":"60bc23ba-92e3-47cd-8688-6bc2bff27a81","year":2022},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:f42dc0438ce9c13a0957392a4521e3bd2ee17efc4b9765002268119c16888815","observation_id":"2cff44b4-ed21-4aaa-8474-9e300a5d59af","resolution":{"observed_at":"2026-07-09T03:05:55.857277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.859895Z","title":"Deepep: An efficient expert-parallel communication library","venue":null,"work_id":"527f3b20-f64d-4f38-8f48-6b540fc38fc1","year":null},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:b10a00e21c8f6c2f23693ff36426fb1401bc2b017a85d80df8357dec27dc1c2f","observation_id":"361bc574-79af-4a30-a5ca-63a06608670f","resolution":{"observed_at":"2026-07-09T03:05:55.861339Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.871944Z","title":null,"venue":null,"work_id":"3bfd6e78-becf-4dbe-b5cd-7ef1ca7e1db5","year":2026},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:ac0d80a711b44161fe82d276e68b5fba04975b82769470a4da3253163afd506d","observation_id":"84b6211c-a79b-4471-a909-5d5e15156e8e","resolution":{"observed_at":"2026-07-09T03:05:55.873149Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.875508Z","title":"Scaling vision transformers to 22 billion parameters","venue":null,"work_id":"213c7811-947b-4b53-83ad-b920f3f66e6e","year":2023},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:86840f75a1a1c6d00a4ffd3dda51152db7fba5d5a9d5aa8ab2adf329820d44ec","observation_id":"3f10346e-3d51-4593-a139-84fc97169474","resolution":{"observed_at":"2026-07-09T03:05:55.876791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.847399Z","title":"Rethinking video generation model for the embodied world","venue":null,"work_id":"f89db3a8-7d61-41c3-8e3a-09ed97cb60e1","year":2026},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:c5eac21c379ce2756444748106ac11d2eeabe8d38c5c1b8d37850d71f7f9bced","observation_id":"ff20bb95-561d-4a7e-8693-9672bdf59099","resolution":{"observed_at":"2026-07-09T03:05:55.849007Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.837586Z","title":"Structure and content- guided video synthesis with diffusion models","venue":null,"work_id":"e8fe18a7-4355-4c38-b513-474e1746fe45","year":2023},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:929c9f0c16315c1597eb405478df50c82f698795b4242cacbfaeb30f02dcaaef","observation_id":"751852de-e464-4e8b-ac62-1b7b76841d70","resolution":{"observed_at":"2026-07-09T03:05:55.839376Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.834941Z","title":"Scaling rectified flow transformers for high-resolution image synthesis","venue":null,"work_id":"b82ba02d-0058-4bd2-960f-ddba9d16df00","year":2024},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:040b204c7aa7e3d6d788efc526f93781fe8768dedf7365c0bfe7ad2e2e9a8456","observation_id":"0b9319d0-9ca9-4227-8d00-6f52d6408626","resolution":{"observed_at":"2026-07-09T03:05:55.836466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T14:57:14.638286Z","title":"Switch transformers: Scaling to trillion parameter models with simple and efficient sparsity.Journal of Machine Learning Research, 23(120):1–39","venue":null,"work_id":"34699817-8561-4043-bbe1-445a0c93266b","year":2022},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:2526f7f11767db742dd9c88dae2b5f9cadc179d872e4ff53bd0492b1e94bc42b","observation_id":"24c48c8d-ee24-4d31-9fe7-7aee347baa19","resolution":{"observed_at":"2026-07-09T03:05:55.836894Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.06949","last_updated":"2026-02-06T18:49:43Z","snapshot_observed_at":"2026-07-06T22:44:51.126114Z","submitted_at":"2026-02-06T18:49:43Z","title":"DreamDojo: A Generalist Robot World Model from Large-Scale Human Videos","version":1},"cited_work":{"arxiv_id":"2602.06949","doi":"10.48550/arxiv.2602.06949","metadata_source":"pith","pith_arxiv_id":"2602.06949","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DreamDojo: A Generalist Robot World Model from Large-Scale Human Videos","venue":"cs.RO","work_id":"95f2f415-c659-4084-a008-39303bea8638","year":2026},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"cited_paper":"/paper/2602.06949","citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:47696c28afb3e975d631a8bff7a85a8e3dba566e65c80a51c52722859137706a","observation_id":"e55f2f81-05ef-4fe7-8e12-5e194e8ba58e","resolution":{"observed_at":"2026-07-09T03:05:55.287932Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.14375","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.272428Z","title":"The pulse of motion: Measuring physical frame rate from visual dynamics","venue":null,"work_id":"9bdc4b07-d0bc-40ce-afb8-93bf879bbdc9","year":2026},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:f2eb1dbaea476481a53842a1f8ece57533559b9052951784be0bd8d42d8261e3","observation_id":"8d650eef-2cf5-4fd0-812c-1f61edeaa5a8","resolution":{"observed_at":"2026-07-09T03:05:55.274549Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.12063","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.346934Z","title":"Vlaw: Iterative co-improvement of vision-language-action policy and world model","venue":null,"work_id":"4438adfc-2ac0-4c22-878a-0d937a02c83e","year":2026},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:055ba0725a6f2b7cd8e4643b97dafb2219d4c0058a45f802409d0d05f6a3deef","observation_id":"9fb154c2-6d77-4b74-b654-2aa890816496","resolution":{"observed_at":"2026-07-09T03:05:55.348812Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.10125","last_updated":"2026-03-01T08:24:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-11T09:13:10Z","title":"Ctrl-World: A Controllable Generative World Model for Robot Manipulation","version":3},"cited_work":{"arxiv_id":"2510.10125","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.10125","snapshot_observed_at":"2026-07-09T03:05:55.293884Z","title":"Ctrl-World: A Controllable Generative World Model for Robot Manipulation","venue":"cs.RO","work_id":"60c6a353-4bc6-4c87-8c39-372fcddd6ac0","year":2025},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"cited_paper":"/paper/2510.10125","citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:2fb53e0644672dd32596cbc154417168f647207a78e4379e961785e733f7ace6","observation_id":"0bdb0a86-22fd-478f-96a3-5836865a55e5","resolution":{"observed_at":"2026-07-09T03:05:55.295756Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.08423","last_updated":"2026-07-20T08:31:09Z","snapshot_observed_at":"2026-08-03T22:53:29.033241Z","submitted_at":"2025-11-11T16:33:49Z","title":"OmniAID: Decoupling Semantics and Artifacts for Universal AI-Generated Image Detection in the Wild","version":4},"cited_work":{"arxiv_id":"2511.08423","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.08423","snapshot_observed_at":"2026-07-09T03:05:55.359747Z","title":"OmniAID: Decoupling Semantic and Artifacts for Universal AI-Generated Image Detection in the Wild","venue":"cs.CV","work_id":"d7f5ad2c-8b98-4728-89b8-eb1bfc5131ca","year":2025},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"cited_paper":"/paper/2511.08423","citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:4d1bd372f7be8b632bbfb3cd635d0a5a8401f13d8d3c2d34f454bf7b5ca05616","observation_id":"5acb3f5d-73af-468a-af59-ce45d6b02848","resolution":{"observed_at":"2026-07-09T03:05:55.361324Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.805244Z","title":"Animatediff: Animate your personalized text-to-image diffusion models without specific tuning","venue":null,"work_id":"8fb80cc8-fd83-4fdc-b228-452735e15574","year":2024},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:e79b5eedbef97dfe62fdaaaa67ad93fdf2bf17f22b568c9a06177947f488d95a","observation_id":"41247c9b-e748-4939-9afe-8a5c203df4ef","resolution":{"observed_at":"2026-07-09T03:05:55.807674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.802390Z","title":"Photorealistic video generation with diffusion models","venue":null,"work_id":"f8da8613-c021-49da-be7f-bff238b45f84","year":2024},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:4e8a843716e15dd89533d7c510c1239b96d04385c3b3c2d0360984066cd25f31","observation_id":"b4dbe36b-8ed4-4402-bbd1-d37a5fccfdce","resolution":{"observed_at":"2026-07-09T03:05:55.804135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.06876","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.268531Z","title":"Generating an image from 1,000 words: Enhancing text-to-image with structured captions","venue":null,"work_id":"18689fc3-927f-4561-98f3-7dcc4c1cdb13","year":2025},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:4678241a61d83415107618353a00da766c8dde7af1ea18c0684088a568ae3a89","observation_id":"75f559d0-8341-45aa-a9a8-0e1b63c88c6a","resolution":{"observed_at":"2026-07-09T03:05:55.270798Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.15980","last_updated":"2026-06-16T09:11:40Z","snapshot_observed_at":"2026-08-02T13:28:26.201564Z","submitted_at":"2026-05-15T14:13:39Z","title":"Flash-GRPO: Efficient Alignment for Video Diffusion via One-Step Policy Optimization","version":3},"cited_work":{"arxiv_id":"2605.15980","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.15980","snapshot_observed_at":"2026-07-09T03:05:55.293895Z","title":"Flash-GRPO: Efficient Alignment for Video Diffusion via One-Step Policy Optimization","venue":"cs.CV","work_id":"6035b3ae-dd0c-4375-9948-c047a30b8ddd","year":2026},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"cited_paper":"/paper/2605.15980","citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:839d50f4e291e31b1af689027bde05224beeaf0111fe903b52ed23545c97f775","observation_id":"81e1d7e4-80b8-425c-88b0-5c90c330cae9","resolution":{"observed_at":"2026-07-09T03:05:55.295529Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.04324","last_updated":"2025-10-15T06:35:29Z","snapshot_observed_at":"2026-07-06T22:08:40.965707Z","submitted_at":"2025-08-06T11:10:39Z","title":"TempFlow-GRPO: When Timing Matters for GRPO in Flow Models","version":4},"cited_work":{"arxiv_id":"2508.04324","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.04324","snapshot_observed_at":"2026-07-09T03:05:55.312048Z","title":"TempFlow-GRPO: When Timing Matters for GRPO in Flow Models","venue":"cs.CV","work_id":"fecc731c-f8a2-4f00-ab1b-51b87a133726","year":2025},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"cited_paper":"/paper/2508.04324","citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:020a441e1a848bce36721718625b37da9dbeb6e38892b5d9ef6076dbc252e648","observation_id":"88fd76ff-7fe0-4edb-839d-93ac2586b840","resolution":{"observed_at":"2026-07-09T03:05:55.314045Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02303","last_updated":"2022-10-05T14:41:38Z","snapshot_observed_at":"2026-07-06T13:59:57.800591Z","submitted_at":"2022-10-05T14:41:38Z","title":"Imagen Video: High Definition Video Generation with Diffusion Models","version":1},"cited_work":{"arxiv_id":"2210.02303","doi":"10.48550/arxiv.2210.02303","metadata_source":"pith","pith_arxiv_id":"2210.02303","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Imagen Video: High Definition Video Generation with Diffusion Models","venue":"cs.CV","work_id":"bb20d241-dc6f-4b0a-b071-fd43a2cbd57f","year":2022},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"cited_paper":"/paper/2210.02303","citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:d2fb0c7a7f6727c1f4724fa8e45d35a53ccaa67d613aa91293d3b57ce82e15a5","observation_id":"bc549c17-ce48-4bf8-b2aa-111d831738f1","resolution":{"observed_at":"2026-07-09T03:05:55.336407Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:49:59.676131+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:49:59.676131+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.828784Z","title":"Video diffusion models.Advances in neural information processing systems, 35:8633–8646","venue":null,"work_id":"1f8f79e2-ab6d-4144-b8df-c93b5880020a","year":2022},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:546aa46bcd36014b4113194ae7e0f9fa63d974f5f6741ac0e0627c0d4472272a","observation_id":"689ba7c5-0767-467f-a07d-7ea3db82e036","resolution":{"observed_at":"2026-07-09T03:05:55.831622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.849872Z","title":"Rae, Oriol Vinyals, and Laurent Sifre","venue":null,"work_id":"1ea5abaa-f628-42b2-8a09-62148b7ce985","year":2022},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:34a2caaecd19c0d148928625d4499a6135c9fb5847ec400b0cde08c789a83d98","observation_id":"57e26a9b-e1f4-4288-9a4f-621ca83404ab","resolution":{"observed_at":"2026-07-09T03:05:55.851486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.842620Z","title":"Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu, Yuanzhi Li, Shean Wang, Lu Wang, and Weizhu Chen","venue":null,"work_id":"6e336c6f-9dc0-4115-add9-8f8d02224ad4","year":2022},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:8b4f7559d1c14b7a9e80d1c11705a59806da323aa51c9ce6b6c522dd7a20e70c","observation_id":"9dd81e01-b8af-4197-81d7-3f8557cb4add","resolution":{"observed_at":"2026-07-09T03:05:55.844301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11143","last_updated":"2025-10-09T12:22:46Z","snapshot_observed_at":"2026-07-31T12:28:37.704994Z","submitted_at":"2024-05-20T01:04:40Z","title":"OpenRLHF: An Easy-to-use, Scalable and High-performance RLHF Framework","version":6},"cited_work":{"arxiv_id":"2405.11143","doi":"10.48550/arxiv.2405.11143","metadata_source":"pith","pith_arxiv_id":"2405.11143","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenRLHF: An Easy-to-use, Scalable and High-performance RLHF Framework","venue":"cs.AI","work_id":"70fa48c9-2f84-49f6-9aca-37476e021fc3","year":2024},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"cited_paper":"/paper/2405.11143","citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:113c7ba9dc6ddff74974e99dcb93600d1a60d2913d22c0105b042226d14c7ac1","observation_id":"56cc5ead-2d39-44be-9093-e4e9708f1749","resolution":{"observed_at":"2026-07-09T03:05:55.340810Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.879575Z","title":"Tutel: Adaptive mixture-of-experts at scale","venue":null,"work_id":"313e479c-6f46-4e15-8f8c-c64e5f5f74f5","year":2023},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:85b8609c373db6a4752a56dacceb9d993f28b06aea92a566254a5a33eaa6b637","observation_id":"11127d1f-bc22-4b80-9969-5c438155834d","resolution":{"observed_at":"2026-07-09T03:05:55.880891Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.783101Z","title":"Jacobs, Michael I","venue":null,"work_id":"84c0c41f-a9a8-4277-bbea-e04b4e5fa41b","year":1991},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:f7192f2c5d245be3c67d248b345e1e08242bcf70f3436b793dcc2bbaaf9dfaa6","observation_id":"9f6d8b17-da7d-412c-80d6-a3ab8ef9d57a","resolution":{"observed_at":"2026-07-09T03:05:55.784513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14509","last_updated":"2023-10-04T16:51:13Z","snapshot_observed_at":"2026-08-04T19:27:31.715261Z","submitted_at":"2023-09-25T20:15:57Z","title":"DeepSpeed Ulysses: System Optimizations for Enabling Training of Extreme Long Sequence Transformer Models","version":2},"cited_work":{"arxiv_id":"2309.14509","doi":"10.48550/arxiv.2309.14509","metadata_source":"pith","pith_arxiv_id":"2309.14509","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSpeed Ulysses: System Optimizations for Enabling Training of Extreme Long Sequence Transformer Models","venue":"cs.LG","work_id":"bb119d0b-c7f0-412a-a426-f74bd6949a51","year":2023},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"cited_paper":"/paper/2309.14509","citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:e626266ca0e2de4522901eb3d8eea40242d712f70ffa67ccd4b6251de2070939","observation_id":"2cbc8996-b7ae-432a-acea-528bc3fff068","resolution":{"observed_at":"2026-07-09T03:05:55.170422Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.13977","last_updated":"2026-06-27T16:11:05Z","snapshot_observed_at":"2026-08-02T23:23:50.481908Z","submitted_at":"2026-02-15T03:48:20Z","title":"WoVR: World Models as Reliable Simulators for Post-Training VLA Policies with RL","version":2},"cited_work":{"arxiv_id":"2602.13977","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.13977","snapshot_observed_at":"2026-07-09T03:05:55.345856Z","title":"Wovr: World models as reliable simulators for post-training vla policies with rl","venue":"cs.RO","work_id":"17804900-10e7-4323-9584-388ff825c14a","year":2026},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"cited_paper":"/paper/2602.13977","citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:b620b85ddf0695d65794646885f28791ebbbccd7c72b330ac1b0b6e23f3c162b","observation_id":"4fc0cfcb-86c5-456e-805f-1171b3c1e9a9","resolution":{"observed_at":"2026-07-09T03:05:55.347531Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.754464Z","title":"Hierarchical mixtures of experts and the em algorithm.Neural computation, 6(2):181– 214, 1994","venue":null,"work_id":"20ba4a53-c21e-44b9-8693-a70886a9c45c","year":1994},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:e37e780ca7aeb2ef27acd0e99b9fa20fafd17eaf1c8b5a6b69e1568cf71365e2","observation_id":"0ce3b01e-01ee-406c-8090-fcf3a2469eac","resolution":{"observed_at":"2026-07-09T03:05:55.756750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":"2001.08361","doi":"10.1145/3616855.3635845","metadata_source":"pith","pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Laws for Neural Language Models","venue":"cs.LG","work_id":"b7dd8749-9c45-4977-ab9b-64478dce1ae8","year":2020},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:d579fffff3d14f667552f7b7cec49828908eecfa64597174a625171236544aee","observation_id":"92a09cda-2931-4fa5-9a7e-aaa0f977994c","resolution":{"observed_at":"2026-07-09T03:05:55.200980Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.757899Z","title":"Pick-a-pic: An open dataset of user preferences for text-to-image generation.Advances in neural information processing systems, 36:36652–36663","venue":null,"work_id":"00e2bd13-9259-4c19-8ac6-cfe745a0da17","year":2023},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:dc3215ec77553d163fb4747029075ca1a5412983dc30c078af24736a67a79623","observation_id":"394d93db-e316-430d-b94a-dc8a9f3e1955","resolution":{"observed_at":"2026-07-09T03:05:55.761087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.772617Z","title":"Reducing activation recomputation in large transformer models","venue":null,"work_id":"5cb4e8f9-9840-4977-9ed6-e35994c40ab3","year":2023},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:12893be9377716a76f3d8a2638cad8a818f07ec8726123813acddee9c98e7732","observation_id":"fb7231a6-0d13-4315-b6a0-535134fd160d","resolution":{"observed_at":"2026-07-09T03:05:55.775761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.02027","last_updated":"2022-10-05T20:14:52Z","snapshot_observed_at":"2026-08-04T15:58:44.498394Z","submitted_at":"2021-06-29T04:37:23Z","title":"Efficient Sequence Packing without Cross-contamination: Accelerating Large Language Models without Impacting Performance","version":2},"cited_work":{"arxiv_id":"2107.02027","doi":"10.48550/arxiv.2107.02027","metadata_source":"pith","pith_arxiv_id":"2107.02027","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kosec, S","venue":"cs.CL","work_id":"168014c6-0f97-4394-a665-a80a203ae40c","year":2021},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"cited_paper":"/paper/2107.02027","citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:62d4222b705ca7fe45451061540ba52092ed133d3c6bb6cd6b8c1df63459a8b0","observation_id":"31adb489-bf50-4f65-b85c-c432ba8c3717","resolution":{"observed_at":"2026-07-09T03:05:55.225351Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.789787Z","title":"Gshard: Scaling giant models with conditional computation and automatic sharding","venue":null,"work_id":"01add923-a3d4-4438-91d0-b63fab2be6a8","year":2021},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:1c725881656c94f74d6334a4f1b366ccff3b3a32fe0ac43b660300e0406814bc","observation_id":"6a38081c-64f9-42e9-939b-50f0f509036c","resolution":{"observed_at":"2026-07-09T03:05:55.791386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":"2507.21802","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-07-09T03:05:55.323624Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","venue":"cs.AI","work_id":"8b0ab84a-b7ea-46ea-a6ba-bf490a84d251","year":2025},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:a950cbd48d34a474b125e7a681237f46881358a244b1b47b270e7510906b5a98","observation_id":"eeef1473-3eaf-4837-88a0-1ef8999344ec","resolution":{"observed_at":"2026-07-09T03:05:55.325140Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.21998","last_updated":"2026-03-22T15:37:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-29T17:07:43Z","title":"Causal World Modeling for Robot Control","version":2},"cited_work":{"arxiv_id":"2601.21998","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.21998","snapshot_observed_at":"2026-07-10T12:47:05.502321Z","title":"Causal World Modeling for Robot Control","venue":"cs.CV","work_id":"a33c4ee0-db06-4f9a-8852-c62e3a72fc27","year":2026},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"cited_paper":"/paper/2601.21998","citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:7edadb366a9f300cfd93708159dc4a5bac510386af0c442d47e00985b7f4fbce","observation_id":"c7c95d25-a18b-41a9-9f97-59a0d7a6139b","resolution":{"observed_at":"2026-07-09T03:05:55.339484Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.793280Z","title":"Pytorch distributed: Experiences on accelerating data parallel training.Proceedings of the VLDB Endowment, 13(12):3005–3018, 2020","venue":null,"work_id":"ed0b0f47-0088-4233-9304-226fd8c93c5f","year":2020},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:07152c263bae50dc50dfa078944d9248d348c0ce7513b53d02ee1a8b729c5b43","observation_id":"c4cbe177-a852-4d45-9eca-d3a27456b067","resolution":{"observed_at":"2026-07-09T03:05:55.794858Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.737034Z","title":"Torchtitan: One-stop pytorch native solution for production ready LLM pretraining","venue":null,"work_id":"ed35fa8b-95cf-4a70-a9eb-b8cb23a3616f","year":2025},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:9af6f6d11f1f426b81af2e3e96dea5d5b49c0dc5dec7bb8a3fabe7af7bd1ffb8","observation_id":"40d7770b-4240-4ce4-a229-93bb23617050","resolution":{"observed_at":"2026-07-09T03:05:55.738988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05635","last_updated":"2025-11-04T12:01:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-07T17:59:44Z","title":"Genie Envisioner: A Unified World Foundation Platform for Robotic Manipulation","version":3},"cited_work":{"arxiv_id":"2508.05635","doi":"10.48550/arxiv.2508.05635","metadata_source":"pith","pith_arxiv_id":"2508.05635","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Genie Envisioner: A Unified World Foundation Platform for Robotic Manipulation","venue":"cs.RO","work_id":"440ad435-44ba-4acd-9aeb-21dd3ee04835","year":2025},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"cited_paper":"/paper/2508.05635","citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:0c3a27bd86e018c4e33755cbefd9072b40846c4866aae826d65007129910a830","observation_id":"473c2d7a-4c49-488f-80d6-8945664f9613","resolution":{"observed_at":"2026-07-09T03:05:55.333017Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.733800Z","title":"Flow matching for generative modeling","venue":null,"work_id":"3a03358e-c47d-482c-ba26-532e599baea6","year":2023},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:278d04680d12acddca020997fc8aff3dbc35834d6b550490dba1c344532e81d7","observation_id":"464c14f7-12a4-4a2f-9696-f95fba431445","resolution":{"observed_at":"2026-07-09T03:05:55.736148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":"2412.19437","doi":"10.1016/j.neucom.2023.127063.url:https://www.sciencedirect","metadata_source":"pith","pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeek-V3 Technical Report","venue":"cs.CL","work_id":"57d2791d-2219-4c31-a077-afc04b12a75c","year":2024},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:0aeceeca4f28ec82bcc5d1f94a2e371bc32f8020e5768e55e5d9f178c3436134","observation_id":"d6ff8eda-bb2f-446a-ac7b-fe0605904ecf","resolution":{"observed_at":"2026-07-09T03:05:55.318622Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.731419Z","title":"Flow-grpo: Training flow matching models via online rl","venue":null,"work_id":"ef97262e-f9d3-40c8-af71-e2661ae41920","year":2026},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:3b280c01fa1da9117a4e01846ea13872876460a0669bd0e1049b31966d5dc3c3","observation_id":"fcb022fb-6e5d-4feb-9d85-acc5e2a9d5d4","resolution":{"observed_at":"2026-07-09T03:05:55.732991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"cited_work":{"arxiv_id":"2601.05242","doi":"10.48550/arxiv.2601.05242","metadata_source":"pith","pith_arxiv_id":"2601.05242","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","venue":"cs.CL","work_id":"e60e0bf8-33b8-47c6-8d66-7975f5c121d4","year":2026},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"cited_paper":"/paper/2601.05242","citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:7f20b253291c10b812e591571e8cae89c1faeb35e4c6c2038c8e612006622c90","observation_id":"11334e03-e355-4ae6-924e-e86d06c2c4c8","resolution":{"observed_at":"2026-07-09T03:05:55.271067Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.887789Z","title":"Flow straight and fast: Learning to generate and transfer data with rectified flow","venue":null,"work_id":"bdb5050d-b8df-4f75-b331-b56549ac25f8","year":2023},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:5a8628d1cf630c6a40c584e930e1fb3e8daa52fc68c10d1c475b7f4a1b80c262","observation_id":"52239194-9700-4306-9bd4-5cc0c812d290","resolution":{"observed_at":"2026-07-09T03:05:55.889150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.02317","last_updated":"2025-08-07T10:31:09Z","snapshot_observed_at":"2026-07-06T22:07:26.271331Z","submitted_at":"2025-08-04T11:33:04Z","title":"VeOmni: Scaling Any Modality Model Training with Model-Centric Distributed Recipe Zoo","version":3},"cited_work":{"arxiv_id":"2508.02317","doi":"10.48550/arxiv.2508.02317","metadata_source":"pith","pith_arxiv_id":"2508.02317","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Veomni: Scaling any modality model training with model-centric distributed recipe zoo","venue":"cs.CL","work_id":"98e8be4a-3e49-42c6-a20b-0106ca5b2488","year":2025},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"cited_paper":"/paper/2508.02317","citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:575c93092dfe2cd3cf91bd3cb00fd9a89550a9accf18df8a9aeec1d4975ac80b","observation_id":"e232313d-ae74-41ba-85ca-1aa9ac3cfe1e","resolution":{"observed_at":"2026-07-09T03:05:55.350703Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.721547Z","title":"Hpsv3: Towards wide-spectrum human preference score","venue":null,"work_id":"625faa9b-3cb8-4c7f-b9ca-37a9ed6daaee","year":2025},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:e24748aa08cee887251c607ba877c1022d52473a574d8d47bbb99b688ec29ca3","observation_id":"9c5523d9-31bb-45bc-a636-bb086c6a3f6a","resolution":{"observed_at":"2026-07-09T03:05:55.724491Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.725347Z","title":"Real: Efficient rlhf training of large language models with parameter reallocation","venue":null,"work_id":"4eef4df3-3a2c-430a-b1fe-da1e68369e01","year":2025},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:e0308cfd1e0147a332c584a2cddafab9de5bf59612805417abec21ec08c783d9","observation_id":"d4824ef0-bd1d-40e3-849c-37499dde4a93","resolution":{"observed_at":"2026-07-09T03:05:55.727250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.748168Z","title":"Ray: A distributed framework for emerging {AI} applications","venue":null,"work_id":"738f77eb-e487-4bad-be86-d59d0bb307b3","year":2018},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:81ee1331f560f63444c5e7ef5f175ac01da6fb0aec794dd700de3abbadea4ed0","observation_id":"f58a3575-7986-45ba-91bf-c53d208e01e2","resolution":{"observed_at":"2026-07-09T03:05:55.750194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.714542Z","title":"Do generative video models understand physical principles? InProceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision (WACV), 2026","venue":null,"work_id":"c3c5f4b0-c314-4bd6-92e5-d6a9d952f234","year":2026},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:c08f200380b90daab9ecafe4d279daa543435dada896f97397571bae3935ca84","observation_id":"bc37b517-4919-4e5d-9f5f-d77b863bd67a","resolution":{"observed_at":"2026-07-09T03:05:55.717244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.850400Z","title":"Efficient large-scale language model training on gpu clusters using megatron-lm","venue":null,"work_id":"2968c0ed-729d-4e89-8c81-ccc2516c9203","year":2021},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:1c1cb1e9fd41079e3ee5056091a8877088aa10651ade49ded9394586bda8d40c","observation_id":"968dffcc-9434-4bda-8baf-a5f669c945b4","resolution":{"observed_at":"2026-07-09T03:05:55.851883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.815574Z","title":"Nowlan and Geoffrey E","venue":null,"work_id":"0b54cf01-bd8e-4c2e-9c4b-8efde159153b","year":1990},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:4a70984f2ae58b9e7f4f7dc3450ccc83377ebafb36a3d500b46b551a00d4f889","observation_id":"09dac93e-8f76-4794-8acf-32225fee767f","resolution":{"observed_at":"2026-07-09T03:05:55.816957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.739609Z","title":"The pagerank citation ranking : Bringing order to the web","venue":null,"work_id":"319ad061-d78a-4bb7-a00d-e1ea491e259a","year":1999},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:f80101b48ef6dcbf526dce983697530dc70343b2459efec9723afce02ff9f4d1","observation_id":"aec767cb-602e-4f70-90bc-7685a2c7220f","resolution":{"observed_at":"2026-07-09T03:05:55.741486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.791062Z","title":"Switch diffusion transformer: Synergizing denoising tasks with sparse mixture-of-experts","venue":null,"work_id":"bb5fe434-0ba1-4cd0-aaed-c428dfd4f7f7","year":2024},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:ec4f60b111120f3c81fe35f9bff220c5d0ce51b4576493a469673fcb437a717c","observation_id":"d1773c59-9cad-413b-9689-f6e09ad96be3","resolution":{"observed_at":"2026-07-09T03:05:55.792609Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.881505Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":"a7d9a278-99a4-4909-8368-42b21df3c6fb","year":2023},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:b72635352d915b8de9dccf9378f7b642073f3e315dd36143d9cb3d2f2db1fb11","observation_id":"2be8db7f-9845-4cdf-9b24-72d192a2f82e","resolution":{"observed_at":"2026-07-09T03:05:55.882836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.844985Z","title":"Lumina- image 2.0: A unified and efficient image generative framework","venue":null,"work_id":"7c96d0a7-ff12-4bcf-9dee-dac30a18f1c5","year":2025},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:5491008db52cdfcd16559103bee47f6d4100b2291057ad3077b19abd2d4b5128","observation_id":"84511f17-e38c-46c3-a1ff-6e671e40ce22","resolution":{"observed_at":"2026-07-09T03:05:55.846711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.827330Z","title":"Qwen3.6-27B: Flagship-level coding in a 27B dense model","venue":null,"work_id":"f03c5d18-7a22-491e-a8c7-642cfc181268","year":2026},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:a3dfadb7079651dffd607b65c36f9c8151cd620873e45b15583b7a9f2faff57b","observation_id":"6ad04e81-d91d-4b06-9c47-5dca10302cd9","resolution":{"observed_at":"2026-07-09T03:05:55.830705Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.18943","last_updated":"2026-06-17T11:23:52Z","snapshot_observed_at":"2026-08-01T03:49:23.750491Z","submitted_at":"2026-06-17T11:23:52Z","title":"Physics-IQ Verified","version":1},"cited_work":{"arxiv_id":"2606.18943","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.18943","snapshot_observed_at":"2026-07-09T03:05:55.353604Z","title":"Physics-IQ Verified","venue":"cs.CV","work_id":"9896d19d-204b-4911-99ba-5e4a786ca41c","year":2026},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"cited_paper":"/paper/2606.18943","citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:a3dd3a1d6a5fab0265557dd9e5dd9f875ed4ea4c292d5d2cedf131753ac5f2bd","observation_id":"4bc46d9b-1a6d-4bcd-bc14-32014c801094","resolution":{"observed_at":"2026-07-09T03:05:55.354852Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.808622Z","title":"Manning, and Chelsea Finn","venue":null,"work_id":"bee1955a-46ae-4c60-aa78-128f83d572d7","year":2023},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:c73b0016c9f27fd6400c14479fb76fce99949c0c8ab7fda6a45709550e668319","observation_id":"da621f34-97d6-409b-b817-23bb2e5dcb2e","resolution":{"observed_at":"2026-07-09T03:05:55.810864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.811827Z","title":"Deepspeed-moe: Advancing mixture-of-experts inference and training to power next-generation ai scale","venue":null,"work_id":"c92fe309-f854-4926-bc3f-6506bdb34e5a","year":2022},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:52e37ac4f22ad5b99c573923699aea1f5a1912628c2ff7bc4ca67ceab560296c","observation_id":"038b75f1-3de7-44e6-8e8c-3777eaf8cbf2","resolution":{"observed_at":"2026-07-09T03:05:55.814087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.815058Z","title":"Zero: Memory optimizations toward training trillion parameter models","venue":null,"work_id":"02980d6f-ccc4-4d1f-b583-471afa83a57f","year":2020},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:768e946fa98e53f5661780ef8ccf61e88043af7f3460fcd2b48d6655856d1adc","observation_id":"919fc223-ef0e-4f77-af59-e31f86ed8a71","resolution":{"observed_at":"2026-07-09T03:05:55.817163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09042","last_updated":"2025-06-18T17:37:28Z","snapshot_observed_at":"2026-08-01T23:42:27.412980Z","submitted_at":"2025-06-10T17:58:17Z","title":"Cosmos-Drive-Dreams: Scalable Synthetic Driving Data Generation with World Foundation Models","version":3},"cited_work":{"arxiv_id":"2506.09042","doi":"10.48550/arxiv.2506.09042","metadata_source":"pith","pith_arxiv_id":"2506.09042","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Robin Rombach, Andreas Blattmann, Dominik Lorenz, Patrick Esser, and Björn Ommer","venue":"cs.CV","work_id":"af51168b-8b82-45d2-bf85-e3d07f99492b","year":2025},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"cited_paper":"/paper/2506.09042","citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:d5aaabc6532bae03f1a8fa7d27010266516c93ad2683e7d9284de5ce9a758444","observation_id":"dae434a5-f7d6-44e8-9344-81cd38555028","resolution":{"observed_at":"2026-07-09T03:05:55.168574Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20523","last_updated":"2025-03-26T13:11:35Z","snapshot_observed_at":"2026-07-06T20:59:00.415760Z","submitted_at":"2025-03-26T13:11:35Z","title":"GAIA-2: A Controllable Multi-View Generative World Model for Autonomous Driving","version":1},"cited_work":{"arxiv_id":"2503.20523","doi":"10.48550/arxiv.2511.09057","metadata_source":"pith","pith_arxiv_id":"2503.20523","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GAIA-2: A Controllable Multi-View Generative World Model for Autonomous Driving","venue":"cs.CV","work_id":"1339e674-d09b-48b4-8e6f-efe55dcab22e","year":2025},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"cited_paper":"/paper/2503.20523","citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:b9ffadb74f56b470909833eaa0263912c654fbafb83f73cda689222232a8a991","observation_id":"a650b96b-0a8a-4a9f-8ab7-24366bf6f934","resolution":{"observed_at":"2026-07-09T03:05:55.259747Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.804878Z","title":"Image super-resolution via iterative refinement.IEEE transactions on pattern analysis and machine intelligence, 45(4):4713–4726, 2022","venue":null,"work_id":"6fa73d83-de6f-4bbc-b90e-6cdb1aee0f95","year":2022},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:80323edce37aea367048e2e9e5fcb03611e9fbfc35b25938d8d8b064d8719315","observation_id":"97ea944d-6de3-4aa4-9a62-14759002b823","resolution":{"observed_at":"2026-07-09T03:05:55.806491Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:9447bacb15ea39cb889889805b48683a4650310a7704a65142cfab1aa7cceb86","observation_id":"38a07966-514c-4155-a6e7-fe155d515dfa","resolution":{"observed_at":"2026-07-09T03:05:55.322189Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.14148","last_updated":"2026-04-15T17:59:40Z","snapshot_observed_at":"2026-07-06T23:02:00.082783Z","submitted_at":"2026-04-15T17:59:40Z","title":"Seedance 2.0: Advancing Video Generation for World Complexity","version":1},"cited_work":{"arxiv_id":"2604.14148","doi":"10.48550/arxiv.2604.14148","metadata_source":"pith","pith_arxiv_id":"2604.14148","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Seedance 2.0: Advancing Video Generation for World Complexity","venue":"cs.CV","work_id":"ceac4ea4-1ca6-4fe9-8324-880c07aec27d","year":2026},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"cited_paper":"/paper/2604.14148","citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:7026a539bc856a64a7b7b39d321523d928a240436115586a6abbe2da835581e1","observation_id":"c47deaf5-7d9f-4e98-973e-5430389a9be2","resolution":{"observed_at":"2026-07-09T03:05:55.356921Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.183783+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.183783+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.19378","last_updated":"2026-05-12T17:57:13Z","snapshot_observed_at":"2026-07-06T23:30:06.876413Z","submitted_at":"2026-05-12T17:57:13Z","title":"Sparse Mixture-of-Experts Routing in Visual Diffusion Transformers:Diagnosis, Boundary Calibration and Evolutionary Roadmap from Routing Collapse to Selective Deadlock","version":1},"cited_work":{"arxiv_id":"2605.19378","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.19378","snapshot_observed_at":"2026-07-09T03:05:55.350217Z","title":"Sparse Mixture-of-Experts Routing in Visual Diffusion Transformers:Diagnosis, Boundary Calibration and Evolutionary Roadmap from Routing Collapse to Selective Deadlock","venue":"cs.CV","work_id":"28b293a3-1fdb-4d74-b415-30948cc3dfe6","year":2026},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"cited_paper":"/paper/2605.19378","citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:b17779b18a34e1a06f315d84b8b464a60c8d974558c044c4dfd3392f2e98f360","observation_id":"5d982b03-7d9b-4c05-8e04-0c63c9ced34f","resolution":{"observed_at":"2026-07-09T03:05:55.352039Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:6433e4fcc79d6e4535e40547ba71d40fb37b3c76bd4c061f33480718edc9dab1","observation_id":"835da1a1-d149-49c7-a65f-865026b1d31b","resolution":{"observed_at":"2026-07-09T03:05:55.353715Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.05202","last_updated":"2020-02-12T19:57:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-02-12T19:57:13Z","title":"GLU Variants Improve Transformer","version":1},"cited_work":{"arxiv_id":"2002.05202","doi":"10.48550/arxiv.2002.05202","metadata_source":"pith","pith_arxiv_id":"2002.05202","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GLU Variants Improve Transformer","venue":"cs.LG","work_id":"17d0763c-1016-41ab-a478-478e890765eb","year":2020},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"cited_paper":"/paper/2002.05202","citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:49a80cfdf3ff6ca557f3c0f19d3208ab5dfc5e55698af7b58fbd20e84bd7f4f3","observation_id":"2a2a4251-64d1-4448-869e-7ab78b2c0bc5","resolution":{"observed_at":"2026-07-09T03:05:55.184581Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:50:07.002485+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:50:07.002485+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.869102Z","title":"Mesh-tensorflow: Deep learning for supercomputers","venue":null,"work_id":"95e86962-bbb6-4ac3-b77b-2558b6ebfa47","year":2018},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:78bbb71094bd724891d8e200b17d13c7573f2462b41bfe2b6c9ebf68c781caba","observation_id":"fb08d893-8931-4f43-89d8-362c3c877578","resolution":{"observed_at":"2026-07-09T03:05:55.870274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.863470Z","title":"Outrageously large neural networks: The sparsely-gated mixture-of-experts layer","venue":null,"work_id":"696ed560-cbac-4847-9355-4f8b9e59f848","year":2017},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:e3d6b12fee3592f034af31a7a90f25cb0306feeb000308a5e98a0660f0f2f545","observation_id":"32ae3d71-85b3-4adf-a9a1-8d7689e95057","resolution":{"observed_at":"2026-07-09T03:05:55.864664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T17:07:26.477602Z","title":"Hybridflow: A flexible and efficient rlhf framework","venue":null,"work_id":"3581d50d-6da4-452f-b4c2-9b9de8ade38a","year":2025},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:667fb5b5d4d7082bf0cae424a8d5c7ec33fdabb9b97e4f439b147cc7d2710906","observation_id":"1e44ba84-e90d-490b-a7b2-88690518180c","resolution":{"observed_at":"2026-07-09T03:05:55.884832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":"1909.08053","doi":"10.48550/arxiv.1909.08053","metadata_source":"pith","pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","venue":"cs.CL","work_id":"c888e6d1-0b1d-43d6-9ef5-f0912a0efa1b","year":2019},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:da6fa262cdd61ea725f1015ff6852372cd6e777c7a2f8f18b16eacb8ac7def85","observation_id":"6d976b50-22dc-484d-a0af-becea7fd26c9","resolution":{"observed_at":"2026-07-09T03:05:55.328143Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:33.392193+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:33.392193+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.867370Z","title":"Make-a-video: Text-to-video generation without text-video data","venue":null,"work_id":"a46c3c42-604a-462a-bf69-9d26f926f053","year":2023},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:203df7ace5edfb6334bfa9192dbd5d49a5e098254ce4aba0933a413d654284e8","observation_id":"1d797439-c349-460b-898b-43d24b56e346","resolution":{"observed_at":"2026-07-09T03:05:55.868532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.874564Z","title":"Denoising diffusion implicit models","venue":null,"work_id":"c9e23da9-2102-46dc-9b23-78dc77a7614b","year":2021},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:1d2e029acddf33171bd9dd310c20b9cad8695562cf5efde7731521f4ce285f96","observation_id":"8cf65560-843c-4178-95a5-a23029179f14","resolution":{"observed_at":"2026-07-09T03:05:55.875666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.861721Z","title":"Transnet v2: An effective deep network architecture for fast shot transition detection","venue":null,"work_id":"a49515c2-2c87-410f-8da0-57f514155068","year":2024},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:062dd76dba43feadd923f450e36ddb60ca5aeda7fd3bf1348f1db6782ff2c75f","observation_id":"d6d45c22-70df-4efe-bd4e-c9ed7ebb22cf","resolution":{"observed_at":"2026-07-09T03:05:55.862914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.14614","last_updated":"2026-06-09T16:18:08Z","snapshot_observed_at":"2026-08-03T16:11:09.055651Z","submitted_at":"2025-12-16T17:22:46Z","title":"WorldPlay: Towards Long-Term Geometric Consistency for Real-Time Interactive World Modeling","version":2},"cited_work":{"arxiv_id":"2512.14614","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.14614","snapshot_observed_at":"2026-07-09T07:56:04.709254Z","title":"WorldPlay: Towards Long-Term Geometric Consistency for Real-Time Interactive World Modeling","venue":"cs.CV","work_id":"48231e12-6c15-4f28-8c51-092766c59f93","year":2025},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"cited_paper":"/paper/2512.14614","citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:df9ba19e6f6f5f4e1cd8b31097d613ec3235d1ebd2b1f40325ca381b687cc89f","observation_id":"0755ce10-6287-42c9-857e-670fedd53d33","resolution":{"observed_at":"2026-07-09T03:05:55.236141Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.855866Z","title":"Enhancing spatial understanding in image generation via reward modeling","venue":null,"work_id":"0e4a2556-dbe9-44c8-b5fb-4531716c27b7","year":2026},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:5bcc85b37d0e750dfc0f2e71626d5f6c36ad9cc98ea036dcd3e62729b73c0ed3","observation_id":"160d8aa8-d12f-43e4-a359-51c79c75ad8d","resolution":{"observed_at":"2026-07-09T03:05:55.857468Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":"2312.11805","doi":"10.1038/nrn2888","metadata_source":"pith","pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemini: A Family of Highly Capable Multimodal Models","venue":"cs.CL","work_id":"83f7c85b-3f11-450f-ac0c-64d9745220b2","year":2023},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:ecb0a83595634cf1cfab5c209d48795b29bc312dcf2288806222bcfe9dc7181d","observation_id":"fcc3de0e-a0fe-440d-96e2-fab7e393983c","resolution":{"observed_at":"2026-07-09T03:05:55.328674Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.10675","doi":"10.48550/arxiv.2512.10675","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Evaluating Gemini Robotics Policies in a Veo World Simulator","venue":"ArXiv.org","work_id":"4c5c257d-41d7-459c-b2b8-ec7b082b9d94","year":2025},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:0974e557bef97427aca7967cc19d495f9d5076a0863a79965be2a769da5bfc7e","observation_id":"f74cdbbd-8267-4731-a1ee-2b41c2990fad","resolution":{"observed_at":"2026-07-09T03:05:55.344354Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:30.970172+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:30.970172+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.20540","last_updated":"2026-01-28T12:37:01Z","snapshot_observed_at":"2026-08-03T01:29:14.204066Z","submitted_at":"2026-01-28T12:37:01Z","title":"Advancing Open-source World Models","version":1},"cited_work":{"arxiv_id":"2601.20540","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.20540","snapshot_observed_at":"2026-07-10T08:36:59.816756Z","title":"Advancing Open-source World Models","venue":"cs.CV","work_id":"3446760e-6460-429e-82f6-6a5133ce4c8a","year":2026},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"cited_paper":"/paper/2601.20540","citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:23d3e4749ddef40692ce3d09cefda3e30f1143bf4da1d4052b205141586b844c","observation_id":"29b8e9b5-aa8a-4167-ad5f-f5db53fff0b4","resolution":{"observed_at":"2026-07-09T03:05:55.240536Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.858089Z","title":"slime: An LLM post-training framework for reinforcement learning at scale","venue":null,"work_id":"7cfddd68-375f-4232-9d01-d8e3fd558402","year":2025},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:85b9b02eb8d684f6d8a88a3bf5b45cefbe5f338772bcbba9cecd668ee9d61438","observation_id":"5eef6e33-39c3-4207-9b22-36a51d5beee7","resolution":{"observed_at":"2026-07-09T03:05:55.859462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:55.845797Z","title":"Improving and generalizing flow-based generative models with minibatch optimal transport.Transactions on Machine Learning Research, 2024","venue":null,"work_id":"4fd85efe-811e-438a-b639-bb6c48cd486d","year":2024},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:9ed34cbcf3f7f10e314ac09088ff6331c8d77da729acd33248444ec0234391dc","observation_id":"6ee41ac9-c8d5-49ce-bebb-de466474b3b1","resolution":{"observed_at":"2026-07-09T03:05:55.847540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":"2302.13971","doi":"10.48550/arxiv.2302.13971","metadata_source":"pith","pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaMA: Open and Efficient Foundation Language Models","venue":"cs.CL","work_id":"c018fc23-6f3f-4035-9d02-28a2173b2b9d","year":2023},"citing_paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-07-09T02:55:58.018234Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2607.07675"},"observation_digest":"sha256:ef1a9cc5fcd571b9012138cce50301c33d6914eadd40833407130a6d7409e5ea","observation_id":"f36e0406-9dc6-46d4-9573-787d6d1d8b00","resolution":{"observed_at":"2026-07-09T03:05:55.285108Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-01T11:08:05.851253+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T11:08:05.851253+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2607.07675","last_updated":"2026-07-08T17:33:40Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-02T22:09:26.507433Z","submitted_at":"2026-07-08T17:33:40Z","title":"Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":3,"parse_uncertain":1,"unresolved":0,"verified_exact":42,"verified_fuzzy":54},"total_outbound_references":131},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 100 of 131 outbound references and 4 inbound Pith citation observations for arXiv:2607.07675."}