{"as_of":"2026-08-13T11:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:24eee132bfdc9c2767fdaf6c5b93603fd218de3ab23ebd439e538cf79070e872","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T04:30:58.855512Z","state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T04:31:30.702800Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T04:31:30.785644Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.03410","last_updated":"2025-08-05T12:55:53Z","snapshot_observed_at":"2026-08-11T16:37:52.810640Z","submitted_at":"2025-08-05T12:55:53Z","title":"VisAug: Facilitating Speech-Rich Web Video Navigation and Engagement with Auto-Generated Visual Augmentations","version":1},"cited_work":{"arxiv_id":"2508.03410","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.03410","snapshot_observed_at":"2026-08-06T04:31:30.785644Z","title":"VisAug: Facilitating Speech-Rich Web Video Navigation and Engagement with Auto-Generated Visual Augmentations","venue":"cs.MM","work_id":"e52a12ae-887a-4ab2-88dc-5dccfe740bc7","year":2025},"citing_paper":{"arxiv_id":"2508.03409","last_updated":"2025-08-05T12:55:06Z","snapshot_observed_at":"2026-08-10T22:59:03.030909Z","submitted_at":"2025-08-05T12:55:06Z","title":"Cornelis Easton:The Milky Way as a spiral galaxy","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T04:31:30.702800Z"},"links":{"cited_paper":"/paper/2508.03410","citing_paper":"/paper/2508.03409"},"observation_digest":"sha256:5f5c34b89d87a825dd66e89f083c27f39ab9c9afaf73d060da92265811729e22","observation_id":"bb072915-1027-4b07-bcb8-ca1f9d69bb33","resolution":{"observed_at":"2026-08-06T04:31:30.867218Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2508.03410/citation-record","integrity":"/paper/2508.03410/integrity","json":"/paper/2508.03410/citation-record.json","paper":"/paper/2508.03410"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:31:05.219804Z","title":"Self- supervised object-centric learning for videos","venue":null,"work_id":"777020a6-0401-4656-b216-4f39794bc414","year":2023},"citing_paper":{"arxiv_id":"2508.03410","last_updated":"2025-08-05T12:55:53Z","snapshot_observed_at":"2026-08-11T16:37:52.810640Z","submitted_at":"2025-08-05T12:55:53Z","title":"VisAug: Facilitating Speech-Rich Web Video Navigation and Engagement with Auto-Generated Visual Augmentations","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:56.315227Z"},"links":{"citing_paper":"/paper/2508.03410"},"observation_digest":"sha256:ccc64af3ea3e8a5c797a1b8fa271e51b88d8dde1bd414165af54afb2061ac743","observation_id":"853abf69-ed9e-4ba1-9e1c-aac611e0a97d","resolution":{"observed_at":"2026-08-06T04:31:05.285548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:31:05.023280Z","title":"Invariant slot attention: object discovery with slot- centric reference frames","venue":null,"work_id":"3b49c4a0-260f-4934-994b-13181c423145","year":2023},"citing_paper":{"arxiv_id":"2508.03410","last_updated":"2025-08-05T12:55:53Z","snapshot_observed_at":"2026-08-11T16:37:52.810640Z","submitted_at":"2025-08-05T12:55:53Z","title":"VisAug: Facilitating Speech-Rich Web Video Navigation and Engagement with Auto-Generated Visual Augmentations","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:56.385986Z"},"links":{"citing_paper":"/paper/2508.03410"},"observation_digest":"sha256:4901041c215b6bd8464c9d48e1536c798110350c78caf0c56d982ad37264b2f1","observation_id":"afa7eafe-1c6b-495e-aa81-aad8e3b9446f","resolution":{"observed_at":"2026-08-06T04:31:05.128437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1901.11390","last_updated":"2019-01-22T18:55:34Z","snapshot_observed_at":"2026-08-13T08:44:00.110334Z","submitted_at":"2019-01-22T18:55:34Z","title":"MONet: Unsupervised Scene Decomposition and Representation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.11390","snapshot_observed_at":"2026-08-06T04:30:56.451793Z","title":"MONet: Unsupervised Scene Decomposition and Representation.arXiv preprint arXiv:1901.11390, 2019","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2508.03410","last_updated":"2025-08-05T12:55:53Z","snapshot_observed_at":"2026-08-11T16:37:52.810640Z","submitted_at":"2025-08-05T12:55:53Z","title":"VisAug: Facilitating Speech-Rich Web Video Navigation and Engagement with Auto-Generated Visual Augmentations","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:56.451793Z"},"links":{"cited_paper":"/paper/1901.11390","citing_paper":"/paper/2508.03410"},"observation_digest":"sha256:986578c8f004354bda9b11c6ed7ae7f084cb39a254b53b53d77d677eb2184309","observation_id":"788d4df3-a31c-4f4f-98b0-77e2e490960f","resolution":{"observed_at":"2026-08-06T04:30:56.451793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:31:04.841369Z","title":"Emerg- ing properties in self-supervised vision transformers","venue":null,"work_id":"cc9e546d-3be4-4218-80a0-bac5a220600f","year":2021},"citing_paper":{"arxiv_id":"2508.03410","last_updated":"2025-08-05T12:55:53Z","snapshot_observed_at":"2026-08-11T16:37:52.810640Z","submitted_at":"2025-08-05T12:55:53Z","title":"VisAug: Facilitating Speech-Rich Web Video Navigation and Engagement with Auto-Generated Visual Augmentations","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:56.539206Z"},"links":{"citing_paper":"/paper/2508.03410"},"observation_digest":"sha256:d3ddb4ed31c1d3d51a1d33916be21edac19ac5dc094ee333956b7d67d74d87d7","observation_id":"e0b0dcf3-e677-4c6c-bdf3-e74073ec048f","resolution":{"observed_at":"2026-08-06T04:31:04.939414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:31:04.697785Z","title":"Sobolev training for neural networks","venue":null,"work_id":"19164433-452b-4bda-a975-70f6fcccda93","year":2017},"citing_paper":{"arxiv_id":"2508.03410","last_updated":"2025-08-05T12:55:53Z","snapshot_observed_at":"2026-08-11T16:37:52.810640Z","submitted_at":"2025-08-05T12:55:53Z","title":"VisAug: Facilitating Speech-Rich Web Video Navigation and Engagement with Auto-Generated Visual Augmentations","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:56.608318Z"},"links":{"citing_paper":"/paper/2508.03410"},"observation_digest":"sha256:970c1eea10ac9318373b192554f72579a8d8505d195add85e8f4bb2aa688780c","observation_id":"a835b49b-c214-476c-becb-a1db42252975","resolution":{"observed_at":"2026-08-06T04:31:04.752038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:30:56.664516Z","title":"CTRL-O: Language-Controllable Object-Centric Visual Representation Learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.03410","last_updated":"2025-08-05T12:55:53Z","snapshot_observed_at":"2026-08-11T16:37:52.810640Z","submitted_at":"2025-08-05T12:55:53Z","title":"VisAug: Facilitating Speech-Rich Web Video Navigation and Engagement with Auto-Generated Visual Augmentations","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:56.664516Z"},"links":{"citing_paper":"/paper/2508.03410"},"observation_digest":"sha256:2fc7b9e181655f28cdc51ff3c940d37079a8499e80fc74114fc160031dbb5bbe","observation_id":"7ea62f96-40c5-4b5c-a6ae-7891b212fdbe","resolution":{"observed_at":"2026-08-06T04:30:56.664516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:30:56.725716Z","title":"SA Vi++: Towards end-to-end object-centric learning from real-world videos","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.03410","last_updated":"2025-08-05T12:55:53Z","snapshot_observed_at":"2026-08-11T16:37:52.810640Z","submitted_at":"2025-08-05T12:55:53Z","title":"VisAug: Facilitating Speech-Rich Web Video Navigation and Engagement with Auto-Generated Visual Augmentations","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:56.725716Z"},"links":{"citing_paper":"/paper/2508.03410"},"observation_digest":"sha256:7602d9205c46370b3874077663e7740437673dcba045207485a302b8a2d88c81","observation_id":"f930be02-3da2-4fcc-92d6-29c250c9037a","resolution":{"observed_at":"2026-08-06T04:30:56.725716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:30:56.774375Z","title":"Adap- tive slot attention: Object discovery with dynamic slot num- ber","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03410","last_updated":"2025-08-05T12:55:53Z","snapshot_observed_at":"2026-08-11T16:37:52.810640Z","submitted_at":"2025-08-05T12:55:53Z","title":"VisAug: Facilitating Speech-Rich Web Video Navigation and Engagement with Auto-Generated Visual Augmentations","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:56.774375Z"},"links":{"citing_paper":"/paper/2508.03410"},"observation_digest":"sha256:b656daf673ec0b49b63a996fe62c0ceafe279e7be5bc84558932e6432ce6fe55","observation_id":"13164b92-a76f-4537-9434-634e112842e6","resolution":{"observed_at":"2026-08-06T04:30:56.774375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:31:04.506743Z","title":"MoVi: A large multi-purpose human motion and video dataset.PLoS One, 16(6):e0253157, 2021","venue":null,"work_id":"9fb6aecb-a533-474f-8893-21c5b5cdaf26","year":2021},"citing_paper":{"arxiv_id":"2508.03410","last_updated":"2025-08-05T12:55:53Z","snapshot_observed_at":"2026-08-11T16:37:52.810640Z","submitted_at":"2025-08-05T12:55:53Z","title":"VisAug: Facilitating Speech-Rich Web Video Navigation and Engagement with Auto-Generated Visual Augmentations","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:56.839087Z"},"links":{"citing_paper":"/paper/2508.03410"},"observation_digest":"sha256:bffeb2729a5477418ad8bff62df96f669b66cf9f3d758a32245f29ae83166c50","observation_id":"d236eda9-cf8d-4093-ab34-4d7c9f54fc61","resolution":{"observed_at":"2026-08-06T04:31:04.582904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:31:04.318391Z","title":"Tagger: Deep un- supervised perceptual grouping","venue":null,"work_id":"200f0af7-fc57-4a3d-bfb2-ecfba85ee0a0","year":null},"citing_paper":{"arxiv_id":"2508.03410","last_updated":"2025-08-05T12:55:53Z","snapshot_observed_at":"2026-08-11T16:37:52.810640Z","submitted_at":"2025-08-05T12:55:53Z","title":"VisAug: Facilitating Speech-Rich Web Video Navigation and Engagement with Auto-Generated Visual Augmentations","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:56.896320Z"},"links":{"citing_paper":"/paper/2508.03410"},"observation_digest":"sha256:ae6bfbf0c6c075351b9612e2d859145dddaa3ec013707212b41650a61e7d0869","observation_id":"9bebab07-a7b3-4fab-b6e9-c7711aca7fd3","resolution":{"observed_at":"2026-08-06T04:31:04.421492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:31:04.132840Z","title":"Neural expectation maximization","venue":null,"work_id":"391f30fe-0b7a-4be9-96cf-0f2e501579de","year":2017},"citing_paper":{"arxiv_id":"2508.03410","last_updated":"2025-08-05T12:55:53Z","snapshot_observed_at":"2026-08-11T16:37:52.810640Z","submitted_at":"2025-08-05T12:55:53Z","title":"VisAug: Facilitating Speech-Rich Web Video Navigation and Engagement with Auto-Generated Visual Augmentations","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:56.954368Z"},"links":{"citing_paper":"/paper/2508.03410"},"observation_digest":"sha256:46d50249eab55ded1a65c5100a05a47db26eaa429937029ae893029090828fb0","observation_id":"3dbd392c-dc5c-4cfe-87f1-d1009247cf78","resolution":{"observed_at":"2026-08-06T04:31:04.211712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:31:03.920034Z","title":"Multi-object representation learning with iterative variational inference","venue":null,"work_id":"190abdbf-cdae-403f-b131-b2b45482a755","year":2019},"citing_paper":{"arxiv_id":"2508.03410","last_updated":"2025-08-05T12:55:53Z","snapshot_observed_at":"2026-08-11T16:37:52.810640Z","submitted_at":"2025-08-05T12:55:53Z","title":"VisAug: Facilitating Speech-Rich Web Video Navigation and Engagement with Auto-Generated Visual Augmentations","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:57.010076Z"},"links":{"citing_paper":"/paper/2508.03410"},"observation_digest":"sha256:a3cd5c8f4789c631aabf0eae8f35f6a506fe62b85c50925e4d23c5314173d1d5","observation_id":"5d1fec2e-4287-4024-bcb6-510d26a8e419","resolution":{"observed_at":"2026-08-06T04:31:04.031103Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:31:03.693734Z","title":"MiniLLM: Knowledge Distillation of Large Language Mod- els","venue":null,"work_id":"af0086f7-6f83-4f89-95bd-c12f387cec40","year":2024},"citing_paper":{"arxiv_id":"2508.03410","last_updated":"2025-08-05T12:55:53Z","snapshot_observed_at":"2026-08-11T16:37:52.810640Z","submitted_at":"2025-08-05T12:55:53Z","title":"VisAug: Facilitating Speech-Rich Web Video Navigation and Engagement with Auto-Generated Visual Augmentations","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:57.073725Z"},"links":{"citing_paper":"/paper/2508.03410"},"observation_digest":"sha256:d03b0aaab61bb83d3412d57e9878c47dcb0fb53fc73f7c7177702720af12b667","observation_id":"f8ef2d4b-b7b5-40ef-922d-7bb24ddd1f00","resolution":{"observed_at":"2026-08-06T04:31:03.799045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:31:03.483268Z","title":"Masked autoencoders are scal- able vision learners","venue":null,"work_id":"c50966ac-5e21-4440-ae72-f96ce219c435","year":2022},"citing_paper":{"arxiv_id":"2508.03410","last_updated":"2025-08-05T12:55:53Z","snapshot_observed_at":"2026-08-11T16:37:52.810640Z","submitted_at":"2025-08-05T12:55:53Z","title":"VisAug: Facilitating Speech-Rich Web Video Navigation and Engagement with Auto-Generated Visual Augmentations","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:57.122200Z"},"links":{"citing_paper":"/paper/2508.03410"},"observation_digest":"sha256:a9d0206d03d32a02623f851c590916dd2137c2b70d075c01b4ddc0da364a5573","observation_id":"5782148d-ac6e-4093-9c78-edd1cd0cfef9","resolution":{"observed_at":"2026-08-06T04:31:03.587311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-07-06T04:11:24.157003Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-06T04:30:57.206596Z","title":"Distill- ing the knowledge in a neural network.arXiv preprint arXiv:1503.02531, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2508.03410","last_updated":"2025-08-05T12:55:53Z","snapshot_observed_at":"2026-08-11T16:37:52.810640Z","submitted_at":"2025-08-05T12:55:53Z","title":"VisAug: Facilitating Speech-Rich Web Video Navigation and Engagement with Auto-Generated Visual Augmentations","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:57.206596Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2508.03410"},"observation_digest":"sha256:2c7d11478fee5a2a462ddde95e3d1d1f45837eb3d3637965180014d13b0a47cd","observation_id":"00520d13-c187-4762-9a1a-6a8358dab990","resolution":{"observed_at":"2026-08-06T04:30:57.206596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:31:03.288083Z","title":"Multi-level feature distillation of joint teachers trained on distinct image datasets","venue":null,"work_id":"d45cee95-0a81-4be4-8d11-184a9a48020d","year":2025},"citing_paper":{"arxiv_id":"2508.03410","last_updated":"2025-08-05T12:55:53Z","snapshot_observed_at":"2026-08-11T16:37:52.810640Z","submitted_at":"2025-08-05T12:55:53Z","title":"VisAug: Facilitating Speech-Rich Web Video Navigation and Engagement with Auto-Generated Visual Augmentations","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:57.274758Z"},"links":{"citing_paper":"/paper/2508.03410"},"observation_digest":"sha256:00a8c6b5786dfa09a61577c062ff79cecc596c020b68c78ee9f9543e3c77d46c","observation_id":"bc62d036-bb5f-4dc8-bd36-387ca04eca9e","resolution":{"observed_at":"2026-08-06T04:31:03.365189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:30:57.347323Z","title":"Improving object- centric learning with query optimization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.03410","last_updated":"2025-08-05T12:55:53Z","snapshot_observed_at":"2026-08-11T16:37:52.810640Z","submitted_at":"2025-08-05T12:55:53Z","title":"VisAug: Facilitating Speech-Rich Web Video Navigation and Engagement with Auto-Generated Visual Augmentations","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:57.347323Z"},"links":{"citing_paper":"/paper/2508.03410"},"observation_digest":"sha256:da03cf8d26cf1216d09520a2acb7f19b9c4c2fb279e7eaa1c130b4a3a4e1e7ce","observation_id":"d71c245f-57bd-4c87-a2cc-7f44af9ecddb","resolution":{"observed_at":"2026-08-06T04:30:57.347323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:31:02.996373Z","title":"SPOT: Self-Training with Patch-Order Permutation for Object-Centric Learning with Autoregressive Transformers","venue":null,"work_id":"69924117-5e63-4521-9941-df3daca93e26","year":2024},"citing_paper":{"arxiv_id":"2508.03410","last_updated":"2025-08-05T12:55:53Z","snapshot_observed_at":"2026-08-11T16:37:52.810640Z","submitted_at":"2025-08-05T12:55:53Z","title":"VisAug: Facilitating Speech-Rich Web Video Navigation and Engagement with Auto-Generated Visual Augmentations","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:57.389490Z"},"links":{"citing_paper":"/paper/2508.03410"},"observation_digest":"sha256:0a8acd34c88b697b68ece5278da7330666dbe8d0708d03b1db37ba372306d491","observation_id":"00622ac3-50ac-4062-885f-51679a8509d7","resolution":{"observed_at":"2026-08-06T04:31:03.157503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:31:02.757828Z","title":"DIOD: Self-Distillation Meets Ob- ject Discovery","venue":null,"work_id":"afb476f6-fd20-4d17-be1b-27c1a2b1be28","year":null},"citing_paper":{"arxiv_id":"2508.03410","last_updated":"2025-08-05T12:55:53Z","snapshot_observed_at":"2026-08-11T16:37:52.810640Z","submitted_at":"2025-08-05T12:55:53Z","title":"VisAug: Facilitating Speech-Rich Web Video Navigation and Engagement with Auto-Generated Visual Augmentations","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:57.480626Z"},"links":{"citing_paper":"/paper/2508.03410"},"observation_digest":"sha256:1a76b2dd47fb4e6c736a896eb8155de97bccea7e2ba81c1acbd7afcbd2092bdb","observation_id":"4b2b0fd7-dc79-405d-a25a-498f0a23ad8a","resolution":{"observed_at":"2026-08-06T04:31:02.866586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:31:02.537236Z","title":"Elsayed, Aravindh Mahen- dran, Austin Stone, Sara Sabour, Georg Heigold, Rico Jon- schkowski, Alexey Dosovitskiy, and Klaus Greff","venue":null,"work_id":"fe98a19c-7606-428e-9b1d-b6b5a7f57ce3","year":2022},"citing_paper":{"arxiv_id":"2508.03410","last_updated":"2025-08-05T12:55:53Z","snapshot_observed_at":"2026-08-11T16:37:52.810640Z","submitted_at":"2025-08-05T12:55:53Z","title":"VisAug: Facilitating Speech-Rich Web Video Navigation and Engagement with Auto-Generated Visual Augmentations","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:57.547467Z"},"links":{"citing_paper":"/paper/2508.03410"},"observation_digest":"sha256:2b04076cf647a6e2e1149e2b61d4f08f8e9ed974a1e627a2a20617d6c01a35e1","observation_id":"62c6b32d-722d-4918-a9fb-e5f478849866","resolution":{"observed_at":"2026-08-06T04:31:02.637383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:31:02.298672Z","title":"Object-centric cross- modal feature distillation for event-based object detection","venue":null,"work_id":"311805da-b4cc-42b4-98bc-a8f5f02cd2e6","year":2024},"citing_paper":{"arxiv_id":"2508.03410","last_updated":"2025-08-05T12:55:53Z","snapshot_observed_at":"2026-08-11T16:37:52.810640Z","submitted_at":"2025-08-05T12:55:53Z","title":"VisAug: Facilitating Speech-Rich Web Video Navigation and Engagement with Auto-Generated Visual Augmentations","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:57.618336Z"},"links":{"citing_paper":"/paper/2508.03410"},"observation_digest":"sha256:e74d8f89a0b8160319f031c5df324802f8c7a89c52351d7f17cb0e3480c700fc","observation_id":"8c313c9c-04d6-4ee1-82ae-ddb00b39d19e","resolution":{"observed_at":"2026-08-06T04:31:02.437533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:31:02.051642Z","title":"Hashimoto","venue":null,"work_id":"5859049d-84bd-4d3a-94c9-5bd9f59a07d5","year":2025},"citing_paper":{"arxiv_id":"2508.03410","last_updated":"2025-08-05T12:55:53Z","snapshot_observed_at":"2026-08-11T16:37:52.810640Z","submitted_at":"2025-08-05T12:55:53Z","title":"VisAug: Facilitating Speech-Rich Web Video Navigation and Engagement with Auto-Generated Visual Augmentations","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:57.690861Z"},"links":{"citing_paper":"/paper/2508.03410"},"observation_digest":"sha256:864829b714c04a5eddc627eb76963b90078d847078d53db72bdd9cbab14f1926","observation_id":"21f4a567-791d-4453-ab7a-96d1ec00b5b7","resolution":{"observed_at":"2026-08-06T04:31:02.138735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:31:01.868859Z","title":"Microsoft COCO: Common Objects in Context","venue":null,"work_id":"c43168a2-d438-4d11-ac06-dd98cb3301da","year":2014},"citing_paper":{"arxiv_id":"2508.03410","last_updated":"2025-08-05T12:55:53Z","snapshot_observed_at":"2026-08-11T16:37:52.810640Z","submitted_at":"2025-08-05T12:55:53Z","title":"VisAug: Facilitating Speech-Rich Web Video Navigation and Engagement with Auto-Generated Visual Augmentations","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:57.778202Z"},"links":{"citing_paper":"/paper/2508.03410"},"observation_digest":"sha256:ac1d6cbc090c071a9fcaba0555d94e6fcf8d5efe81fb6aab18c673e006c4002f","observation_id":"d0f3c9ce-1e28-420f-822d-f92e0ddfed7a","resolution":{"observed_at":"2026-08-06T04:31:01.961664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:31:01.674246Z","title":"Object- centric learning with slot attention","venue":null,"work_id":"b81b2923-cb10-482e-8852-b9615f93cec2","year":2020},"citing_paper":{"arxiv_id":"2508.03410","last_updated":"2025-08-05T12:55:53Z","snapshot_observed_at":"2026-08-11T16:37:52.810640Z","submitted_at":"2025-08-05T12:55:53Z","title":"VisAug: Facilitating Speech-Rich Web Video Navigation and Engagement with Auto-Generated Visual Augmentations","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:57.874877Z"},"links":{"citing_paper":"/paper/2508.03410"},"observation_digest":"sha256:e9388da8b8c2fa905f6967ad10b6c8588347fe2083467eddb9d6a821f9de3367","observation_id":"492b0791-372a-44d9-a45a-58deda931865","resolution":{"observed_at":"2026-08-06T04:31:01.761165Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:31:01.453509Z","title":"Temporally consistent object-centric learning by contrasting slots","venue":null,"work_id":"4c050aa4-f1e7-48fa-bf66-42f9bcfbe1c4","year":2025},"citing_paper":{"arxiv_id":"2508.03410","last_updated":"2025-08-05T12:55:53Z","snapshot_observed_at":"2026-08-11T16:37:52.810640Z","submitted_at":"2025-08-05T12:55:53Z","title":"VisAug: Facilitating Speech-Rich Web Video Navigation and Engagement with Auto-Generated Visual Augmentations","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:57.969711Z"},"links":{"citing_paper":"/paper/2508.03410"},"observation_digest":"sha256:548d43fcff3b450ec8bcaacfaa889e9563a5662db100e5db6c96f2bcb68948ec","observation_id":"d13e6d06-ee1d-4dfd-866b-a4b6a6ad3d0e","resolution":{"observed_at":"2026-08-06T04:31:01.576513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:31:01.147369Z","title":"DINOv2: Learning robust visual features without supervi- sion.Transactions on Machine Learning Research, 2024","venue":null,"work_id":"28633066-fe8d-48c1-b8dc-d5fc2d6993ab","year":2024},"citing_paper":{"arxiv_id":"2508.03410","last_updated":"2025-08-05T12:55:53Z","snapshot_observed_at":"2026-08-11T16:37:52.810640Z","submitted_at":"2025-08-05T12:55:53Z","title":"VisAug: Facilitating Speech-Rich Web Video Navigation and Engagement with Auto-Generated Visual Augmentations","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:58.071804Z"},"links":{"citing_paper":"/paper/2508.03410"},"observation_digest":"sha256:7a670ec5cc7dc68162c4f31d1c946d5bf6b1be07a06e49edfaa864b21f2c39f9","observation_id":"01100cb7-ef8f-4908-ad72-21d653f1ccaf","resolution":{"observed_at":"2026-08-06T04:31:01.311964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:31:00.834343Z","title":"Perazzi, J","venue":null,"work_id":"26d19509-8870-44ac-95b4-f2e75ecc4640","year":2016},"citing_paper":{"arxiv_id":"2508.03410","last_updated":"2025-08-05T12:55:53Z","snapshot_observed_at":"2026-08-11T16:37:52.810640Z","submitted_at":"2025-08-05T12:55:53Z","title":"VisAug: Facilitating Speech-Rich Web Video Navigation and Engagement with Auto-Generated Visual Augmentations","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:58.150727Z"},"links":{"citing_paper":"/paper/2508.03410"},"observation_digest":"sha256:0ea8006d69e514e28851f75be898c24167c2d3855ef088f46750bd18a194a480","observation_id":"998a1e18-719b-4f53-b3f6-dbb637f54a42","resolution":{"observed_at":"2026-08-06T04:31:01.016609Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:31:00.516331Z","title":"Torr, and Song Bai","venue":null,"work_id":"ff0dedb2-4e6c-4114-a3d4-63b284e9239d","year":2022},"citing_paper":{"arxiv_id":"2508.03410","last_updated":"2025-08-05T12:55:53Z","snapshot_observed_at":"2026-08-11T16:37:52.810640Z","submitted_at":"2025-08-05T12:55:53Z","title":"VisAug: Facilitating Speech-Rich Web Video Navigation and Engagement with Auto-Generated Visual Augmentations","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:58.223978Z"},"links":{"citing_paper":"/paper/2508.03410"},"observation_digest":"sha256:5c50b18a76363f92c561074d1ceaef86cd6eaf78bc27e3e8a0fe97ddf0921e3f","observation_id":"f3dca698-d562-411f-996e-b2d9e1717786","resolution":{"observed_at":"2026-08-06T04:31:00.692495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6550","last_updated":"2015-03-27T11:52:28Z","snapshot_observed_at":"2026-07-06T04:04:16.777653Z","submitted_at":"2014-12-19T22:40:51Z","title":"FitNets: Hints for Thin Deep Nets","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6550","snapshot_observed_at":"2026-08-06T04:30:58.248095Z","title":"FitNets: Hints for Thin Deep Nets.arXiv preprint arXiv:1412.6550,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03410","last_updated":"2025-08-05T12:55:53Z","snapshot_observed_at":"2026-08-11T16:37:52.810640Z","submitted_at":"2025-08-05T12:55:53Z","title":"VisAug: Facilitating Speech-Rich Web Video Navigation and Engagement with Auto-Generated Visual Augmentations","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:58.248095Z"},"links":{"cited_paper":"/paper/1412.6550","citing_paper":"/paper/2508.03410"},"observation_digest":"sha256:112cc59fd71dbef3660d4ff651cb8cda7aba38ca453b76127d942397026f0c35","observation_id":"f2d0397d-f3bc-4e86-8f64-26d5d111339e","resolution":{"observed_at":"2026-08-06T04:30:58.248095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:31:00.205823Z","title":"Bridging the gap to real-world object-centric learning","venue":null,"work_id":"24d684e4-51e2-42a9-a72b-fbfa346ae330","year":2023},"citing_paper":{"arxiv_id":"2508.03410","last_updated":"2025-08-05T12:55:53Z","snapshot_observed_at":"2026-08-11T16:37:52.810640Z","submitted_at":"2025-08-05T12:55:53Z","title":"VisAug: Facilitating Speech-Rich Web Video Navigation and Engagement with Auto-Generated Visual Augmentations","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:58.306675Z"},"links":{"citing_paper":"/paper/2508.03410"},"observation_digest":"sha256:3b54d7c973c31fc1b9ac7c0ae342aef5f42edf5f8dfd1b71d3edb3cf6c84bd11","observation_id":"c0adba32-53f7-49ed-83e2-d08b174b2882","resolution":{"observed_at":"2026-08-06T04:31:00.372198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:30:59.862704Z","title":"Simple unsu- pervised object-centric learning for complex and naturalis- tic videos","venue":null,"work_id":"d7fb13da-ecc7-4d91-9b50-5396f266a024","year":null},"citing_paper":{"arxiv_id":"2508.03410","last_updated":"2025-08-05T12:55:53Z","snapshot_observed_at":"2026-08-11T16:37:52.810640Z","submitted_at":"2025-08-05T12:55:53Z","title":"VisAug: Facilitating Speech-Rich Web Video Navigation and Engagement with Auto-Generated Visual Augmentations","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:58.384400Z"},"links":{"citing_paper":"/paper/2508.03410"},"observation_digest":"sha256:12eb15fe23889575960948de057d4b156133339a39fd6a850a88731b6645590f","observation_id":"623dff23-c2ad-4960-95f6-3d55c66f6bb5","resolution":{"observed_at":"2026-08-06T04:31:00.032058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:30:59.684208Z","title":"Self-supervised video object segmentation by motion grouping","venue":null,"work_id":"17719e7a-cecc-4ece-bc98-6b39b79ec8f3","year":2021},"citing_paper":{"arxiv_id":"2508.03410","last_updated":"2025-08-05T12:55:53Z","snapshot_observed_at":"2026-08-11T16:37:52.810640Z","submitted_at":"2025-08-05T12:55:53Z","title":"VisAug: Facilitating Speech-Rich Web Video Navigation and Engagement with Auto-Generated Visual Augmentations","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:58.454779Z"},"links":{"citing_paper":"/paper/2508.03410"},"observation_digest":"sha256:afe72f980927c9e15bef56b0064fb71bf0a2aef04802ee9e8f9e0240e6146f26","observation_id":"4109caf7-3d09-4470-9f27-fc1938d7b9df","resolution":{"observed_at":"2026-08-06T04:30:59.789129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:30:59.542582Z","title":"The 3rd large-scale video object segmentation challenge - video in- stance segmentation track, 2021","venue":null,"work_id":"74540fb5-9bdf-4423-bad2-b960092b1aa9","year":2021},"citing_paper":{"arxiv_id":"2508.03410","last_updated":"2025-08-05T12:55:53Z","snapshot_observed_at":"2026-08-11T16:37:52.810640Z","submitted_at":"2025-08-05T12:55:53Z","title":"VisAug: Facilitating Speech-Rich Web Video Navigation and Engagement with Auto-Generated Visual Augmentations","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:58.585604Z"},"links":{"citing_paper":"/paper/2508.03410"},"observation_digest":"sha256:f24175be82d283d1adcc08b32316a3fdfaa9bc04f870f165e7c98caab1fbf736","observation_id":"60a88745-0076-4b62-9070-000ae8c311de","resolution":{"observed_at":"2026-08-06T04:30:59.606311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:30:59.322076Z","title":"Object-centric learning for real-world videos by predict- ing temporal feature similarities","venue":null,"work_id":"6b7225d2-b41b-4d7b-83f7-fc4a2c755f6b","year":2023},"citing_paper":{"arxiv_id":"2508.03410","last_updated":"2025-08-05T12:55:53Z","snapshot_observed_at":"2026-08-11T16:37:52.810640Z","submitted_at":"2025-08-05T12:55:53Z","title":"VisAug: Facilitating Speech-Rich Web Video Navigation and Engagement with Auto-Generated Visual Augmentations","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:58.699996Z"},"links":{"citing_paper":"/paper/2508.03410"},"observation_digest":"sha256:936ce06637c0b1a6f6c252f2ed57cb72f5c9c11b46e4135eb9bfe3011990bc8b","observation_id":"92a05be0-e7c7-42ad-ac55-0297dd531122","resolution":{"observed_at":"2026-08-06T04:30:59.442514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:30:59.149869Z","title":"The SLOTMATCHstudent based on DINOv2 is compared with an equivalent architecture without distillation (no KD), as well as its corresponding teacher model","venue":null,"work_id":"49562ebc-d1aa-47e8-a15f-7bdba945d91e","year":2021},"citing_paper":{"arxiv_id":"2508.03410","last_updated":"2025-08-05T12:55:53Z","snapshot_observed_at":"2026-08-11T16:37:52.810640Z","submitted_at":"2025-08-05T12:55:53Z","title":"VisAug: Facilitating Speech-Rich Web Video Navigation and Engagement with Auto-Generated Visual Augmentations","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:58.777597Z"},"links":{"citing_paper":"/paper/2508.03410"},"observation_digest":"sha256:ae1eda95119ee0d020aa7bd00a0da380a0580b29e76bcbfda99ea316b537662f","observation_id":"8855759e-aea4-430e-ab96-00dc24dfd321","resolution":{"observed_at":"2026-08-06T04:30:59.223002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T04:30:58.986875Z","title":"In preliminary experiments, we found the standard deviation for FG-ARI, and mBO across seeds to be within±0.06 and±0.29 on YTVIS, indicating stable convergence behavior","venue":null,"work_id":"2bacf346-add0-4daa-afad-0c772a3aad2d","year":2021},"citing_paper":{"arxiv_id":"2508.03410","last_updated":"2025-08-05T12:55:53Z","snapshot_observed_at":"2026-08-11T16:37:52.810640Z","submitted_at":"2025-08-05T12:55:53Z","title":"VisAug: Facilitating Speech-Rich Web Video Navigation and Engagement with Auto-Generated Visual Augmentations","version":1},"reference_index":2048,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:58.855512Z"},"links":{"citing_paper":"/paper/2508.03410"},"observation_digest":"sha256:4e0578dd430f3e022f3accf61dde1f7d094ffb29ab75bf1c9c71f0cd434416cd","observation_id":"fe00adde-0429-40ae-8600-88453e16f351","resolution":{"observed_at":"2026-08-06T04:30:59.064396Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.03410","last_updated":"2025-08-05T12:55:53Z","latest_version":1,"primary_category":"cs.MM","snapshot_observed_at":"2026-08-11T16:37:52.810640Z","submitted_at":"2025-08-05T12:55:53Z","title":"VisAug: Facilitating Speech-Rich Web Video Navigation and Engagement with Auto-Generated Visual Augmentations"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":7,"verified_exact":0,"verified_fuzzy":29},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 1 inbound Pith citation observation for arXiv:2508.03410."}