{"as_of":"2026-08-11T06:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d20a16557da1598b7d40d61bdda7453f1070fa2d2793206235b642655f6810a3","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T19:13:03.461605Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2502.00397/citation-record","integrity":"/paper/2502.00397/integrity","json":"/paper/2502.00397/citation-record.json","paper":"/paper/2502.00397"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:13:03.844687Z","title":"Visual saliency model for robot cameras,","venue":null,"work_id":"66949d4d-30ef-42f8-a5cb-cb345aa1b002","year":2008},"citing_paper":{"arxiv_id":"2502.00397","last_updated":"2025-02-01T11:05:28Z","snapshot_observed_at":"2026-08-09T19:07:14.387115Z","submitted_at":"2025-02-01T11:05:28Z","title":"Minimalistic Video Saliency Prediction via Efficient Decoder & Spatio Temporal Action Cues","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-09T19:13:03.340855Z"},"links":{"citing_paper":"/paper/2502.00397"},"observation_digest":"sha256:bfd671ad11f08cf9d34283ab227f35877dd204f24f559a797e63218fd9907dc8","observation_id":"6e431000-728e-4e1b-aea8-b111e21bf261","resolution":{"observed_at":"2026-08-09T19:13:03.847907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:13:03.836349Z","title":"Gazed– gaze-guided cinematic editing of wide-angle monocular video record- ings,","venue":null,"work_id":"a91f6f7a-81ca-40c3-b064-e88eb11f8186","year":2020},"citing_paper":{"arxiv_id":"2502.00397","last_updated":"2025-02-01T11:05:28Z","snapshot_observed_at":"2026-08-09T19:07:14.387115Z","submitted_at":"2025-02-01T11:05:28Z","title":"Minimalistic Video Saliency Prediction via Efficient Decoder & Spatio Temporal Action Cues","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-09T19:13:03.344735Z"},"links":{"citing_paper":"/paper/2502.00397"},"observation_digest":"sha256:79926bc6005413c1e27900dc9dfe481dc55e48703cac5cc82886bff872c885df","observation_id":"ea8f4b89-fb3f-48f3-872b-0237b650bcf2","resolution":{"observed_at":"2026-08-09T19:13:03.839453Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:13:03.827257Z","title":"Salgaze: Personalizing gaze estimation using visual saliency,","venue":null,"work_id":"39942e64-7cfa-431c-97b1-0a7885737a3c","year":2019},"citing_paper":{"arxiv_id":"2502.00397","last_updated":"2025-02-01T11:05:28Z","snapshot_observed_at":"2026-08-09T19:07:14.387115Z","submitted_at":"2025-02-01T11:05:28Z","title":"Minimalistic Video Saliency Prediction via Efficient Decoder & Spatio Temporal Action Cues","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-09T19:13:03.348390Z"},"links":{"citing_paper":"/paper/2502.00397"},"observation_digest":"sha256:67ce74d3193c803eb13d3b0e4e08304f8f78a643c9b4aaf9dfb3b02d9d69e34a","observation_id":"ebdca697-77f8-48eb-ac5b-2f3c87437f02","resolution":{"observed_at":"2026-08-09T19:13:03.830304Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:13:03.818475Z","title":"Attentional mechanisms for socially in- teractive robots–a survey,","venue":null,"work_id":"d8734196-3eb4-42d2-b387-a9dac54a5bcf","year":2014},"citing_paper":{"arxiv_id":"2502.00397","last_updated":"2025-02-01T11:05:28Z","snapshot_observed_at":"2026-08-09T19:07:14.387115Z","submitted_at":"2025-02-01T11:05:28Z","title":"Minimalistic Video Saliency Prediction via Efficient Decoder & Spatio Temporal Action Cues","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-09T19:13:03.352217Z"},"links":{"citing_paper":"/paper/2502.00397"},"observation_digest":"sha256:dcad3940f4be81a88fee99ac15cfec0fc7fc635d4f28010518a68a2cec48091b","observation_id":"c10f5d01-7c3b-446e-b2af-0623aca4cfa0","resolution":{"observed_at":"2026-08-09T19:13:03.821962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:13:03.808281Z","title":"Facial expression recognition using visual saliency and deep learning,","venue":null,"work_id":"0e4027e0-5b7c-4def-97f6-d49e53d8b560","year":2017},"citing_paper":{"arxiv_id":"2502.00397","last_updated":"2025-02-01T11:05:28Z","snapshot_observed_at":"2026-08-09T19:07:14.387115Z","submitted_at":"2025-02-01T11:05:28Z","title":"Minimalistic Video Saliency Prediction via Efficient Decoder & Spatio Temporal Action Cues","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-09T19:13:03.355918Z"},"links":{"citing_paper":"/paper/2502.00397"},"observation_digest":"sha256:ab55f63692146f65baceaaec792160f36c0dc83a772dc6d952221f82dd26133a","observation_id":"af87c647-ecca-491f-ae5b-d0842646a5cf","resolution":{"observed_at":"2026-08-09T19:13:03.811740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:13:03.797942Z","title":"Evaluating the effect of saliency detection and attention manipulation in human-robot interac- tion,","venue":null,"work_id":"785751d3-21af-4da1-8484-6c518e64bcfe","year":2013},"citing_paper":{"arxiv_id":"2502.00397","last_updated":"2025-02-01T11:05:28Z","snapshot_observed_at":"2026-08-09T19:07:14.387115Z","submitted_at":"2025-02-01T11:05:28Z","title":"Minimalistic Video Saliency Prediction via Efficient Decoder & Spatio Temporal Action Cues","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-09T19:13:03.358976Z"},"links":{"citing_paper":"/paper/2502.00397"},"observation_digest":"sha256:3f29b0787f57e4da6c8879cd0e9788a6ad892679d29dbdd199545f44bb3398c6","observation_id":"49e7d367-ff0e-4b54-b843-8fda5831d9a7","resolution":{"observed_at":"2026-08-09T19:13:03.800927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:13:03.789580Z","title":"Saliency heat-map as visual attention for autonomous driving using generative adversarial network (gan),","venue":null,"work_id":"c9ca6ba5-891a-413a-9131-f0ed0d9ab115","year":2021},"citing_paper":{"arxiv_id":"2502.00397","last_updated":"2025-02-01T11:05:28Z","snapshot_observed_at":"2026-08-09T19:07:14.387115Z","submitted_at":"2025-02-01T11:05:28Z","title":"Minimalistic Video Saliency Prediction via Efficient Decoder & Spatio Temporal Action Cues","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-09T19:13:03.362398Z"},"links":{"citing_paper":"/paper/2502.00397"},"observation_digest":"sha256:b294328a07ba48adfff82be71b0a31e27647d2775c39eb0d338436758505dfb4","observation_id":"71c974f7-5efd-4a6d-85ad-69b6863326c5","resolution":{"observed_at":"2026-08-09T19:13:03.792841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:13:03.780930Z","title":"A gated fusion network for dynamic saliency prediction,","venue":null,"work_id":"14455ea9-7474-41b1-9c5e-7d2a4fd4557b","year":2021},"citing_paper":{"arxiv_id":"2502.00397","last_updated":"2025-02-01T11:05:28Z","snapshot_observed_at":"2026-08-09T19:07:14.387115Z","submitted_at":"2025-02-01T11:05:28Z","title":"Minimalistic Video Saliency Prediction via Efficient Decoder & Spatio Temporal Action Cues","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-09T19:13:03.365227Z"},"links":{"citing_paper":"/paper/2502.00397"},"observation_digest":"sha256:929b568cf0df36b1b26e94178ed18418de35335f76820cb5e9dfc35b8eadc1c0","observation_id":"1177dafd-542c-4c6f-8253-2f650bdd1c93","resolution":{"observed_at":"2026-08-09T19:13:03.784138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:13:03.771584Z","title":"Video saliency prediction based on spatial- temporal two-stream network,","venue":null,"work_id":"80aef2cd-906b-426e-9a91-ff88dafd6b91","year":2019},"citing_paper":{"arxiv_id":"2502.00397","last_updated":"2025-02-01T11:05:28Z","snapshot_observed_at":"2026-08-09T19:07:14.387115Z","submitted_at":"2025-02-01T11:05:28Z","title":"Minimalistic Video Saliency Prediction via Efficient Decoder & Spatio Temporal Action Cues","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-09T19:13:03.368512Z"},"links":{"citing_paper":"/paper/2502.00397"},"observation_digest":"sha256:5354b7a12d7ff7d9954a95d3ba189f311dc3e4105ea1af5fd2a5eb619e621fe8","observation_id":"05b6f720-53b8-4248-8eb6-5b3fb12eaede","resolution":{"observed_at":"2026-08-09T19:13:03.775208Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:13:03.761828Z","title":"Unified image and video saliency modeling,","venue":null,"work_id":"4488b11b-df43-42f4-945d-7b26170fa00e","year":2020},"citing_paper":{"arxiv_id":"2502.00397","last_updated":"2025-02-01T11:05:28Z","snapshot_observed_at":"2026-08-09T19:07:14.387115Z","submitted_at":"2025-02-01T11:05:28Z","title":"Minimalistic Video Saliency Prediction via Efficient Decoder & Spatio Temporal Action Cues","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-09T19:13:03.371282Z"},"links":{"citing_paper":"/paper/2502.00397"},"observation_digest":"sha256:8497466287f5f29cd729debc03759a7c3a6d234341d133f6cb38147cba5bec3e","observation_id":"ffb2f9a9-ce96-4b5a-859a-a959d8ef6a78","resolution":{"observed_at":"2026-08-09T19:13:03.765839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:13:03.750973Z","title":"Revisiting video saliency prediction in the deep learning era,","venue":null,"work_id":"d0b72083-0079-4f1b-8cf7-1e21d117bed0","year":2019},"citing_paper":{"arxiv_id":"2502.00397","last_updated":"2025-02-01T11:05:28Z","snapshot_observed_at":"2026-08-09T19:07:14.387115Z","submitted_at":"2025-02-01T11:05:28Z","title":"Minimalistic Video Saliency Prediction via Efficient Decoder & Spatio Temporal Action Cues","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-09T19:13:03.374266Z"},"links":{"citing_paper":"/paper/2502.00397"},"observation_digest":"sha256:0207a0ad16ac111dc3e77e6120a1d2b26928e7e977ff82f0041785e06eeb90b1","observation_id":"9f1fac0d-049c-4212-a070-9d84695b0d97","resolution":{"observed_at":"2026-08-09T19:13:03.754282Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:13:03.741198Z","title":"Vinet: Pushing the limits of visual modality for audio-visual saliency prediction,","venue":null,"work_id":"0402315b-cf9d-4c7b-94ec-9be922c63fd2","year":2021},"citing_paper":{"arxiv_id":"2502.00397","last_updated":"2025-02-01T11:05:28Z","snapshot_observed_at":"2026-08-09T19:07:14.387115Z","submitted_at":"2025-02-01T11:05:28Z","title":"Minimalistic Video Saliency Prediction via Efficient Decoder & Spatio Temporal Action Cues","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-09T19:13:03.377452Z"},"links":{"citing_paper":"/paper/2502.00397"},"observation_digest":"sha256:2d660ff12b7ce8cc8f08303a352d14b6808d5fd556f4ec1f0e4343f4f947cbf8","observation_id":"a8c4f7a6-d2e7-4430-b913-58bfb2b37ddb","resolution":{"observed_at":"2026-08-09T19:13:03.744643Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:13:03.731636Z","title":"Tased-net: Temporally-aggregating spatial encoder-decoder network for video saliency detection,","venue":null,"work_id":"1afc60a0-42d7-45f3-9fd8-fd24aeb92ac1","year":2019},"citing_paper":{"arxiv_id":"2502.00397","last_updated":"2025-02-01T11:05:28Z","snapshot_observed_at":"2026-08-09T19:07:14.387115Z","submitted_at":"2025-02-01T11:05:28Z","title":"Minimalistic Video Saliency Prediction via Efficient Decoder & Spatio Temporal Action Cues","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-09T19:13:03.381064Z"},"links":{"citing_paper":"/paper/2502.00397"},"observation_digest":"sha256:29acacb125789830ab074a1840fcd4c6d3de5ffa4fc8b445641072aabdf6642e","observation_id":"a605d4ca-b65b-4870-8f45-5093569f68a6","resolution":{"observed_at":"2026-08-09T19:13:03.735251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:13:03.722133Z","title":"Rethinking spatiotem- poral feature learning: Speed-accuracy trade-offs in video classification,","venue":null,"work_id":"d716a8d7-3f3d-4e5c-ad66-48e84ea39a16","year":2018},"citing_paper":{"arxiv_id":"2502.00397","last_updated":"2025-02-01T11:05:28Z","snapshot_observed_at":"2026-08-09T19:07:14.387115Z","submitted_at":"2025-02-01T11:05:28Z","title":"Minimalistic Video Saliency Prediction via Efficient Decoder & Spatio Temporal Action Cues","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-09T19:13:03.383843Z"},"links":{"citing_paper":"/paper/2502.00397"},"observation_digest":"sha256:14a8fecb4ce8161f4478b56e8fd241eebe2fc2c4e5438c35025d04c6692604ff","observation_id":"bcb8e4b9-a45e-4e35-ad53-6b05290b8ef3","resolution":{"observed_at":"2026-08-09T19:13:03.725740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-08-08T17:46:50.107463Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-08-09T19:13:03.386650Z","title":"The kinetics human action video dataset,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.00397","last_updated":"2025-02-01T11:05:28Z","snapshot_observed_at":"2026-08-09T19:07:14.387115Z","submitted_at":"2025-02-01T11:05:28Z","title":"Minimalistic Video Saliency Prediction via Efficient Decoder & Spatio Temporal Action Cues","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-09T19:13:03.386650Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/2502.00397"},"observation_digest":"sha256:9aec8df8e19f67319ede4c22e3f398453b627b5a7c9d3e65377155e824fc3baf","observation_id":"419474bc-90d4-42ff-9124-9fdff43a794f","resolution":{"observed_at":"2026-08-09T19:13:03.386650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:13:03.390295Z","title":"U-net: Convolutional networks for biomedical image segmentation,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.00397","last_updated":"2025-02-01T11:05:28Z","snapshot_observed_at":"2026-08-09T19:07:14.387115Z","submitted_at":"2025-02-01T11:05:28Z","title":"Minimalistic Video Saliency Prediction via Efficient Decoder & Spatio Temporal Action Cues","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-09T19:13:03.390295Z"},"links":{"citing_paper":"/paper/2502.00397"},"observation_digest":"sha256:d83956476e3dcbaa0058720362ee87617af07fad24780754c16eca3ed39dd276","observation_id":"872b3164-3bfb-4a17-8472-3d7ef398fe1f","resolution":{"observed_at":"2026-08-09T19:13:03.390295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:13:03.707373Z","title":"Spatio-temporal self-attention network for video saliency prediction,","venue":null,"work_id":"7b81b0cd-141d-465b-a778-8718c86f329b","year":2021},"citing_paper":{"arxiv_id":"2502.00397","last_updated":"2025-02-01T11:05:28Z","snapshot_observed_at":"2026-08-09T19:07:14.387115Z","submitted_at":"2025-02-01T11:05:28Z","title":"Minimalistic Video Saliency Prediction via Efficient Decoder & Spatio Temporal Action Cues","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-09T19:13:03.393113Z"},"links":{"citing_paper":"/paper/2502.00397"},"observation_digest":"sha256:586285d8077e71e57b138518dbc57c25f7274c37847b9eb8b4705ad4a04b85fe","observation_id":"b76305d9-f5ee-4e99-8d03-eedbb9d4ce74","resolution":{"observed_at":"2026-08-09T19:13:03.710799Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:13:03.698469Z","title":"Transformer-based multi-scale feature integration network for video saliency prediction,","venue":null,"work_id":"b8304672-afbd-4fb9-b1a4-06683ffcc6a6","year":2023},"citing_paper":{"arxiv_id":"2502.00397","last_updated":"2025-02-01T11:05:28Z","snapshot_observed_at":"2026-08-09T19:07:14.387115Z","submitted_at":"2025-02-01T11:05:28Z","title":"Minimalistic Video Saliency Prediction via Efficient Decoder & Spatio Temporal Action Cues","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-09T19:13:03.395737Z"},"links":{"citing_paper":"/paper/2502.00397"},"observation_digest":"sha256:15b3786b2285af494af58b111456e43ef3659cda35eb0afeee9c3aab055f8b3e","observation_id":"51ff5cc8-b091-49f0-b5e6-b401ac11c645","resolution":{"observed_at":"2026-08-09T19:13:03.701581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:13:03.688430Z","title":"Transformer-based video saliency prediction with high temporal dimension decoding,","venue":null,"work_id":"f16bafd2-9e28-4e72-96f1-a1b98c4b7b1f","year":2024},"citing_paper":{"arxiv_id":"2502.00397","last_updated":"2025-02-01T11:05:28Z","snapshot_observed_at":"2026-08-09T19:07:14.387115Z","submitted_at":"2025-02-01T11:05:28Z","title":"Minimalistic Video Saliency Prediction via Efficient Decoder & Spatio Temporal Action Cues","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-09T19:13:03.398636Z"},"links":{"citing_paper":"/paper/2502.00397"},"observation_digest":"sha256:39f052379edd4fe6adb0fe2616abe033e0a83a6a0c3feac100f6ee22e020c70b","observation_id":"911fb5e8-7de5-4820-81b0-0fefad5798d4","resolution":{"observed_at":"2026-08-09T19:13:03.692733Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:13:03.679788Z","title":"Stavis: Spatio-temporal audio- visual saliency network,","venue":null,"work_id":"3fd7c6f7-9a5f-4954-b896-87cb64880989","year":2020},"citing_paper":{"arxiv_id":"2502.00397","last_updated":"2025-02-01T11:05:28Z","snapshot_observed_at":"2026-08-09T19:07:14.387115Z","submitted_at":"2025-02-01T11:05:28Z","title":"Minimalistic Video Saliency Prediction via Efficient Decoder & Spatio Temporal Action Cues","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-09T19:13:03.401401Z"},"links":{"citing_paper":"/paper/2502.00397"},"observation_digest":"sha256:5401b87056832a55f333ce535cc65b87d3439a083848da2dce8a85dd21fb1b55","observation_id":"afa4fb62-e2a1-44a5-a7dd-74963c6c938c","resolution":{"observed_at":"2026-08-09T19:13:03.682802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.04213","last_updated":"2021-09-14T00:40:20Z","snapshot_observed_at":"2026-08-07T11:49:50.970432Z","submitted_at":"2021-05-10T09:14:14Z","title":"Temporal-Spatial Feature Pyramid for Video Saliency Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.04213","snapshot_observed_at":"2026-08-09T19:13:03.404771Z","title":"Temporal-spatial feature pyramid for video saliency detection,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.00397","last_updated":"2025-02-01T11:05:28Z","snapshot_observed_at":"2026-08-09T19:07:14.387115Z","submitted_at":"2025-02-01T11:05:28Z","title":"Minimalistic Video Saliency Prediction via Efficient Decoder & Spatio Temporal Action Cues","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-09T19:13:03.404771Z"},"links":{"cited_paper":"/paper/2105.04213","citing_paper":"/paper/2502.00397"},"observation_digest":"sha256:04ca2f93901aa615e6cbaace8421eeee16e4c6949956f5c1a49490c6f985d0fb","observation_id":"1fb34a7e-f573-4d0a-b98e-6a4f6650a71b","resolution":{"observed_at":"2026-08-09T19:13:03.404771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:13:03.670378Z","title":"Joint learning of audio-visual saliency prediction and sound source localization on multi-face videos,","venue":null,"work_id":"94805c91-970f-4a59-acc4-e0e7fd01034d","year":2003},"citing_paper":{"arxiv_id":"2502.00397","last_updated":"2025-02-01T11:05:28Z","snapshot_observed_at":"2026-08-09T19:07:14.387115Z","submitted_at":"2025-02-01T11:05:28Z","title":"Minimalistic Video Saliency Prediction via Efficient Decoder & Spatio Temporal Action Cues","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-09T19:13:03.407912Z"},"links":{"citing_paper":"/paper/2502.00397"},"observation_digest":"sha256:9680de42d9273b881366b4239b5224c752524aeecb87889f9490d8bedb9e6882","observation_id":"70832a52-b68e-4438-a255-ab88e0ae3b44","resolution":{"observed_at":"2026-08-09T19:13:03.673464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:13:03.662202Z","title":"Learning to predict salient faces: A novel visual-audio saliency model,","venue":null,"work_id":"107d00bc-6ba7-4e41-858a-b3b18e768d1e","year":2020},"citing_paper":{"arxiv_id":"2502.00397","last_updated":"2025-02-01T11:05:28Z","snapshot_observed_at":"2026-08-09T19:07:14.387115Z","submitted_at":"2025-02-01T11:05:28Z","title":"Minimalistic Video Saliency Prediction via Efficient Decoder & Spatio Temporal Action Cues","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-09T19:13:03.410741Z"},"links":{"citing_paper":"/paper/2502.00397"},"observation_digest":"sha256:30128b2abd0376141ab9cb60b38275ec075d4874944e06afb188980840ea0a17","observation_id":"10e67ec7-b294-463b-9d07-8daf50c0031e","resolution":{"observed_at":"2026-08-09T19:13:03.665172Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:13:03.653987Z","title":"Casp-net: Rethinking video saliency prediction from an audio-visual consistency perceptual perspective,","venue":null,"work_id":"4796b361-b304-49e4-9b1a-13e6eabd3c65","year":2023},"citing_paper":{"arxiv_id":"2502.00397","last_updated":"2025-02-01T11:05:28Z","snapshot_observed_at":"2026-08-09T19:07:14.387115Z","submitted_at":"2025-02-01T11:05:28Z","title":"Minimalistic Video Saliency Prediction via Efficient Decoder & Spatio Temporal Action Cues","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-09T19:13:03.413446Z"},"links":{"citing_paper":"/paper/2502.00397"},"observation_digest":"sha256:0761c92e0445e2a61146341b2e16023f685a486c67ca9af3866c0a1fc69399c3","observation_id":"6b3a2fc4-d9c1-4727-87c3-37a87d911c38","resolution":{"observed_at":"2026-08-09T19:13:03.657150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:13:03.645018Z","title":"Diffsal: Joint audio and video learning for diffusion saliency prediction,","venue":null,"work_id":"4efd9bc2-76de-4cda-b4ad-dd87d54c27cd","year":2024},"citing_paper":{"arxiv_id":"2502.00397","last_updated":"2025-02-01T11:05:28Z","snapshot_observed_at":"2026-08-09T19:07:14.387115Z","submitted_at":"2025-02-01T11:05:28Z","title":"Minimalistic Video Saliency Prediction via Efficient Decoder & Spatio Temporal Action Cues","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-09T19:13:03.416329Z"},"links":{"citing_paper":"/paper/2502.00397"},"observation_digest":"sha256:9dbb405fd1a974d9eda602dc8ecb8a5f4e46011eb53d5171d23044d0a20c501e","observation_id":"b1889d04-22b4-49b3-a7e1-9227b9f3123d","resolution":{"observed_at":"2026-08-09T19:13:03.648146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:13:03.636594Z","title":"Deep roots: Improving cnn efficiency with hierarchical filter groups,","venue":null,"work_id":"3ad9b302-800b-4917-9d80-6044b415de2e","year":2017},"citing_paper":{"arxiv_id":"2502.00397","last_updated":"2025-02-01T11:05:28Z","snapshot_observed_at":"2026-08-09T19:07:14.387115Z","submitted_at":"2025-02-01T11:05:28Z","title":"Minimalistic Video Saliency Prediction via Efficient Decoder & Spatio Temporal Action Cues","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-09T19:13:03.419165Z"},"links":{"citing_paper":"/paper/2502.00397"},"observation_digest":"sha256:b83a1c17aa1bd6dde3c95bbb0132d3f2e6b1a906141a3c6c45f714eb21b32fd0","observation_id":"a4b3a613-a75d-409a-9d61-a63bc0025d99","resolution":{"observed_at":"2026-08-09T19:13:03.639371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:13:03.628324Z","title":"Shufflenet: An extremely efficient convolutional neural network for mobile devices,","venue":null,"work_id":"c1c9ae5a-3986-444e-a67c-db804b2fa4d0","year":2018},"citing_paper":{"arxiv_id":"2502.00397","last_updated":"2025-02-01T11:05:28Z","snapshot_observed_at":"2026-08-09T19:07:14.387115Z","submitted_at":"2025-02-01T11:05:28Z","title":"Minimalistic Video Saliency Prediction via Efficient Decoder & Spatio Temporal Action Cues","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-09T19:13:03.421867Z"},"links":{"citing_paper":"/paper/2502.00397"},"observation_digest":"sha256:8d7b1aacdfe32ec201346c5bfaaa9ed8173e4532ad9fe6890550e4f4764d82e5","observation_id":"38379fce-13a5-4d5c-bc89-878ef2f644fb","resolution":{"observed_at":"2026-08-09T19:13:03.631380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:13:03.620168Z","title":"Actor- context-actor relation network for spatio-temporal action localization,","venue":null,"work_id":"bdb2a19b-4963-41a2-84c5-419e99851c06","year":2021},"citing_paper":{"arxiv_id":"2502.00397","last_updated":"2025-02-01T11:05:28Z","snapshot_observed_at":"2026-08-09T19:07:14.387115Z","submitted_at":"2025-02-01T11:05:28Z","title":"Minimalistic Video Saliency Prediction via Efficient Decoder & Spatio Temporal Action Cues","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-09T19:13:03.424569Z"},"links":{"citing_paper":"/paper/2502.00397"},"observation_digest":"sha256:1754b1736d2729ff3f0f6cdccc7d5b69f60bcd6c1349ce491415aeef59274bd6","observation_id":"e9d9ee8c-c587-4518-b985-b5ab1e8436dd","resolution":{"observed_at":"2026-08-09T19:13:03.623245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:13:03.611020Z","title":"Slowfast networks for video recognition,","venue":null,"work_id":"d1e1688e-214e-4a0c-bfa9-4451aa9b593b","year":2019},"citing_paper":{"arxiv_id":"2502.00397","last_updated":"2025-02-01T11:05:28Z","snapshot_observed_at":"2026-08-09T19:07:14.387115Z","submitted_at":"2025-02-01T11:05:28Z","title":"Minimalistic Video Saliency Prediction via Efficient Decoder & Spatio Temporal Action Cues","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-09T19:13:03.427677Z"},"links":{"citing_paper":"/paper/2502.00397"},"observation_digest":"sha256:ddd5c572c10b80b1c4d411b652bc20d13ab4e1ee64efdc6df194310a6697188d","observation_id":"4e26c035-8412-4faa-9f0b-278113f4b862","resolution":{"observed_at":"2026-08-09T19:13:03.613895Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:13:03.602711Z","title":"Ava: A video dataset of spatio-temporally localized atomic visual actions,","venue":null,"work_id":"d48e2564-d1c5-405d-ac36-e2516815022b","year":2018},"citing_paper":{"arxiv_id":"2502.00397","last_updated":"2025-02-01T11:05:28Z","snapshot_observed_at":"2026-08-09T19:07:14.387115Z","submitted_at":"2025-02-01T11:05:28Z","title":"Minimalistic Video Saliency Prediction via Efficient Decoder & Spatio Temporal Action Cues","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-09T19:13:03.430271Z"},"links":{"citing_paper":"/paper/2502.00397"},"observation_digest":"sha256:3215a90d33e17f62740c7d252f07f812e628dccd8c8fbc32d8fad5950b9fc839","observation_id":"fd2f8970-3785-4b1f-80c7-85c8171a254e","resolution":{"observed_at":"2026-08-09T19:13:03.605955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:13:03.594420Z","title":"Actions in the eye: Dynamic gaze datasets and learnt saliency models for visual recognition,","venue":null,"work_id":"b76c425e-0ccd-4dce-9963-99375dcfdc92","year":2014},"citing_paper":{"arxiv_id":"2502.00397","last_updated":"2025-02-01T11:05:28Z","snapshot_observed_at":"2026-08-09T19:07:14.387115Z","submitted_at":"2025-02-01T11:05:28Z","title":"Minimalistic Video Saliency Prediction via Efficient Decoder & Spatio Temporal Action Cues","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-09T19:13:03.432862Z"},"links":{"citing_paper":"/paper/2502.00397"},"observation_digest":"sha256:e5accad0dc991dd400d714fd1b1c7cc8e6ee4bfea9bd715cfe3108e34be60e85","observation_id":"8cb2d9bb-038a-4f02-b8f1-5b6f8f2af615","resolution":{"observed_at":"2026-08-09T19:13:03.597676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:13:03.585959Z","title":"Fixation prediction through multimodal analysis,","venue":null,"work_id":"4fa45fe0-c840-4fdc-9443-85f820a1131e","year":2016},"citing_paper":{"arxiv_id":"2502.00397","last_updated":"2025-02-01T11:05:28Z","snapshot_observed_at":"2026-08-09T19:07:14.387115Z","submitted_at":"2025-02-01T11:05:28Z","title":"Minimalistic Video Saliency Prediction via Efficient Decoder & Spatio Temporal Action Cues","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-09T19:13:03.435844Z"},"links":{"citing_paper":"/paper/2502.00397"},"observation_digest":"sha256:5ac8281d8f91b754a2c2c0e29ca3e16be112eb6f4c8a91f0e24349e617fe12e6","observation_id":"52e2a6d1-abd0-4b70-8af4-0adb6a543475","resolution":{"observed_at":"2026-08-09T19:13:03.589435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:13:03.575782Z","title":"How saliency, faces, and sound influence gaze in dynamic social scenes,","venue":null,"work_id":"ce3415e7-e3c6-478f-8e5a-4216d71de1fb","year":2014},"citing_paper":{"arxiv_id":"2502.00397","last_updated":"2025-02-01T11:05:28Z","snapshot_observed_at":"2026-08-09T19:07:14.387115Z","submitted_at":"2025-02-01T11:05:28Z","title":"Minimalistic Video Saliency Prediction via Efficient Decoder & Spatio Temporal Action Cues","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-09T19:13:03.439170Z"},"links":{"citing_paper":"/paper/2502.00397"},"observation_digest":"sha256:8af1f224cb2306e77c51ed7d9405ccf4834f9686718971b6412033379e4e4265","observation_id":"629d8538-fa1b-4492-acef-c46d43f675eb","resolution":{"observed_at":"2026-08-09T19:13:03.579363Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:13:03.566268Z","title":"Toward the introduction of auditory information in dynamic visual attention models,","venue":null,"work_id":"a222c276-83c9-4083-a209-c1aac49becb2","year":2013},"citing_paper":{"arxiv_id":"2502.00397","last_updated":"2025-02-01T11:05:28Z","snapshot_observed_at":"2026-08-09T19:07:14.387115Z","submitted_at":"2025-02-01T11:05:28Z","title":"Minimalistic Video Saliency Prediction via Efficient Decoder & Spatio Temporal Action Cues","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-09T19:13:03.441720Z"},"links":{"citing_paper":"/paper/2502.00397"},"observation_digest":"sha256:6a1e0f210b95d2c750959f76320c89ca067dab158ecaf02e24f6338f85c79a64","observation_id":"0c4e7ff8-ff2c-4f33-9122-41949582ce8c","resolution":{"observed_at":"2026-08-09T19:13:03.569696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:13:03.556458Z","title":"An efficient audiovisual saliency model to predict eye positions when looking at conversations,","venue":null,"work_id":"0ec00cb6-db82-4985-932b-7de198d0f645","year":2015},"citing_paper":{"arxiv_id":"2502.00397","last_updated":"2025-02-01T11:05:28Z","snapshot_observed_at":"2026-08-09T19:07:14.387115Z","submitted_at":"2025-02-01T11:05:28Z","title":"Minimalistic Video Saliency Prediction via Efficient Decoder & Spatio Temporal Action Cues","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-09T19:13:03.444399Z"},"links":{"citing_paper":"/paper/2502.00397"},"observation_digest":"sha256:def6f9eefd213ca11e31edd60aef775cf83cb7083dc62fe5b1c4022897b372ee","observation_id":"3776c107-34d1-456c-9e00-fb98a76caced","resolution":{"observed_at":"2026-08-09T19:13:03.559930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:13:03.546158Z","title":"Clustering of gaze during dynamic scene viewing is predicted by motion,","venue":null,"work_id":"417a4608-4b5f-4d73-80c7-2a5b90a36527","year":2011},"citing_paper":{"arxiv_id":"2502.00397","last_updated":"2025-02-01T11:05:28Z","snapshot_observed_at":"2026-08-09T19:07:14.387115Z","submitted_at":"2025-02-01T11:05:28Z","title":"Minimalistic Video Saliency Prediction via Efficient Decoder & Spatio Temporal Action Cues","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-09T19:13:03.447075Z"},"links":{"citing_paper":"/paper/2502.00397"},"observation_digest":"sha256:034adfa9fe6108c19b2f2e678322353a41a2a15ab2f3455c1f87f4462c131f60","observation_id":"f3f96374-e6b4-4a69-b076-9742178c10c0","resolution":{"observed_at":"2026-08-09T19:13:03.549618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:13:03.536732Z","title":"Predicting eyes’ fixa- tions in movie videos: Visual saliency experiments on a new eye- tracking database,","venue":null,"work_id":"5d9c3180-82a9-468c-af05-f2f98cbc7a94","year":2014},"citing_paper":{"arxiv_id":"2502.00397","last_updated":"2025-02-01T11:05:28Z","snapshot_observed_at":"2026-08-09T19:07:14.387115Z","submitted_at":"2025-02-01T11:05:28Z","title":"Minimalistic Video Saliency Prediction via Efficient Decoder & Spatio Temporal Action Cues","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-09T19:13:03.450023Z"},"links":{"citing_paper":"/paper/2502.00397"},"observation_digest":"sha256:23278d8d7952401626687e2cdcb5c37addfaf37b60b68e07ace432f8b331be37","observation_id":"3fe200b4-4cd8-4d74-8c52-66005e90d132","resolution":{"observed_at":"2026-08-09T19:13:03.539925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:13:03.527249Z","title":"Tinyhd: Efficient video saliency prediction with heterogeneous decoders using hierarchical maps distillation,","venue":null,"work_id":"1925225f-1063-417c-94d1-339a4a62d2fa","year":2023},"citing_paper":{"arxiv_id":"2502.00397","last_updated":"2025-02-01T11:05:28Z","snapshot_observed_at":"2026-08-09T19:07:14.387115Z","submitted_at":"2025-02-01T11:05:28Z","title":"Minimalistic Video Saliency Prediction via Efficient Decoder & Spatio Temporal Action Cues","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-09T19:13:03.452673Z"},"links":{"citing_paper":"/paper/2502.00397"},"observation_digest":"sha256:7423fbbe890aaa737aaadf35e5c4d2abecbdffd2b8117e54994fcaddaf111c6d","observation_id":"4a8c7cbd-e557-4448-8782-5197ce51d1fd","resolution":{"observed_at":"2026-08-09T19:13:03.530709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:13:03.518074Z","title":"Video saliency forecasting transformer,","venue":null,"work_id":"04d50a53-8c96-465f-9f3c-4064b45453e9","year":2022},"citing_paper":{"arxiv_id":"2502.00397","last_updated":"2025-02-01T11:05:28Z","snapshot_observed_at":"2026-08-09T19:07:14.387115Z","submitted_at":"2025-02-01T11:05:28Z","title":"Minimalistic Video Saliency Prediction via Efficient Decoder & Spatio Temporal Action Cues","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-09T19:13:03.455473Z"},"links":{"citing_paper":"/paper/2502.00397"},"observation_digest":"sha256:d1104faaf570dd197246319cb52ce6d571d521377c00a494971e8e194d73f265","observation_id":"c0e331bd-fbe9-4858-a4ff-4d6849cba445","resolution":{"observed_at":"2026-08-09T19:13:03.520968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:13:03.508955Z","title":"What do different evaluation metrics tell us about saliency models?","venue":null,"work_id":"496c91cb-6ee4-49bc-b240-371c20ff0d1f","year":2019},"citing_paper":{"arxiv_id":"2502.00397","last_updated":"2025-02-01T11:05:28Z","snapshot_observed_at":"2026-08-09T19:07:14.387115Z","submitted_at":"2025-02-01T11:05:28Z","title":"Minimalistic Video Saliency Prediction via Efficient Decoder & Spatio Temporal Action Cues","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-09T19:13:03.458030Z"},"links":{"citing_paper":"/paper/2502.00397"},"observation_digest":"sha256:a60c5320220ef05bda80b3b63661eeb05c582f30d9a41aaa36a4bd0feddb970a","observation_id":"6a52a3c4-8d4b-4839-b001-4c5fd5744ede","resolution":{"observed_at":"2026-08-09T19:13:03.512313Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:13:03.496932Z","title":"Does audio help in deep audio-visual saliency prediction models?","venue":null,"work_id":"f95d8fc8-2816-4659-8d4c-b7407ab84657","year":2022},"citing_paper":{"arxiv_id":"2502.00397","last_updated":"2025-02-01T11:05:28Z","snapshot_observed_at":"2026-08-09T19:07:14.387115Z","submitted_at":"2025-02-01T11:05:28Z","title":"Minimalistic Video Saliency Prediction via Efficient Decoder & Spatio Temporal Action Cues","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-09T19:13:03.461605Z"},"links":{"citing_paper":"/paper/2502.00397"},"observation_digest":"sha256:2d56da972208785f1144f8a917fcc5c967af257b4a2a66027766a325956cb558","observation_id":"0dd95823-6a1f-4c1c-925a-c30a2d44240b","resolution":{"observed_at":"2026-08-09T19:13:03.501771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.00397","last_updated":"2025-02-01T11:05:28Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T19:07:14.387115Z","submitted_at":"2025-02-01T11:05:28Z","title":"Minimalistic Video Saliency Prediction via Efficient Decoder & Spatio Temporal Action Cues"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":3,"verified_exact":0,"verified_fuzzy":38},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 0 inbound Pith citation observations for arXiv:2502.00397."}