{"as_of":"2026-08-07T23:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a7fcb6bb9cc519c471cc31e26c2a55cb46f6320596be03e5e59cd89ff489a628","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:10:40.870961Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.03531/citation-record","integrity":"/paper/2507.03531/integrity","json":"/paper/2507.03531/citation-record.json","paper":"/paper/2507.03531"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:10:41.270448Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"35405a7d-f310-427f-a248-7a9163a794d1","year":2021},"citing_paper":{"arxiv_id":"2507.03531","last_updated":"2025-07-04T12:35:52Z","snapshot_observed_at":"2026-08-06T20:05:16.276070Z","submitted_at":"2025-07-04T12:35:52Z","title":"Multimodal Alignment with Cross-Attentive GRUs for Fine-Grained Video Understanding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T20:10:40.500401Z"},"links":{"citing_paper":"/paper/2507.03531"},"observation_digest":"sha256:8c440ba3a47a2a938531313f30273926b871e99f1cbc50dd20ce5e3bc7c9f9b5","observation_id":"3f64a285-5486-4481-a848-41d37450c95b","resolution":{"observed_at":"2026-08-06T20:10:41.273653Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:10:41.260917Z","title":"Cowen, Stefanos Zafeiriou, Irene Kotsia, Eric Granger, Marco Pedersoli, Simon L","venue":null,"work_id":"364b3477-518c-4d38-af90-1fd22e3771b8","year":2025},"citing_paper":{"arxiv_id":"2507.03531","last_updated":"2025-07-04T12:35:52Z","snapshot_observed_at":"2026-08-06T20:05:16.276070Z","submitted_at":"2025-07-04T12:35:52Z","title":"Multimodal Alignment with Cross-Attentive GRUs for Fine-Grained Video Understanding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T20:10:40.607543Z"},"links":{"citing_paper":"/paper/2507.03531"},"observation_digest":"sha256:28ec6a81ec3aaf91bc00b2e5860810d8cbd58bdc0d5b8561df3d21838fe2e1ef","observation_id":"08f5321e-940a-492b-930e-a8d2926d4753","resolution":{"observed_at":"2026-08-06T20:10:41.264057Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:10:41.251002Z","title":"Advancements in affective and behavior analysis: The 8th abaw workshop and competition","venue":null,"work_id":"f272c139-d39f-4b12-aaa1-72dd3790ad63","year":null},"citing_paper":{"arxiv_id":"2507.03531","last_updated":"2025-07-04T12:35:52Z","snapshot_observed_at":"2026-08-06T20:05:16.276070Z","submitted_at":"2025-07-04T12:35:52Z","title":"Multimodal Alignment with Cross-Attentive GRUs for Fine-Grained Video Understanding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T20:10:40.645816Z"},"links":{"citing_paper":"/paper/2507.03531"},"observation_digest":"sha256:a106411e149899bbb27fd2c3462f2e624c49c9f51bb6aaefa17f425da2e020d6","observation_id":"a08ef3e8-8b7d-4929-bdad-2564cdb6b6d9","resolution":{"observed_at":"2026-08-06T20:10:41.254562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03835","last_updated":"2024-07-08T10:40:53Z","snapshot_observed_at":"2026-07-06T18:41:27.621784Z","submitted_at":"2024-07-04T11:04:29Z","title":"7th ABAW Competition: Multi-Task Learning and Compound Expression Recognition","version":2},"cited_work":{"arxiv_id":"2407.03835","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.03835","snapshot_observed_at":"2026-08-06T20:10:41.055220Z","title":"7th ABAW Competition: Multi-Task Learning and Compound Expression Recognition","venue":"cs.CV","work_id":"23199e7b-ebc1-45b5-93f8-82176bc5038a","year":2024},"citing_paper":{"arxiv_id":"2507.03531","last_updated":"2025-07-04T12:35:52Z","snapshot_observed_at":"2026-08-06T20:05:16.276070Z","submitted_at":"2025-07-04T12:35:52Z","title":"Multimodal Alignment with Cross-Attentive GRUs for Fine-Grained Video Understanding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T20:10:40.759840Z"},"links":{"cited_paper":"/paper/2407.03835","citing_paper":"/paper/2507.03531"},"observation_digest":"sha256:5af5a340b3139f79dda0a79e3eb46f3d19456ee70109cd4bc73845e00a6d36f9","observation_id":"f1e90cbc-c112-4c54-b824-e6368022d9fd","resolution":{"observed_at":"2026-08-06T20:10:41.059074Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:10:41.241439Z","title":"The 6th affective behavior analysis in-the-wild (abaw) competition","venue":null,"work_id":"3e96e072-b4dd-4eaa-8332-1685c2182b8b","year":2024},"citing_paper":{"arxiv_id":"2507.03531","last_updated":"2025-07-04T12:35:52Z","snapshot_observed_at":"2026-08-06T20:05:16.276070Z","submitted_at":"2025-07-04T12:35:52Z","title":"Multimodal Alignment with Cross-Attentive GRUs for Fine-Grained Video Understanding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T20:10:40.781120Z"},"links":{"citing_paper":"/paper/2507.03531"},"observation_digest":"sha256:b801e2ca269fed46c27ebcc4ecacf258f19e3980cf9e8fa269235ce353ab60fd","observation_id":"35fda226-7fbe-475b-bd42-1b768c83a350","resolution":{"observed_at":"2026-08-06T20:10:41.244620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:10:41.232494Z","title":"Distribution matching for multi-task learning of classification tasks: A large-scale study on faces & beyond","venue":null,"work_id":"32d9cdd7-482c-494d-83b3-00b4a77df627","year":2024},"citing_paper":{"arxiv_id":"2507.03531","last_updated":"2025-07-04T12:35:52Z","snapshot_observed_at":"2026-08-06T20:05:16.276070Z","submitted_at":"2025-07-04T12:35:52Z","title":"Multimodal Alignment with Cross-Attentive GRUs for Fine-Grained Video Understanding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T20:10:40.784942Z"},"links":{"citing_paper":"/paper/2507.03531"},"observation_digest":"sha256:d50c56f4777c8fc0ff8ba997c955bc51d6912b1cd0cba1d90af5614888aacf44","observation_id":"7445a316-cce0-437c-9b9a-b346f8832216","resolution":{"observed_at":"2026-08-06T20:10:41.235719Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:10:41.223007Z","title":"Abaw: Valence-arousal estimation, expression recognition, action unit detection & emotional reaction intensity estimation challenges","venue":null,"work_id":"604f7569-8cd9-42ef-bbbf-db710e261363","year":2023},"citing_paper":{"arxiv_id":"2507.03531","last_updated":"2025-07-04T12:35:52Z","snapshot_observed_at":"2026-08-06T20:05:16.276070Z","submitted_at":"2025-07-04T12:35:52Z","title":"Multimodal Alignment with Cross-Attentive GRUs for Fine-Grained Video Understanding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T20:10:40.788478Z"},"links":{"citing_paper":"/paper/2507.03531"},"observation_digest":"sha256:7cd4d58cb7768e01a35618b9090f5db7d66c82d555567a97140c03eb71985ed2","observation_id":"f58196a3-b9e7-48ef-aabb-b4550e736c0a","resolution":{"observed_at":"2026-08-06T20:10:41.226399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:10:41.212660Z","title":"Multi-label compound expression recognition: C-expr database & network","venue":null,"work_id":"e25893e5-b398-45d8-8fa5-36ef3615ee3a","year":2023},"citing_paper":{"arxiv_id":"2507.03531","last_updated":"2025-07-04T12:35:52Z","snapshot_observed_at":"2026-08-06T20:05:16.276070Z","submitted_at":"2025-07-04T12:35:52Z","title":"Multimodal Alignment with Cross-Attentive GRUs for Fine-Grained Video Understanding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T20:10:40.791965Z"},"links":{"citing_paper":"/paper/2507.03531"},"observation_digest":"sha256:d60386224601c69d2f6bea8fc94d29e68688abc1055c40170802c5ca8f27c59d","observation_id":"03e8bd93-488b-4c2c-aa4e-c3e8d09a1303","resolution":{"observed_at":"2026-08-06T20:10:41.215669Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:10:41.203497Z","title":"Abaw: Valence-arousal estimation, expression recognition, action unit detection & emotional reaction intensity estimation challenges","venue":null,"work_id":"9f3d4027-fda6-4083-b244-27c080cb2ec7","year":2023},"citing_paper":{"arxiv_id":"2507.03531","last_updated":"2025-07-04T12:35:52Z","snapshot_observed_at":"2026-08-06T20:05:16.276070Z","submitted_at":"2025-07-04T12:35:52Z","title":"Multimodal Alignment with Cross-Attentive GRUs for Fine-Grained Video Understanding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T20:10:40.795345Z"},"links":{"citing_paper":"/paper/2507.03531"},"observation_digest":"sha256:48b3db3804711f1e65fb9dbd514f8412dd351b6d1b1d7709013670cc94e6e998","observation_id":"072d26f9-c235-417b-97cc-5b06ba8674f6","resolution":{"observed_at":"2026-08-06T20:10:41.206809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:10:41.193251Z","title":"Abaw: Valence-arousal estimation, expression recognition, action unit detection & multi-task learning challenges","venue":null,"work_id":"a4c3a027-a044-4e70-9ee0-653f06596f38","year":2022},"citing_paper":{"arxiv_id":"2507.03531","last_updated":"2025-07-04T12:35:52Z","snapshot_observed_at":"2026-08-06T20:05:16.276070Z","submitted_at":"2025-07-04T12:35:52Z","title":"Multimodal Alignment with Cross-Attentive GRUs for Fine-Grained Video Understanding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T20:10:40.799224Z"},"links":{"citing_paper":"/paper/2507.03531"},"observation_digest":"sha256:93661db7b103f6d38238c9d6469f67c25725df74a4a48bdd9c275c5da8a29e6e","observation_id":"f63ccf43-2d0e-4eeb-829b-c0f7dcb30879","resolution":{"observed_at":"2026-08-06T20:10:41.197017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:10:41.184041Z","title":"Analysing affective behavior in the second abaw2 competition","venue":null,"work_id":"f909cd9c-437b-4ee4-b98a-fac57cdabc3c","year":2021},"citing_paper":{"arxiv_id":"2507.03531","last_updated":"2025-07-04T12:35:52Z","snapshot_observed_at":"2026-08-06T20:05:16.276070Z","submitted_at":"2025-07-04T12:35:52Z","title":"Multimodal Alignment with Cross-Attentive GRUs for Fine-Grained Video Understanding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T20:10:40.803144Z"},"links":{"citing_paper":"/paper/2507.03531"},"observation_digest":"sha256:7505bdaa59357fcc9dd467063f0e3e26d65d156a7126fbab9a371a8c2f25df39","observation_id":"a085e703-44d0-4474-9ae1-31069f6f3644","resolution":{"observed_at":"2026-08-06T20:10:41.187225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:10:41.174032Z","title":"Analysing affective behavior in the first abaw 2020 competition","venue":null,"work_id":"74b57ba3-d57c-4127-b5cb-a60721fa03a5","year":2020},"citing_paper":{"arxiv_id":"2507.03531","last_updated":"2025-07-04T12:35:52Z","snapshot_observed_at":"2026-08-06T20:05:16.276070Z","submitted_at":"2025-07-04T12:35:52Z","title":"Multimodal Alignment with Cross-Attentive GRUs for Fine-Grained Video Understanding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T20:10:40.806712Z"},"links":{"citing_paper":"/paper/2507.03531"},"observation_digest":"sha256:44a09b81ade49cfee214c724d3427afa3db8ad178255ef824d0718da9b4f9a57","observation_id":"87117d46-f234-483e-a142-2a2469971925","resolution":{"observed_at":"2026-08-06T20:10:41.177571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.03790","last_updated":"2021-05-08T22:26:52Z","snapshot_observed_at":"2026-07-06T11:07:34.876977Z","submitted_at":"2021-05-08T22:26:52Z","title":"Distribution Matching for Heterogeneous Multi-Task Learning: a Large-scale Face Study","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.03790","snapshot_observed_at":"2026-08-06T20:10:40.810429Z","title":"Distribution matching for heterogeneous multi-task learning: A large-scale face study","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.03531","last_updated":"2025-07-04T12:35:52Z","snapshot_observed_at":"2026-08-06T20:05:16.276070Z","submitted_at":"2025-07-04T12:35:52Z","title":"Multimodal Alignment with Cross-Attentive GRUs for Fine-Grained Video Understanding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T20:10:40.810429Z"},"links":{"cited_paper":"/paper/2105.03790","citing_paper":"/paper/2507.03531"},"observation_digest":"sha256:895dd297199eba063aad7b5d7027648fe9ed3f5851bf84c4fdd30ae0e0bd2a40","observation_id":"1689b15b-0d71-49b2-a3cb-f3e06dc87cfa","resolution":{"observed_at":"2026-08-06T20:10:40.810429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.15792","last_updated":"2021-03-29T17:36:20Z","snapshot_observed_at":"2026-07-06T10:54:32.865841Z","submitted_at":"2021-03-29T17:36:20Z","title":"Affect Analysis in-the-wild: Valence-Arousal, Expressions, Action Units and a Unified Framework","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.15792","snapshot_observed_at":"2026-08-06T20:10:40.814343Z","title":"Affect analysis in-the-wild: Valence-arousal, expressions, action units and a unified framework","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.03531","last_updated":"2025-07-04T12:35:52Z","snapshot_observed_at":"2026-08-06T20:05:16.276070Z","submitted_at":"2025-07-04T12:35:52Z","title":"Multimodal Alignment with Cross-Attentive GRUs for Fine-Grained Video Understanding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T20:10:40.814343Z"},"links":{"cited_paper":"/paper/2103.15792","citing_paper":"/paper/2507.03531"},"observation_digest":"sha256:06a976f478b6be5c51ce39042200c16777055da9e64111fd26713c69c8ccec43","observation_id":"4b24b0fc-aa14-4630-9a09-26b0a906c5be","resolution":{"observed_at":"2026-08-06T20:10:40.814343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.04855","last_updated":"2019-09-25T22:45:18Z","snapshot_observed_at":"2026-07-06T08:28:35.109400Z","submitted_at":"2019-09-25T22:45:18Z","title":"Expression, Affect, Action Unit Recognition: Aff-Wild2, Multi-Task Learning and ArcFace","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.04855","snapshot_observed_at":"2026-08-06T20:10:40.817947Z","title":"Expression, affect, action unit recognition: Aff-wild2, multi-task learning and arcface","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2507.03531","last_updated":"2025-07-04T12:35:52Z","snapshot_observed_at":"2026-08-06T20:05:16.276070Z","submitted_at":"2025-07-04T12:35:52Z","title":"Multimodal Alignment with Cross-Attentive GRUs for Fine-Grained Video Understanding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T20:10:40.817947Z"},"links":{"cited_paper":"/paper/1910.04855","citing_paper":"/paper/2507.03531"},"observation_digest":"sha256:606bcd01ae8e4fce3af06cb2adfd9da994b0f99cacef393b45a65019f64d6a5b","observation_id":"e6a9dfae-7c77-4cc3-9499-58c56f06e7a9","resolution":{"observed_at":"2026-08-06T20:10:40.817947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.11111","last_updated":"2020-05-29T02:35:49Z","snapshot_observed_at":"2026-07-06T08:31:56.527124Z","submitted_at":"2019-10-15T15:45:41Z","title":"Face Behavior a la carte: Expressions, Affect and Action Units in a Single Network","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.11111","snapshot_observed_at":"2026-08-06T20:10:40.821888Z","title":"Face behavior a la carte: Expressions, affect and action units in a single network","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2507.03531","last_updated":"2025-07-04T12:35:52Z","snapshot_observed_at":"2026-08-06T20:05:16.276070Z","submitted_at":"2025-07-04T12:35:52Z","title":"Multimodal Alignment with Cross-Attentive GRUs for Fine-Grained Video Understanding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T20:10:40.821888Z"},"links":{"cited_paper":"/paper/1910.11111","citing_paper":"/paper/2507.03531"},"observation_digest":"sha256:ce832bb301801346b0e56832391c65d9213c502790c475af7d082200a6bbb83a","observation_id":"0045ef01-93c9-4bd8-9c95-7beb30d01b9c","resolution":{"observed_at":"2026-08-06T20:10:40.821888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:10:41.163834Z","title":"Deep affect prediction in-the-wild: Aff-wild database and challenge, deep architectures, and beyond","venue":null,"work_id":"4fd40b8a-99da-4e35-bf9d-c2e871dddc7d","year":2019},"citing_paper":{"arxiv_id":"2507.03531","last_updated":"2025-07-04T12:35:52Z","snapshot_observed_at":"2026-08-06T20:05:16.276070Z","submitted_at":"2025-07-04T12:35:52Z","title":"Multimodal Alignment with Cross-Attentive GRUs for Fine-Grained Video Understanding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T20:10:40.825643Z"},"links":{"citing_paper":"/paper/2507.03531"},"observation_digest":"sha256:ed11a2975af1e9e761cf80001b3919e5ba9dd8cafd59c4698c529ac9f8e49346","observation_id":"1d5046d1-8763-454e-828a-e274d0327289","resolution":{"observed_at":"2026-08-06T20:10:41.167438Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"publication/3923978","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:10:41.000317Z","title":"Dvd: A comprehensive dataset for advancing violence detection in real-world scenarios","venue":null,"work_id":"20a43b20-110f-472b-8584-f5ccd9484878","year":2025},"citing_paper":{"arxiv_id":"2507.03531","last_updated":"2025-07-04T12:35:52Z","snapshot_observed_at":"2026-08-06T20:05:16.276070Z","submitted_at":"2025-07-04T12:35:52Z","title":"Multimodal Alignment with Cross-Attentive GRUs for Fine-Grained Video Understanding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T20:10:40.828773Z"},"links":{"citing_paper":"/paper/2507.03531"},"observation_digest":"sha256:b16177eea47f72aac5554cd832f5fd751e9ca2550489b09fffd298075501661d","observation_id":"2df671bc-8334-47fb-89ab-627009e25e1e","resolution":{"observed_at":"2026-08-06T20:10:41.005456Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:10:41.154406Z","title":"Deep residual learning for image recognition","venue":null,"work_id":"dca3bcd3-211c-4f64-84e7-f3d84e0a2517","year":2016},"citing_paper":{"arxiv_id":"2507.03531","last_updated":"2025-07-04T12:35:52Z","snapshot_observed_at":"2026-08-06T20:05:16.276070Z","submitted_at":"2025-07-04T12:35:52Z","title":"Multimodal Alignment with Cross-Attentive GRUs for Fine-Grained Video Understanding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T20:10:40.831875Z"},"links":{"citing_paper":"/paper/2507.03531"},"observation_digest":"sha256:fb488062dad8e11626d627b4570ae173cf378c67cc6afa9dd6905987343109f5","observation_id":"736a5e90-dd88-4472-88b7-674ad358d992","resolution":{"observed_at":"2026-08-06T20:10:41.157434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:10:41.144786Z","title":"Efficientnetv2: Smaller models and faster training","venue":null,"work_id":"54d5b795-6cec-4af7-bb01-4a273c9ab98e","year":2021},"citing_paper":{"arxiv_id":"2507.03531","last_updated":"2025-07-04T12:35:52Z","snapshot_observed_at":"2026-08-06T20:05:16.276070Z","submitted_at":"2025-07-04T12:35:52Z","title":"Multimodal Alignment with Cross-Attentive GRUs for Fine-Grained Video Understanding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T20:10:40.835222Z"},"links":{"citing_paper":"/paper/2507.03531"},"observation_digest":"sha256:2d0da919ef08e7ba6b775c76c53604cabb1778e9c818b26ff646c556d5d297a8","observation_id":"7691a0c4-a1e8-4862-9972-962336ec3e0e","resolution":{"observed_at":"2026-08-06T20:10:41.148032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:10:41.133815Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":"30529ec9-ae24-4d76-bd93-c2603ff6ce8b","year":2022},"citing_paper":{"arxiv_id":"2507.03531","last_updated":"2025-07-04T12:35:52Z","snapshot_observed_at":"2026-08-06T20:05:16.276070Z","submitted_at":"2025-07-04T12:35:52Z","title":"Multimodal Alignment with Cross-Attentive GRUs for Fine-Grained Video Understanding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T20:10:40.838238Z"},"links":{"citing_paper":"/paper/2507.03531"},"observation_digest":"sha256:88a774ac60bacb2c5430c7a8f39540d30f2b420d57311463e1818a866eaccef0","observation_id":"9fd62586-fcd0-458d-a8b2-606daee5c610","resolution":{"observed_at":"2026-08-06T20:10:41.137646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:10:41.123270Z","title":"Cnn architectures for large-scale audio classification","venue":null,"work_id":"560af477-e52b-462e-b138-2b6b0c84220e","year":2017},"citing_paper":{"arxiv_id":"2507.03531","last_updated":"2025-07-04T12:35:52Z","snapshot_observed_at":"2026-08-06T20:05:16.276070Z","submitted_at":"2025-07-04T12:35:52Z","title":"Multimodal Alignment with Cross-Attentive GRUs for Fine-Grained Video Understanding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T20:10:40.841654Z"},"links":{"citing_paper":"/paper/2507.03531"},"observation_digest":"sha256:1e9a0243dd562b6115f5a5ce65c3ddfdef75fc7d709b6034dda720797fe0cc7d","observation_id":"c0f5d483-74e6-4ac4-8d94-069b27293e7c","resolution":{"observed_at":"2026-08-06T20:10:41.127063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:10:41.113293Z","title":"wav2vec 2.0: A framework for self- supervised learning of speech representations","venue":null,"work_id":"0a518769-5d4e-436a-aff6-8fd01e68cbca","year":2020},"citing_paper":{"arxiv_id":"2507.03531","last_updated":"2025-07-04T12:35:52Z","snapshot_observed_at":"2026-08-06T20:05:16.276070Z","submitted_at":"2025-07-04T12:35:52Z","title":"Multimodal Alignment with Cross-Attentive GRUs for Fine-Grained Video Understanding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T20:10:40.844737Z"},"links":{"citing_paper":"/paper/2507.03531"},"observation_digest":"sha256:d74e359dbf6661b07c403c03162ef55d2d7bdc1fad604a611c25ec83db5978b2","observation_id":"635b295a-8207-4728-a989-d738270442ec","resolution":{"observed_at":"2026-08-06T20:10:41.116831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:10:41.103194Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":"adcf0935-50df-4779-9eac-9d7492a9b8f1","year":2019},"citing_paper":{"arxiv_id":"2507.03531","last_updated":"2025-07-04T12:35:52Z","snapshot_observed_at":"2026-08-06T20:05:16.276070Z","submitted_at":"2025-07-04T12:35:52Z","title":"Multimodal Alignment with Cross-Attentive GRUs for Fine-Grained Video Understanding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T20:10:40.847598Z"},"links":{"citing_paper":"/paper/2507.03531"},"observation_digest":"sha256:f796c4d7d706ca872efaffc92a11737df8f820737038356d650f24fcfa540b43","observation_id":"bbd5d9cb-16bf-45c9-aef4-bd7838eb0c62","resolution":{"observed_at":"2026-08-06T20:10:41.106839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:10:41.092871Z","title":"Attention is all you need","venue":null,"work_id":"9f16dc13-492d-4e85-99a5-d353d020a487","year":2017},"citing_paper":{"arxiv_id":"2507.03531","last_updated":"2025-07-04T12:35:52Z","snapshot_observed_at":"2026-08-06T20:05:16.276070Z","submitted_at":"2025-07-04T12:35:52Z","title":"Multimodal Alignment with Cross-Attentive GRUs for Fine-Grained Video Understanding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T20:10:40.850744Z"},"links":{"citing_paper":"/paper/2507.03531"},"observation_digest":"sha256:815b8f84ff655247ab8cb113427da7e379a419127d66446922b40b16f16fe105","observation_id":"f6bb8e1d-d169-4914-941a-52d1d0f315db","resolution":{"observed_at":"2026-08-06T20:10:41.096282Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:10:41.081866Z","title":"Learning phrase representations using rnn encoder-decoder for statistical machine translation","venue":null,"work_id":"98e4ca29-6cf4-4d5a-9566-d19f351c9583","year":2014},"citing_paper":{"arxiv_id":"2507.03531","last_updated":"2025-07-04T12:35:52Z","snapshot_observed_at":"2026-08-06T20:05:16.276070Z","submitted_at":"2025-07-04T12:35:52Z","title":"Multimodal Alignment with Cross-Attentive GRUs for Fine-Grained Video Understanding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T20:10:40.853807Z"},"links":{"citing_paper":"/paper/2507.03531"},"observation_digest":"sha256:3c6b8c895cb602fb980ef81ef546ea8d7098f6156da2a6e1af368e60b44510a4","observation_id":"38f6ce61-6586-45ce-9f5f-36e4e8be9a1c","resolution":{"observed_at":"2026-08-06T20:10:41.085288Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.01271","last_updated":"2018-04-19T14:32:38Z","snapshot_observed_at":"2026-07-06T06:26:27.965096Z","submitted_at":"2018-03-04T00:20:29Z","title":"An Empirical Evaluation of Generic Convolutional and Recurrent Networks for Sequence Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.01271","snapshot_observed_at":"2026-08-06T20:10:40.856769Z","title":"An empirical evaluation of generic convolutional and recurrent networks for sequence modeling","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.03531","last_updated":"2025-07-04T12:35:52Z","snapshot_observed_at":"2026-08-06T20:05:16.276070Z","submitted_at":"2025-07-04T12:35:52Z","title":"Multimodal Alignment with Cross-Attentive GRUs for Fine-Grained Video Understanding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T20:10:40.856769Z"},"links":{"cited_paper":"/paper/1803.01271","citing_paper":"/paper/2507.03531"},"observation_digest":"sha256:6fd48fdfa1a012837db02e0fa8ed32ac1471b54abf09ef0a678e287b192bcc66","observation_id":"fae51b66-8d97-4a4e-a4c1-ff63160464e0","resolution":{"observed_at":"2026-08-06T20:10:40.856769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15001","last_updated":"2023-11-09T13:48:26Z","snapshot_observed_at":"2026-07-06T15:32:25.931739Z","submitted_at":"2023-05-24T10:37:43Z","title":"Contrastive Training of Complex-Valued Autoencoders for Object Discovery","version":3},"cited_work":{"arxiv_id":"2305.15001","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.15001","snapshot_observed_at":"2026-08-06T20:10:40.911159Z","title":"Contrastive Training of Complex-Valued Autoencoders for Object Discovery","venue":"cs.LG","work_id":"0cfd5db5-7610-43ba-aec0-77529b09399c","year":2023},"citing_paper":{"arxiv_id":"2507.03531","last_updated":"2025-07-04T12:35:52Z","snapshot_observed_at":"2026-08-06T20:05:16.276070Z","submitted_at":"2025-07-04T12:35:52Z","title":"Multimodal Alignment with Cross-Attentive GRUs for Fine-Grained Video Understanding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T20:10:40.861047Z"},"links":{"cited_paper":"/paper/2305.15001","citing_paper":"/paper/2507.03531"},"observation_digest":"sha256:fbf57db7ab3da056318382f6fc2a3e521c2c1bd4fe52b5541e5b50da7032ddd1","observation_id":"8ca3f941-0204-4fcd-8856-70ab839f6d5b","resolution":{"observed_at":"2026-08-06T20:10:40.917485Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-06T20:10:40.864539Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.03531","last_updated":"2025-07-04T12:35:52Z","snapshot_observed_at":"2026-08-06T20:05:16.276070Z","submitted_at":"2025-07-04T12:35:52Z","title":"Multimodal Alignment with Cross-Attentive GRUs for Fine-Grained Video Understanding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T20:10:40.864539Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2507.03531"},"observation_digest":"sha256:f321fa3e00605a0a933b35d296cfe3e5622bb21e64adca2ad31fed9af6562499","observation_id":"e2935fdb-3a17-4d9c-8fe2-1c96ee5ed57b","resolution":{"observed_at":"2026-08-06T20:10:40.864539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:10:40.867742Z","title":"Focal loss for dense object detection","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.03531","last_updated":"2025-07-04T12:35:52Z","snapshot_observed_at":"2026-08-06T20:05:16.276070Z","submitted_at":"2025-07-04T12:35:52Z","title":"Multimodal Alignment with Cross-Attentive GRUs for Fine-Grained Video Understanding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T20:10:40.867742Z"},"links":{"citing_paper":"/paper/2507.03531"},"observation_digest":"sha256:310c7ca5fbc9417ab1ed437542655a7c463d7ce71aff47fed221923ebdcedcf3","observation_id":"a8410bae-100f-4ba2-b17a-20ffe6b0573e","resolution":{"observed_at":"2026-08-06T20:10:40.867742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:10:41.066574Z","title":"Decoupled weight decay regularization","venue":null,"work_id":"cf806805-3d97-4b4d-b7c0-e9e0765f4111","year":2019},"citing_paper":{"arxiv_id":"2507.03531","last_updated":"2025-07-04T12:35:52Z","snapshot_observed_at":"2026-08-06T20:05:16.276070Z","submitted_at":"2025-07-04T12:35:52Z","title":"Multimodal Alignment with Cross-Attentive GRUs for Fine-Grained Video Understanding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T20:10:40.870961Z"},"links":{"citing_paper":"/paper/2507.03531"},"observation_digest":"sha256:f7b9d3fcdb6944c5cca91b317de567d591845e3f68246e1f5daec9cbcd464fb6","observation_id":"cbdc3a54-adea-4007-a5d8-8526b33355a3","resolution":{"observed_at":"2026-08-06T20:10:41.069656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.03531","last_updated":"2025-07-04T12:35:52Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T20:05:16.276070Z","submitted_at":"2025-07-04T12:35:52Z","title":"Multimodal Alignment with Cross-Attentive GRUs for Fine-Grained Video Understanding"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":7,"verified_exact":2,"verified_fuzzy":21},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 0 inbound Pith citation observations for arXiv:2507.03531."}