{"as_of":"2026-08-15T13:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c18765dba9f87930e36963a0d6ee2a92ea469d50582fb9580764adf59a831712","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T13:08:42.417254Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/1908.05787/citation-record","integrity":"/paper/1908.05787/integrity","json":"/paper/1908.05787/citation-record.json","paper":"/paper/1908.05787"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:08:41.784863Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"1908.05787","last_updated":"2020-11-21T13:52:22Z","snapshot_observed_at":"2026-08-15T05:57:29.581176Z","submitted_at":"2019-08-15T22:51:21Z","title":"Integrating Multimodal Information in Large Pretrained Transformers","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-14T13:08:41.784863Z"},"links":{"citing_paper":"/paper/1908.05787"},"observation_digest":"sha256:abc3979e8ca4ef5c158b5261bcc052632b3b38d7fd782c140e50f6fe0e03f53f","observation_id":"2726e7ab-e649-46c3-82be-bf15238d8b63","resolution":{"observed_at":"2026-08-14T13:08:41.784863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.02715","last_updated":"2019-10-28T17:53:14Z","snapshot_observed_at":"2026-08-14T16:19:41.847021Z","submitted_at":"2019-06-06T17:33:22Z","title":"Visualizing and Measuring the Geometry of BERT","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.02715","snapshot_observed_at":"2026-08-14T13:08:41.797211Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"1908.05787","last_updated":"2020-11-21T13:52:22Z","snapshot_observed_at":"2026-08-15T05:57:29.581176Z","submitted_at":"2019-08-15T22:51:21Z","title":"Integrating Multimodal Information in Large Pretrained Transformers","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-14T13:08:41.797211Z"},"links":{"cited_paper":"/paper/1906.02715","citing_paper":"/paper/1908.05787"},"observation_digest":"sha256:fb858982d6a813580722ebbf755750dc344d0fdd4c3f93c7664e90d67de643af","observation_id":"05acbbe1-99ff-498f-b348-0ff540b05ad1","resolution":{"observed_at":"2026-08-14T13:08:41.797211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1901.02860","last_updated":"2019-06-02T21:21:48Z","snapshot_observed_at":"2026-08-14T17:33:04.904744Z","submitted_at":"2019-01-09T18:28:19Z","title":"Transformer-XL: Attentive Language Models Beyond a Fixed-Length Context","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.02860","snapshot_observed_at":"2026-08-14T13:08:41.803267Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"1908.05787","last_updated":"2020-11-21T13:52:22Z","snapshot_observed_at":"2026-08-15T05:57:29.581176Z","submitted_at":"2019-08-15T22:51:21Z","title":"Integrating Multimodal Information in Large Pretrained Transformers","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-14T13:08:41.803267Z"},"links":{"cited_paper":"/paper/1901.02860","citing_paper":"/paper/1908.05787"},"observation_digest":"sha256:c53c1f12dffcf9f1a735daf0a04bc6dbe8aa81798ef4526e0a678ecb9d3570ea","observation_id":"b69b9367-8c07-4e97-a896-bab1ecc088b0","resolution":{"observed_at":"2026-08-14T13:08:41.803267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:08:43.316458Z","title":null,"venue":null,"work_id":"1c37638a-0a2a-4c92-97e4-114705890cb3","year":2014},"citing_paper":{"arxiv_id":"1908.05787","last_updated":"2020-11-21T13:52:22Z","snapshot_observed_at":"2026-08-15T05:57:29.581176Z","submitted_at":"2019-08-15T22:51:21Z","title":"Integrating Multimodal Information in Large Pretrained Transformers","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-14T13:08:41.811764Z"},"links":{"citing_paper":"/paper/1908.05787"},"observation_digest":"sha256:70ea3f35b15f5274e99df2b3ca6be17bd8606df0fa2872d4d995bf8ebcba6830","observation_id":"53a272f3-bc20-4603-b859-43fa7b916d86","resolution":{"observed_at":"2026-08-14T13:08:43.329262Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-08-14T18:16:28.847993Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-14T13:08:41.818365Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1908.05787","last_updated":"2020-11-21T13:52:22Z","snapshot_observed_at":"2026-08-15T05:57:29.581176Z","submitted_at":"2019-08-15T22:51:21Z","title":"Integrating Multimodal Information in Large Pretrained Transformers","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-14T13:08:41.818365Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/1908.05787"},"observation_digest":"sha256:984b3a69dca0b2680d6808c9196276896f8049f67dc2cc6e0b778fa743d89ebc","observation_id":"9cd6dca2-a534-48c2-a14e-f65323c3168d","resolution":{"observed_at":"2026-08-14T13:08:41.818365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:08:43.300393Z","title":null,"venue":null,"work_id":"a116227a-7691-4073-af85-4e294f2be86a","year":2018},"citing_paper":{"arxiv_id":"1908.05787","last_updated":"2020-11-21T13:52:22Z","snapshot_observed_at":"2026-08-15T05:57:29.581176Z","submitted_at":"2019-08-15T22:51:21Z","title":"Integrating Multimodal Information in Large Pretrained Transformers","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-14T13:08:41.884515Z"},"links":{"citing_paper":"/paper/1908.05787"},"observation_digest":"sha256:1cedb66fc8cc4065daeab72d4587b6d6344774844bef4a949d6209aee2e88ae6","observation_id":"191e99ab-6ecd-4234-840d-689add5768a1","resolution":{"observed_at":"2026-08-14T13:08:43.305532Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:08:43.218407Z","title":null,"venue":null,"work_id":"7e0ef6d5-0480-4050-ae35-4dce4d154adc","year":2017},"citing_paper":{"arxiv_id":"1908.05787","last_updated":"2020-11-21T13:52:22Z","snapshot_observed_at":"2026-08-15T05:57:29.581176Z","submitted_at":"2019-08-15T22:51:21Z","title":"Integrating Multimodal Information in Large Pretrained Transformers","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-14T13:08:41.966371Z"},"links":{"citing_paper":"/paper/1908.05787"},"observation_digest":"sha256:efb73f5792511688cf6cedba458b9161bb6496fcf50957b82371f3b49d4e1d1d","observation_id":"307ccced-3178-4b5a-bae6-7b752775cee0","resolution":{"observed_at":"2026-08-14T13:08:43.291560Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-14T18:51:16.666127Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-14T13:08:41.972696Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"1908.05787","last_updated":"2020-11-21T13:52:22Z","snapshot_observed_at":"2026-08-15T05:57:29.581176Z","submitted_at":"2019-08-15T22:51:21Z","title":"Integrating Multimodal Information in Large Pretrained Transformers","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-14T13:08:41.972696Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/1908.05787"},"observation_digest":"sha256:e51d29829685693a2b1c9740908adc3512938f28ef9b624cfd0d11f611b909c2","observation_id":"f5b98cfb-664a-4596-937a-40898d5f0f16","resolution":{"observed_at":"2026-08-14T13:08:41.972696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1808.03920","last_updated":"2018-08-12T10:04:45Z","snapshot_observed_at":"2026-08-14T18:42:09.594855Z","submitted_at":"2018-08-12T10:04:45Z","title":"Multimodal Language Analysis with Recurrent Multistage Fusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.03920","snapshot_observed_at":"2026-08-14T13:08:41.978201Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1908.05787","last_updated":"2020-11-21T13:52:22Z","snapshot_observed_at":"2026-08-15T05:57:29.581176Z","submitted_at":"2019-08-15T22:51:21Z","title":"Integrating Multimodal Information in Large Pretrained Transformers","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-14T13:08:41.978201Z"},"links":{"cited_paper":"/paper/1808.03920","citing_paper":"/paper/1908.05787"},"observation_digest":"sha256:fb96823ceed6f9ce688bb712cf2cc31a22dfb13a857e4ed01a5c155415357946","observation_id":"60594a82-3fd7-40c6-ad2a-498b02a6dfe0","resolution":{"observed_at":"2026-08-14T13:08:41.978201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:08:41.984311Z","title":null,"venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"1908.05787","last_updated":"2020-11-21T13:52:22Z","snapshot_observed_at":"2026-08-15T05:57:29.581176Z","submitted_at":"2019-08-15T22:51:21Z","title":"Integrating Multimodal Information in Large Pretrained Transformers","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-14T13:08:41.984311Z"},"links":{"citing_paper":"/paper/1908.05787"},"observation_digest":"sha256:fab31e7c8dc1bd23db6a5108e333d782d018e4b591d956974af57562e81031e3","observation_id":"d733f5d5-ec3c-4c13-83d1-b25af0ac4db0","resolution":{"observed_at":"2026-08-14T13:08:41.984311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:08:41.994324Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"1908.05787","last_updated":"2020-11-21T13:52:22Z","snapshot_observed_at":"2026-08-15T05:57:29.581176Z","submitted_at":"2019-08-15T22:51:21Z","title":"Integrating Multimodal Information in Large Pretrained Transformers","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-14T13:08:41.994324Z"},"links":{"citing_paper":"/paper/1908.05787"},"observation_digest":"sha256:007887023c69c5465605fc23dc11245227081306fd24030bc1fa07ddc2efc9e5","observation_id":"a5261e4a-64fc-4d60-b35b-c9cb3a2f229d","resolution":{"observed_at":"2026-08-14T13:08:41.994324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:08:42.002036Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"1908.05787","last_updated":"2020-11-21T13:52:22Z","snapshot_observed_at":"2026-08-15T05:57:29.581176Z","submitted_at":"2019-08-15T22:51:21Z","title":"Integrating Multimodal Information in Large Pretrained Transformers","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-14T13:08:42.002036Z"},"links":{"citing_paper":"/paper/1908.05787"},"observation_digest":"sha256:386c3ca20a3320a8b8ad46d98c673f5817496ddb6d0168aab3da7dda39a49a60","observation_id":"b9f2e0ef-1093-4845-a1e5-c10f30f6b3b7","resolution":{"observed_at":"2026-08-14T13:08:42.002036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1802.05365","last_updated":"2018-03-22T21:59:40Z","snapshot_observed_at":"2026-08-14T19:45:43.957260Z","submitted_at":"2018-02-15T00:05:11Z","title":"Deep contextualized word representations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.05365","snapshot_observed_at":"2026-08-14T13:08:42.079765Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1908.05787","last_updated":"2020-11-21T13:52:22Z","snapshot_observed_at":"2026-08-15T05:57:29.581176Z","submitted_at":"2019-08-15T22:51:21Z","title":"Integrating Multimodal Information in Large Pretrained Transformers","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-14T13:08:42.079765Z"},"links":{"cited_paper":"/paper/1802.05365","citing_paper":"/paper/1908.05787"},"observation_digest":"sha256:82681d3cfc843160621879128c042d83ad5f2443772781f91fa7bbbdb89334d5","observation_id":"4001bd9d-55f9-4c80-aa2e-abbd46c686b7","resolution":{"observed_at":"2026-08-14T13:08:42.079765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.07809","last_updated":"2020-02-28T09:20:33Z","snapshot_observed_at":"2026-08-14T17:41:24.660089Z","submitted_at":"2018-12-19T08:38:21Z","title":"Found in Translation: Learning Robust Joint Representations by Cyclic Translations Between Modalities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.07809","snapshot_observed_at":"2026-08-14T13:08:42.086914Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"1908.05787","last_updated":"2020-11-21T13:52:22Z","snapshot_observed_at":"2026-08-15T05:57:29.581176Z","submitted_at":"2019-08-15T22:51:21Z","title":"Integrating Multimodal Information in Large Pretrained Transformers","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-14T13:08:42.086914Z"},"links":{"cited_paper":"/paper/1812.07809","citing_paper":"/paper/1908.05787"},"observation_digest":"sha256:097c0fa9e5b34477b8a8c6e443727181d19f60aa46e657868ba36b5b6cda284c","observation_id":"4552fe32-a713-4e6b-a9d1-9c8bbcbdace5","resolution":{"observed_at":"2026-08-14T13:08:42.086914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:08:43.089343Z","title":null,"venue":null,"work_id":"0a7b467a-698d-4934-bea3-17a5a2560481","year":2018},"citing_paper":{"arxiv_id":"1908.05787","last_updated":"2020-11-21T13:52:22Z","snapshot_observed_at":"2026-08-15T05:57:29.581176Z","submitted_at":"2019-08-15T22:51:21Z","title":"Integrating Multimodal Information in Large Pretrained Transformers","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-14T13:08:42.092157Z"},"links":{"citing_paper":"/paper/1908.05787"},"observation_digest":"sha256:43e2574a0c16fdb9a07c740b0de7e11d5b2f0e69eb08a96b6c42c94c32c0770d","observation_id":"515fc9b1-c78d-4e3f-b759-9390d1f6e616","resolution":{"observed_at":"2026-08-14T13:08:43.181382Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:08:42.096501Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1908.05787","last_updated":"2020-11-21T13:52:22Z","snapshot_observed_at":"2026-08-15T05:57:29.581176Z","submitted_at":"2019-08-15T22:51:21Z","title":"Integrating Multimodal Information in Large Pretrained Transformers","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-14T13:08:42.096501Z"},"links":{"citing_paper":"/paper/1908.05787"},"observation_digest":"sha256:93093bbe48f40fcbfb756ef4101f5f5946e548e9d9cd6013f83e14a40c572f54","observation_id":"5e00a31c-a3f9-4409-8f29-601197569fe8","resolution":{"observed_at":"2026-08-14T13:08:42.096501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.01766","last_updated":"2019-09-11T19:52:54Z","snapshot_observed_at":"2026-08-14T16:52:36.554748Z","submitted_at":"2019-04-03T04:40:16Z","title":"VideoBERT: A Joint Model for Video and Language Representation Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.01766","snapshot_observed_at":"2026-08-14T13:08:42.100869Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"1908.05787","last_updated":"2020-11-21T13:52:22Z","snapshot_observed_at":"2026-08-15T05:57:29.581176Z","submitted_at":"2019-08-15T22:51:21Z","title":"Integrating Multimodal Information in Large Pretrained Transformers","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-14T13:08:42.100869Z"},"links":{"cited_paper":"/paper/1904.01766","citing_paper":"/paper/1908.05787"},"observation_digest":"sha256:178962eadb5a595f4ac4bc5dbf3fd1ec5101e77a5f8fec8ec4faa44eb971b454","observation_id":"feeec428-6444-44e7-970c-960a54674546","resolution":{"observed_at":"2026-08-14T13:08:42.100869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.00295","last_updated":"2019-06-01T21:29:20Z","snapshot_observed_at":"2026-08-14T16:22:29.991521Z","submitted_at":"2019-06-01T21:29:20Z","title":"Multimodal Transformer for Unaligned Multimodal Language Sequences","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.00295","snapshot_observed_at":"2026-08-14T13:08:42.105235Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"1908.05787","last_updated":"2020-11-21T13:52:22Z","snapshot_observed_at":"2026-08-15T05:57:29.581176Z","submitted_at":"2019-08-15T22:51:21Z","title":"Integrating Multimodal Information in Large Pretrained Transformers","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-14T13:08:42.105235Z"},"links":{"cited_paper":"/paper/1906.00295","citing_paper":"/paper/1908.05787"},"observation_digest":"sha256:8505419d2c80832d7dd5a9859abdd1fce06a646bbba9a4e9882626922b2ff955","observation_id":"3691115b-a282-4139-8ada-d25f8f1d5eae","resolution":{"observed_at":"2026-08-14T13:08:42.105235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1806.06176","last_updated":"2019-05-14T14:16:40Z","snapshot_observed_at":"2026-08-14T19:03:01.587722Z","submitted_at":"2018-06-16T03:48:50Z","title":"Learning Factorized Multimodal Representations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.06176","snapshot_observed_at":"2026-08-14T13:08:42.112742Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1908.05787","last_updated":"2020-11-21T13:52:22Z","snapshot_observed_at":"2026-08-15T05:57:29.581176Z","submitted_at":"2019-08-15T22:51:21Z","title":"Integrating Multimodal Information in Large Pretrained Transformers","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-14T13:08:42.112742Z"},"links":{"cited_paper":"/paper/1806.06176","citing_paper":"/paper/1908.05787"},"observation_digest":"sha256:7a80c2905cf36bdd144e4889984e81135393d01e7effd6868a5d7ba14767d17c","observation_id":"0a0a6d0b-50ae-49bf-8fda-63f12055aafd","resolution":{"observed_at":"2026-08-14T13:08:42.112742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:08:42.167963Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"1908.05787","last_updated":"2020-11-21T13:52:22Z","snapshot_observed_at":"2026-08-15T05:57:29.581176Z","submitted_at":"2019-08-15T22:51:21Z","title":"Integrating Multimodal Information in Large Pretrained Transformers","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-14T13:08:42.167963Z"},"links":{"citing_paper":"/paper/1908.05787"},"observation_digest":"sha256:dbe8670eb222d6386d0eee9ca5c349484915580ce8e4c3fff5a359982f6935bf","observation_id":"265c5897-eaca-47db-a612-c28f89847527","resolution":{"observed_at":"2026-08-14T13:08:42.167963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.09362","last_updated":"2018-11-26T03:28:36Z","snapshot_observed_at":"2026-08-14T17:54:51.865310Z","submitted_at":"2018-11-23T05:13:38Z","title":"Words Can Shift: Dynamically Adjusting Word Representations Using Nonverbal Behaviors","version":2},"cited_work":{"arxiv_id":"1811.09362","doi":null,"metadata_source":"pith","pith_arxiv_id":"1811.09362","snapshot_observed_at":"2026-08-14T13:08:42.518997Z","title":"Words Can Shift: Dynamically Adjusting Word Representations Using Nonverbal Behaviors","venue":"cs.CL","work_id":"9849cdd2-8790-44b5-ba18-21435dbfe019","year":2018},"citing_paper":{"arxiv_id":"1908.05787","last_updated":"2020-11-21T13:52:22Z","snapshot_observed_at":"2026-08-15T05:57:29.581176Z","submitted_at":"2019-08-15T22:51:21Z","title":"Integrating Multimodal Information in Large Pretrained Transformers","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-14T13:08:42.234382Z"},"links":{"cited_paper":"/paper/1811.09362","citing_paper":"/paper/1908.05787"},"observation_digest":"sha256:d5bd1d286728f0a62f6a58a944fd78d5795e5352a0270b2b164c3daa7e40f3c7","observation_id":"46fd7850-e318-4af3-8c3f-78b9ad9c0f2b","resolution":{"observed_at":"2026-08-14T13:08:42.602091Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.08237","last_updated":"2020-01-02T12:48:08Z","snapshot_observed_at":"2026-07-31T22:49:43.034741Z","submitted_at":"2019-06-19T17:35:48Z","title":"XLNet: Generalized Autoregressive Pretraining for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.08237","snapshot_observed_at":"2026-08-14T13:08:42.313226Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"1908.05787","last_updated":"2020-11-21T13:52:22Z","snapshot_observed_at":"2026-08-15T05:57:29.581176Z","submitted_at":"2019-08-15T22:51:21Z","title":"Integrating Multimodal Information in Large Pretrained Transformers","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-14T13:08:42.313226Z"},"links":{"cited_paper":"/paper/1906.08237","citing_paper":"/paper/1908.05787"},"observation_digest":"sha256:ca400455f91972189ac51e15fd79afc901668ddf0239a0f83d24563b0e828050","observation_id":"190652c7-3f0a-41a0-a891-e108e537e602","resolution":{"observed_at":"2026-08-14T13:08:42.313226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:08:43.010682Z","title":null,"venue":null,"work_id":"08256e1c-3390-4bdf-a3c9-c9d8fb6e65d8","year":2008},"citing_paper":{"arxiv_id":"1908.05787","last_updated":"2020-11-21T13:52:22Z","snapshot_observed_at":"2026-08-15T05:57:29.581176Z","submitted_at":"2019-08-15T22:51:21Z","title":"Integrating Multimodal Information in Large Pretrained Transformers","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-14T13:08:42.318209Z"},"links":{"citing_paper":"/paper/1908.05787"},"observation_digest":"sha256:6071d1dba72bdb29ae0673b5a65a1e176b2afc268b8bf3d3a132704b6b1a57db","observation_id":"32cfcfa6-0d67-465b-a766-99328f94a010","resolution":{"observed_at":"2026-08-14T13:08:43.058822Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.07250","last_updated":"2017-07-23T05:54:20Z","snapshot_observed_at":"2026-08-14T20:45:55.731918Z","submitted_at":"2017-07-23T05:54:20Z","title":"Tensor Fusion Network for Multimodal Sentiment Analysis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.07250","snapshot_observed_at":"2026-08-14T13:08:42.322224Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"1908.05787","last_updated":"2020-11-21T13:52:22Z","snapshot_observed_at":"2026-08-15T05:57:29.581176Z","submitted_at":"2019-08-15T22:51:21Z","title":"Integrating Multimodal Information in Large Pretrained Transformers","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-14T13:08:42.322224Z"},"links":{"cited_paper":"/paper/1707.07250","citing_paper":"/paper/1908.05787"},"observation_digest":"sha256:d08ce0443691a1df4a251fc9aaec998f65d1f7c8ab4a457638b0c7cb0be325a4","observation_id":"be1cf253-6173-437b-a178-e527305c1add","resolution":{"observed_at":"2026-08-14T13:08:42.322224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:08:42.959703Z","title":null,"venue":null,"work_id":"37d89aed-2437-4f36-afe4-7bcad47b8c7e","year":2018},"citing_paper":{"arxiv_id":"1908.05787","last_updated":"2020-11-21T13:52:22Z","snapshot_observed_at":"2026-08-15T05:57:29.581176Z","submitted_at":"2019-08-15T22:51:21Z","title":"Integrating Multimodal Information in Large Pretrained Transformers","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-14T13:08:42.326721Z"},"links":{"citing_paper":"/paper/1908.05787"},"observation_digest":"sha256:bacf49c753a05086e46a6cb96bb0870e1f2895434972d33fd61f61dad40f51a1","observation_id":"61f95a8d-1753-4e07-bd8c-cdc8ccb131cc","resolution":{"observed_at":"2026-08-14T13:08:42.964512Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:08:42.944540Z","title":null,"venue":null,"work_id":"565fd9be-c02b-4e87-9b8d-c7a3ddd97f8f","year":2018},"citing_paper":{"arxiv_id":"1908.05787","last_updated":"2020-11-21T13:52:22Z","snapshot_observed_at":"2026-08-15T05:57:29.581176Z","submitted_at":"2019-08-15T22:51:21Z","title":"Integrating Multimodal Information in Large Pretrained Transformers","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-14T13:08:42.331913Z"},"links":{"citing_paper":"/paper/1908.05787"},"observation_digest":"sha256:d2300ad37423532676ca79e79580569401ebf57bd3b779e5ce46a30804d16ce7","observation_id":"4a1431e9-579c-4fc5-9d8b-7c781d8639e8","resolution":{"observed_at":"2026-08-14T13:08:42.949414Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:08:42.826466Z","title":null,"venue":null,"work_id":"84896330-bb67-4802-99ad-7b87d7e43e73","year":2018},"citing_paper":{"arxiv_id":"1908.05787","last_updated":"2020-11-21T13:52:22Z","snapshot_observed_at":"2026-08-15T05:57:29.581176Z","submitted_at":"2019-08-15T22:51:21Z","title":"Integrating Multimodal Information in Large Pretrained Transformers","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-14T13:08:42.336306Z"},"links":{"citing_paper":"/paper/1908.05787"},"observation_digest":"sha256:9a3182e23a05320580b595c54ea80266104796ff76efc37046f67a0531aff4cc","observation_id":"7df5dfd5-922c-4930-bfee-8db8ba682aec","resolution":{"observed_at":"2026-08-14T13:08:42.867272Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.06259","last_updated":"2016-08-12T02:39:40Z","snapshot_observed_at":"2026-08-14T21:51:56.879375Z","submitted_at":"2016-06-20T19:23:53Z","title":"MOSI: Multimodal Corpus of Sentiment Intensity and Subjectivity Analysis in Online Opinion Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.06259","snapshot_observed_at":"2026-08-14T13:08:42.388144Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1908.05787","last_updated":"2020-11-21T13:52:22Z","snapshot_observed_at":"2026-08-15T05:57:29.581176Z","submitted_at":"2019-08-15T22:51:21Z","title":"Integrating Multimodal Information in Large Pretrained Transformers","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-14T13:08:42.388144Z"},"links":{"cited_paper":"/paper/1606.06259","citing_paper":"/paper/1908.05787"},"observation_digest":"sha256:a18faedfaad7a067da9ce5eaee701638c62c22343fe20866db2d5fa046c3714f","observation_id":"ad40d0c8-3f2b-48d6-b079-03ffcc6715af","resolution":{"observed_at":"2026-08-14T13:08:42.388144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:08:42.768648Z","title":null,"venue":null,"work_id":"f98976a2-6574-40e8-b5c0-84b74cdf2a2e","year":2018},"citing_paper":{"arxiv_id":"1908.05787","last_updated":"2020-11-21T13:52:22Z","snapshot_observed_at":"2026-08-15T05:57:29.581176Z","submitted_at":"2019-08-15T22:51:21Z","title":"Integrating Multimodal Information in Large Pretrained Transformers","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-14T13:08:42.407217Z"},"links":{"citing_paper":"/paper/1908.05787"},"observation_digest":"sha256:c02eb021feb0fffcf1c7020ad53030d587cd80a68898b1bdbdae8f57c651dd86","observation_id":"8c87400e-4b36-45ff-a3c1-4efd56046d8e","resolution":{"observed_at":"2026-08-14T13:08:42.815356Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:08:42.412277Z","title":"URL: \" 'urlintro :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"1908.05787","last_updated":"2020-11-21T13:52:22Z","snapshot_observed_at":"2026-08-15T05:57:29.581176Z","submitted_at":"2019-08-15T22:51:21Z","title":"Integrating Multimodal Information in Large Pretrained Transformers","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-14T13:08:42.412277Z"},"links":{"citing_paper":"/paper/1908.05787"},"observation_digest":"sha256:357826c2359b5d900992848c3db031a51d9213f574bdcc33f618abac65d4034c","observation_id":"254013cc-4824-422e-9707-e0303308dedd","resolution":{"observed_at":"2026-08-14T13:08:42.412277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:08:42.417254Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"1908.05787","last_updated":"2020-11-21T13:52:22Z","snapshot_observed_at":"2026-08-15T05:57:29.581176Z","submitted_at":"2019-08-15T22:51:21Z","title":"Integrating Multimodal Information in Large Pretrained Transformers","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-14T13:08:42.417254Z"},"links":{"citing_paper":"/paper/1908.05787"},"observation_digest":"sha256:3b84e47da61c0e147c70e3d947f1cd3116cc33c738c401a8a3494d8f722c0147","observation_id":"f3a2ab75-990d-4cf1-9c7e-36bdc4d3e645","resolution":{"observed_at":"2026-08-14T13:08:42.417254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"1908.05787","last_updated":"2020-11-21T13:52:22Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-15T05:57:29.581176Z","submitted_at":"2019-08-15T22:51:21Z","title":"Integrating Multimodal Information in Large Pretrained Transformers"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":30,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 0 inbound Pith citation observations for arXiv:1908.05787."}