Raphaël G. Git Repositories - youtubedl/blob - youtube_dl/extractor/tvp.py

   1 # -*- coding: utf-8 -*-
   2 from __future__ import unicode_literals
   3
   4 import re
   5
   6 from .common import InfoExtractor
   7
   8
   9 class TvpIE(InfoExtractor):
  10     IE_NAME = 'tvp.pl'
  11     _VALID_URL = r'https?://(?:vod|www)\.tvp\.pl/.*/(?P<id>\d+)$'
  12
  13     _TESTS = [{
  14         'url': 'http://vod.tvp.pl/filmy-fabularne/filmy-za-darmo/ogniem-i-mieczem/wideo/odc-2/4278035',
  15         'info_dict': {
  16             'id': '4278035',
  17             'ext': 'wmv',
  18             'title': 'Ogniem i mieczem, odc. 2',
  19             'description': 'Bohun dowiaduje się o złamaniu przez kniahinię danego mu słowa i wyrusza do Rozłogów. Helenie w ostatniej chwili udaje się uciec dzięki pomocy Zagłoby.',
  20         },
  21     }, {
  22         'url': 'http://vod.tvp.pl/seriale/obyczajowe/czas-honoru/sezon-1-1-13/i-seria-odc-13/194536',
  23         'info_dict': {
  24             'id': '194536',
  25             'ext': 'mp4',
  26             'title': 'Czas honoru, I seria – odc. 13',
  27             #  'description': 'WŁADEK\nCzesław prosi Marię o dostarczenie Władkowi zarazki tyfusu. Jeśli zachoruje zostanie przewieziony do szpitala skąd łatwiej będzie go odbić. Czy matka zdecyduje się zarazić syna? Karol odwiedza Wandę przyznaje się, że ją oszukiwał, ale ostrzega też, że grozi jej aresztowanie i nalega, żeby wyjechała z Warszawy. Czy dziewczyna zdecyduje się znów oddalić od ukochanego? Rozpoczyna się akcja odbicia Władka.',
  28         },
  29     }, {
  30         'url': 'http://www.tvp.pl/there-can-be-anything-so-i-shortened-it/17916176',
  31         'info_dict': {
  32             'id': '17916176',
  33             'ext': 'mp4',
  34             'title': 'TVP Gorzów pokaże filmy studentów z podroży dookoła świata',
  35         },
  36         'params': {
  37             # m3u8 download
  38             'skip_download': 'true',
  39         },
  40     }, {
  41         'url': 'http://vod.tvp.pl/seriale/obyczajowe/na-sygnale/sezon-2-27-/odc-39/17834272',
  42         'info_dict': {
  43             'id': '17834272',
  44             'ext': 'mp4',
  45             'title': 'Na sygnale, odc. 39',
  46             'description': 'Ekipa Wiktora ratuje młodą matkę, która spadła ze schodów trzymając na rękach noworodka. Okazuje się, że dziewczyna jest surogatką, a biologiczni rodzice dziecka próbują zmusić ją do oddania synka…',
  47         },
  48         'params': {
  49             # m3u8 download
  50             'skip_download': 'true',
  51         },
  52     }]
  53
  54     def _real_extract(self, url):
  55         video_id = self._match_id(url)
  56         webpage = self._download_webpage(
  57             'http://www.tvp.pl/sess/tvplayer.php?object_id=%s' % video_id, video_id)
  58
  59         title = self._og_search_title(webpage)
  60         series = self._search_regex(
  61             r'{name:\s*([\'"])SeriesTitle\1,\s*value:\s*\1(?P<series>.*?)\1},',
  62             webpage, 'series', group='series', default=None)
  63         if series is not None and series not in title:
  64             title = '%s, %s' % (series, title)
  65         description = self._og_search_description(webpage, default=None)
  66
  67         video_url = self._search_regex(
  68             r'0:{src:([\'"])(?P<url>.*?)\1', webpage, 'formats', group='url', default=None)
  69         if video_url is None:
  70             video_url = self._download_json(
  71                 'http://www.tvp.pl/pub/stat/videofileinfo?video_id=%s' % video_id,
  72                 video_id)['video_url']
  73
  74         ext = video_url.rsplit('.', 1)[-1]
  75         if ext != 'ism/manifest':
  76             if '/' in ext:
  77                 ext = 'mp4'
  78             formats = [{
  79                 'format_id': 'direct',
  80                 'url': video_url,
  81                 'ext': ext,
  82             }]
  83         else:
  84             m3u8_url = re.sub('([^/]*)\.ism/manifest', r'\1.ism/\1.m3u8', video_url)
  85             formats = self._extract_m3u8_formats(m3u8_url, video_id, 'mp4')
  86
  87         self._sort_formats(formats)
  88
  89         return {
  90             'id': video_id,
  91             'title': title,
  92             'thumbnail': self._og_search_thumbnail(webpage),
  93             'description': description,
  94             'formats': formats,
  95         }
  96
  97
  98 class TvpSeriesIE(InfoExtractor):
  99     IE_NAME = 'tvp.pl:Series'
 100     _VALID_URL = r'https?://vod\.tvp\.pl/(?:[^/]+/){2}(?P<id>[^/]+)/?$'
 101
 102     _TESTS = [{
 103         'url': 'http://vod.tvp.pl/filmy-fabularne/filmy-za-darmo/ogniem-i-mieczem',
 104         'info_dict': {
 105             'title': 'Ogniem i mieczem',
 106             'id': '4278026',
 107         },
 108         'playlist_count': 4,
 109     }, {
 110         'url': 'http://vod.tvp.pl/audycje/podroze/boso-przez-swiat',
 111         'info_dict': {
 112             'title': 'Boso przez świat',
 113             'id': '9329207',
 114         },
 115         'playlist_count': 86,
 116     }]
 117
 118     def _real_extract(self, url):
 119         display_id = self._match_id(url)
 120         webpage = self._download_webpage(url, display_id, tries=5)
 121
 122         title = self._html_search_regex(
 123             r'(?s) id=[\'"]path[\'"]>(?:.*? / ){2}(.*?)</span>', webpage, 'series')
 124         playlist_id = self._search_regex(r'nodeId:\s*(\d+)', webpage, 'playlist id')
 125         playlist = self._download_webpage(
 126             'http://vod.tvp.pl/vod/seriesAjax?type=series&nodeId=%s&recommend'
 127             'edId=0&sort=&page=0&pageSize=10000' % playlist_id, display_id, tries=5,
 128             note='Downloading playlist')
 129
 130         videos_paths = re.findall(
 131             '(?s)class="shortTitle">.*?href="(/[^"]+)', playlist)
 132         entries = [
 133             self.url_result('http://vod.tvp.pl%s' % v_path, ie=TvpIE.ie_key())
 134             for v_path in videos_paths]
 135
 136         return {
 137             '_type': 'playlist',
 138             'id': playlist_id,
 139             'display_id': display_id,
 140             'title': title,
 141             'entries': entries,
 142         }