GoogleExtractUrls.java example

Explorer

WebGatherer---Scraper-and-Analyzer-master
- src
  - main
    - java
      - com
        rickdane
        springmodularizedproject
        api
        transport
        EmailTransport.java
        Rawscrapeddata.java
        ReceivedEmail.java
        Scraper.java
        TransportBase.java
        WebGathererJobJsonTransport.java
      - org
        Webgatherer
        Api
        Scraper
        ScraperFactory.java
        Common
        Properties
        PropertiesContainer.java
        Controller
        Api
        ApiCommunication.java
        BaseApiCommunication.java
        Base
        EntryBase.java
        Component
        ControllerFlow.java
        WorkflowControllerImpl_1.java
        EntityTransport
        EntryTransport.java
        Entry_ExampleMain.java
        Entry_ExampleRun_SearchScrape.java
        Entry_ExampleRun_WebPagesScrape.java
        Entry_ScraperGeneric.java
        Entry_ScraperIndeed.java
        CoreEngine
        Core
        ThreadCommunication
        FinalOutputContainer.java
        FinalOutputContainerImpl.java
        ThreadCommunication.java
        ThreadCommunicationBase.java
        ThreadCommunicationImpl.java
        Threadable
        Base
        BaseWebThread.java
        BaseWebThreadImpl.java
        DataInterpreatation
        DataInterpretor.java
        DataInterpretorImpl.java
        WebGather
        PageRetrieverThreadManager.java
        ThreadCommunicationPageRetriever.java
        ThreadRetrievePage.java
        WebGather.java
        WebGatherImpl.java
        DependencyInjection
        DependencyBindingModule.java
        Workflow
        WorfkflowWrapperImpl_Reflection.java
        WorkflowWrapper.java
        WorkflowWrapperImpl_External.java
        lib
        WebDriverFactory.java
        ExperimentalLabs
        DependencyInjection
        DependencyBindingModule.java
        EmailExtraction
        ExtractEmailsFromFileMain.java
        ExtractEmailsFromList.java
        PageRetrieverThreadManagerEmailExtraction.java
        ThreadRetrievePageEmailExtraction.java
        HtmlProcessing
        HtmlParser.java
        HtmlParserImpl.java
        Mail
        EmailSendReceive.java
        mainSendEmail.java
        Scraper
        Core
        PageRetrieverThreadManagerScraper.java
        ScraperBase.java
        Deprecated
        Entry_Scraper2.java
        PlacesScraper.java
        ScraperBaseStatic.java
        Generic
        ScraperGeneric.java
        ThreadRetrievePageGeneric.java
        Google
        GoogleExtractUrls.java
        googleTest.java
        Indeed
        ScraperIndeed.java
        ThreadRetrievePageIndeed.java
        Object
        ScraperBaseDepr.java
        ScraperBaseJavascript.java
        WebService
        WebServiceCaller.java
        Persistence
        InputOutput
        Persistence.java
        PersistenceImpl_WriteToFile.java
        ReadFromFileToList.java
        WriterOutputQueueToFile.java
        Utility
        RandomSelector.java
        ReadFiles.java
        Service
        WebServiceClient.java
        TextCleaner.java
        TextReformatter.java
        WorkflowExample
        DataHolders
        Container.java
        ContainerBase.java
        DataHolder.java
        DataHolderImpl.java
        DependencyInjection
        DependencyBindingModule.java
        Provider
        WorkflowProvider.java
        Status
        StatusIndicator.java
        Workflows
        Base
        Common
        WorkflowBase.java
        DataInterpetor
        EmailExtractor.java
        TextExtraction.java
        Workflow_DataInterpretorBase.java
        Implementations
        DataInterpetor
        Workflow_DataInterpretor_1.java
        Workflow_DataInterpretor_SearchResultsScrape.java
        WebGatherer
        EnumUrlRetrieveOptions.java
        Workflow_WebGather_1.java
        Workflow_WebSearch1.java
        Workflow_WebSearch2.java
        ardverk
        collection
        AbstractKeyAnalyzer.java
        AbstractPatriciaTrie.java
        AbstractTrie.java
        ByteArrayKeyAnalyzer.java
        ByteKeyAnalyzer.java
        CharArrayKeyAnalyzer.java
        CharacterKeyAnalyzer.java
        Cursor.java
        DefaultKeyAnalyzer.java
        IntegerKeyAnalyzer.java
        Key.java
        KeyAnalyzer.java
        LongKeyAnalyzer.java
        PatriciaTrie.java
        ShortKeyAnalyzer.java
        StringKeyAnalyzer.java
        Trie.java
        Tries.java

package org.Webgatherer.ExperimentalLabs.Scraper.Google;

import com.google.inject.Inject;
import org.Webgatherer.CoreEngine.lib.WebDriverFactory;
import org.Webgatherer.ExperimentalLabs.HtmlProcessing.HtmlParser;
import org.openqa.selenium.WebDriver;

import java.util.ArrayList;
import java.util.List;
import java.util.Map;

/**
 * @author Rick Dane
 */
public class GoogleExtractUrls {

    private HtmlParser htmlParser;
    private String searchPhrase;

    private WebDriver driver;
    private int numPages;

    private int googleNum;
    private int basePageNum = 10;
    private int incrementNum = 10;
    private int delay = 1000;
    private int numResultsPerPage = 10;

    private String negativeMatchLinkPrefix = "google.com";
    private String negativeMatchLinkContains = "google";
    private String positiveMatchLinkPrefix = "http";

    private List<String> outputLinks = new ArrayList<String>();
    private List<String> duplicateCheckList = new ArrayList<String>();

    @Inject
    public GoogleExtractUrls(HtmlParser htmlParser, WebDriverFactory webDriverFactory) {
        this.htmlParser = htmlParser;
        driver = webDriverFactory.createNewWebDriver();
    }

    public void configure(String searchPhrase, int numPages) {
        this.searchPhrase = searchPhrase;
        this.numPages = numPages;
        googleNum = numPages * numResultsPerPage;
    }

    public List<String> extractUrls() {
        int i = basePageNum;
        while (i <= googleNum) {
            driver.get("https://www.google.com/search?q=" + searchPhrase + "&hl=en&num=" + i + "&lr=&ft=i&cr=&safe=images&tbs=qdr:m#q=livermore+java+developer&hl=en&lr=&tbs=qdr:m&prmd=imvns");

            Map<String, String> links = htmlParser.extractLinks(negativeMatchLinkPrefix, driver.getPageSource());

            addToOutputList(links);

            i = i + incrementNum;

            try {
                Thread.sleep(delay);
            } catch (InterruptedException e) {
                e.printStackTrace();
            }
        }
        return outputLinks;
    }

    private void addToOutputList(Map<String, String> links) {
        for (Map.Entry<String, String> entries : links.entrySet()) {
            String url = entries.getValue();
            if (!url.startsWith(negativeMatchLinkPrefix) && !url.contains(negativeMatchLinkContains) && url.startsWith(positiveMatchLinkPrefix) && !duplicateCheckList.contains(url)) {
                outputLinks.add(url);
                duplicateCheckList.add(url);
            }
        }
    }
}