博客

  • JBlog 15年技术大神带小白玩开源项目 梦想从这里启航 一代技术人带新人见证技术变迁

    个人参与JBlog预期收获

    1. 从0学会玩开源
    2. 从.net转java绝佳的练习,15年技术大神带队
    3. 学会Git
    4. 学会自动构建
    5. 学会服务器管理
    6. 学会博客系统架构
    7. 免费的科学上网指导,技术资料不再有国界

    企业参与收获

    将公司团队打造成一支敏捷开发团队,构建全自动的CI系统,理顺研发流程,持续的产品研发交付能力​!​

    正文

    每个开源项目的背后,都有一群为梦想执着的人!从asp+access到.net+mssql到php+mysql到java+mysql,见证技术变迁!用过wordpress,用过blogengine,用过phpcms,用过dedecms,各式各样的建站系统!随着版本的迭代,很多产品越来越成熟,也离梦想越来越远!很多时候,功能越多,并不意味着适合自己。

    对于写博客来说, WordPress是很流行,我也是一名wordpress用户,但是一直磨灭不了自己要写一个自己的博客小系统,感觉自己写的,才能真正满足使用需求,而不是被别人所牵引。

    相信很多人都有这么一个小小梦想,就是拥有一个自己的小系统,亲手打造,能被众多“信徒”所喜爱。很多人没有亲眼见证过一个系统从无到有,从无人使用到广受欢迎的历练过程。或许JBlog是一个小白成长的不错选择。

    JBlog发起人是一位技术大佬,拥有15年工作经验,从大佬的博客上所见,在大数据搜索、游戏开发、自动构建、技术管理、CMS系统架构、网络管理等领域都有深入的研究。

    JBlog将从无到有,从一个简单的小博客逐渐壮大起来!这个过程是漫长的,值得期待了,更是小白的一次历练机会!学会从无到有,从0基础到掌握系统研发、架构、管理!

    关注大佬的公众号,参与JBlog开源项目!

    如何参与?

    JBlog是托管在Github.com上面,对于Github的使用,大佬的公众号都有讲,就不废话了,关注公众号去看吧!

    JBlog部署

    JBlog的文档在大佬的公众号里都有提到,不再赘述!

    代码贡献

    JBlog采用Github管理,代码贡献要通过大佬审核,大胆的fork,push吧!

    关注大佬的公众号:海哥聊技术

  • 用Elasticsearch打造自主站点内搜索引擎 用开源技术成就个性化搜索 带小白玩转es开源搜索 No Code Talk

     

    提到实现搜索功能,很快就想到sql的like模糊查找 ,很快就想到Lucene、Elasticsearch、solr,这些都是要实现搜索功能的关键术语。今天将分享的是采用Elasticsearch打造自主站内搜索引擎的实战经验分享。本文不是讲原理,不是分析es源代码,也不是讲es故事的,仅从应用角度,带小白运用es打造一个简易的搜索引擎。

    一、为什么要使用elasticsearch

    选elasticsearch,冲着开源免费,内置Lucene分词,在主自搜索引擎这块,es还是很有名气的。相比较于关系型数据库,elasticsearch倒排索引,能有更加高效的搜索性能。对于一般企业来讲,重复造轮子的成本太大,使用es算是一个不错的选择。

    二、自主搜索引擎的基本组成

    自主搜索引擎主要由elaticsearch安装、数据同步服务与Elastic Search High level API三大块组成。下面分别介绍这三大块。

    2.0 安装elasticsearch

    安装教程之前有专门写了一个小白序列,可以参考。

    Storm Topology : Elasticsearch & Redis 构建实时性低延时数据统计分析 呈现大数据分析效果

    2.1 数据同步服务 建立es索引

    数据同步服务,即将需要用于搜索展示的数据组装好,同步到es,这个过程是利用es建立索引的过程。服务一般以后台服务的形式定时执行。我们的做法是,针对需要查询的数据,写操作日志,包括增、删、改操作,同步服务定时检查日志,将数据同步到es上。一般是多个表组合好的业务数据,对应es上的一个索引类型。若是同步服务写得好,应该可以将同步服务做成透明的,通过配置,直接将数据对接到es,显然,我们没有造这种“面包机”,我们在mysql里有建立操作日志,专门用于es同步。同步服务会记录操作日志进度,不断同步业务数据到es.基本上,写完这个服务,基本上就完成很大一块工作了,成功的希望就在眼前。

    关注ChinaHadoop公众号,回复”Elasticsearch”可获取一份《创建index和type.txt》

    2.2 使用elasticsearch High Level API查询数据

    准备好了同步服务,有了索引数据,接下来就是使用数据了。在这里推荐使用的是elasticsearch High Level API,为什么不推荐其他api或映射框架?因为我就会这一种方式啊!算是抛砖引玉,想了解更的方式,可以关注公众号,期待下一个回合。

    你可能会见到的包引用,以java为例

    POM包

    <!-- elasticsearch.client -->      <dependency>        <groupId>org.elasticsearch.client</groupId>        <artifactId>elasticsearch-rest-high-level-client</artifactId>        <version>6.7.2</version>      </dependency>
    import org.elasticsearch.action.DocWriteResponse;import org.elasticsearch.action.delete.DeleteRequest;import org.elasticsearch.action.delete.DeleteResponse;import org.elasticsearch.action.index.IndexRequest;import org.elasticsearch.action.index.IndexResponse;import org.elasticsearch.action.search.SearchRequest;import org.elasticsearch.action.search.SearchResponse;import org.elasticsearch.action.update.UpdateRequest;import org.elasticsearch.action.update.UpdateResponse;import org.elasticsearch.client.RequestOptions;import org.elasticsearch.client.RestHighLevelClient;import org.elasticsearch.common.unit.TimeValue;import org.elasticsearch.common.xcontent.XContentType;import org.elasticsearch.index.query.BoolQueryBuilder;import org.elasticsearch.index.query.QueryBuilders;import org.elasticsearch.search.SearchHit;import org.elasticsearch.search.builder.SearchSourceBuilder;import org.elasticsearch.search.sort.FieldSortBuilder;import org.elasticsearch.search.sort.SortOrder;

    其他语言的就不帖了,可以到官方站点寻找。感觉官方还是有所保留就是。使用Elasticsearch High Level写查询,相比较于sql,会有一种强烈的不适感,应该有现成的工具可以将sql脚本转化为elasticsearch High level对应的查询代码吧,在这里简单晒一下查询代码的一点神态。

    BoolQueryBuilder boolBuilder = QueryBuilders.boolQuery();boolBuilder.must(QueryBuilders.termsQuery("title", “ChinaHadoop”));boolBuilder.must(QueryBuilders.termsQuery("content","公众号"))

    不要太惊讶,就是这么晦涩与不爽的节奏!写习惯的sql,再来写这种“奇葩”的查询代码,是不是有种“生无可恋”的感受?不用太担心,关注ChinaHadoop公众号,回复”Elasticsearch”可获取一份小白 demo,初始化High Level API Client,定位index,type,多种查询条件代码,覆盖常见查询场景,完全不用烧脑,享受ChinaHadoop干货经验,快速打造自己的搜索引擎!

    本文从应用的角度介绍了如何运用Elaticsearch搭建自主的搜索引擎解决方案,从环境安装、索引建立、同步索引数据,到使用Elastic High Level API进行数据查询,覆盖了一个简易自主搜索引擎的全生命周期,小白可参考本文实现一个自主搜索引擎,遇到问题可回复ChinaHadoop,得到指导与帮助。

    关注ChinaHadoop 走进大数据实战

     

  • ChinaHadoop携手图书云打造大数据主题图书馆 免费企业图书馆 私人图书馆 共享图书更加便捷高效 扫码即刻开启图书共享时代

     

    图书云为共享图书平台,通过图书云微信公众号可将自己的闲置图书共享出来,建立自己的微信私人共享图书馆,可与附近的朋友、同事、好友、群友、同学、邻居、俱乐部成员等分享自己的图书!也许,自己沉睡的图书是他人成长的阶梯!通过图书云,可以打造私人图书馆、企业图书馆、小区图书馆​!

    本次ChinaHadoop携手图书云活动分为微信私人图书馆与企业图书馆两大活动主题!关注图书云公众号可开通私人图书馆,将自己的图书共享到平台,就近分享,特别适合​邻居、同事共享图书!动手能力强的可以自行扫码探索!想先了解的,可以扫码后,看看ChinaHadoop为图书云开设的介绍​!

    一、私人图书馆

    每个IT人士,或多或少都会有些​图书,这些书一点也不便宜!尤其是外文原版图书,看完也舍不得丢了,当废品卖了,更是​心疼!建立一个自己的私人小图书馆,让朋友邻居借着看,感觉就是不​一样!

    1.1 巧用扫码录入

    图书云支持扫码录入图书,扫图书的条形码,可直接将图书录入到平台,结合lbs技术,可让周围的朋友看到自己的图书!快速高效录入!

    1.2 巧用书单码

    图书云书单码是私人图书馆的快速入口,分享给朋友后,可让朋友进入到自己的私人图书馆中,浏览图书清单!支持分享到朋友圈,与圈里的​小伙伴共同图书!

    1.3 实时微信提醒

    关注图书云公众号之后,一旦有小伙伴相中的图书,能收到微信的实时提醒​!通过图书云小程序,可与借书的小伙伴进行实时文字聊天​!约时间、约地点,完成一次图书的​借阅!

    二、图书云企业图书馆

    图书云支持企业微信,通过图书云企业微信入口,可由企业微信管理员开通图书云企业微信功能,还未开通企业微信的企业负责人,可直接通过以下二维码​进行开通!非企业微信管理人员,无法直接开通,需要找管理员扫码开通!图书云​企业版,也是免费的!

    图书云不仅支持私人图书馆、企业图书馆,也支持更多应用场景,可建立社区图书馆、微群图书馆、俱乐部图书馆、社区图书馆!更多的应用​场景等着大家去发现!ChinaHadoop欢迎各位小伙伴共享Hadoop大数据图书,共同建立以大数据为主题的线上​虚拟图书馆!

    图书云  共享创建价值

    ​

  •  

    有人的地方,就有江湖,有输入框的地方,就有注入风险!有输入框的地方,就有敏感词!敏感词就像一个平台杀手,可能直接导致平台被封锁!

    敏感词是一个APP、一个网站、一个内容平台的“杀手”,危害程度杀伤力相当大。将一个文本中的敏感词过滤掉,是一个合法合规平台所必须使用的技术。敏感词的过滤算法是关键词查找、过滤打码的过程,可有效结合时间复杂度高效的树型结构进行算法设计与实现!

    敏感词可能是脏话,也可能是不同文化背景下的禁词,也可能是政治敏感词汇,等等,敏感词可能导致平台遭受法律或政策的制约。举个简单的例子,非法涉黄的网站可能直接被取消网站备案,无法在中国大陆访问。不做敏感词的后果是相当严重的。

    做为一个程序员,一个开发工程师,一定要掌握敏感词算法么?工程师分为很多派系,对于做搜索的工程师,算法,b树,敏感词过程,应该要从底层,从设计到实现都不能放过!做为应用工程师(小白程序员),能掌握算法原理,并能使用,我觉得就好了,树叶有专攻!来来来,来一段算法描述。目前查到的敏感词过滤算法。

    一、敏感词少的情况

    如果敏感词少的话,就直接使用replace,indexOf等等来搞定吧,只是这种情况存在的可能性太小了。敏感词可以说是很多很多。不过,不讲究效率的地方,能实现业务要求的话,使用这种方式也可以。

    二、敏感词较多的情况

    敏感词受政治、人文、种族各种因素影响,词汇量较多,要做到全面的过滤,自然要考虑考虑算法的设计,以保证过滤的高效性。在这里介绍网上流行的一种敏感词过滤算法。深入了解专业算法已经超出了本文的范畴,请自行找其他资料查看。网上流传的算法,主要是将敏感词库放到树型数据结构中,将带过滤的文本投射到敏感词树上,命中的就是踩到敏感词。用树型结构体加速匹配速度。

    2.1 构建敏感词树

    什么是树?主要是树型结构在时间复杂度上有优势。详细了解时间复杂度与树型算法,关注公众号回“算法”!今天不展开介绍树型结构。构建敏感词树型结构体,可以通过第三方库来完成,有现成的。回复公众号“敏感词库”可获取相关信息。如图所示,我们构建了一棵敏感词树,这棵树有傻子、傻逼、傻逼人三个敏感词​。

    2.2 投射文本

    把文本填充到敏感词树上,就能直观的看到哪些敏感词覆盖到了。如果有人在平台发布违禁信息,可以快速识别出来。在这里使用投射文本描述,只是为了描述算法,具体实现就看代码。如图所示,投射到树上文本“傻逼”,就是被发现的​敏感词。

    敏感词过滤算法的核心就是这两步!一棵敏感词树,一次投射文本,就能把敏感词全遍找过来,高效​!

    今天的算法分享就要告一段落了,赶紧播放赞助商广告!

    敏感词过滤算法 为内容保驾护航 Java/.Net/C++/c/Python等语言是如何进行敏感词打码限制的 高效防范违规内容

  • JAX-WS RI 2.2.9 Java WebService Timeout时间设置

     

    JDK1.8 +Tomcat环境,采用以下配置实现了超时配置,且验证有效。

    bindingProvider.getRequestContext().put(“com.sun.xml.internal.ws.connect.timeout”, 30000);
    bindingProvider.getRequestContext().put(“com.sun.xml.internal.ws.request.timeout”, 60000);

    给人感觉,有多种不同的实现!小红帽RedHat给出的示例是针对JBoss,看起jdk有些不一样。

    public void testConfigureTimeout() throws Exception
    {
       //Set timeout until a connection is established
       ((BindingProvider)port).getRequestContext().put("javax.xml.ws.client.connectionTimeout", "6000");
    
       //Set timeout until the response is received
       ((BindingProvider) port).getRequestContext().put("javax.xml.ws.client.receiveTimeout", "1000");
    
       port.echo("testTimeout");
    }
    代码看起来跟引入的包名匹配度高,但是实测不生效。
    而Github上的资料显示,不同的环境下,采用的配置有些不一样,也没有一个统一的标准。
    A little overview of several implementations:
    // Weblogic JAX-WS properties
    ((BindingProvider) port).getRequestContext().put(“com.sun.xml.ws.connect.timeout”, timeout);
    ((BindingProvider) port).getRequestContext().put(“com.sun.xml.ws.request.timeout”, timeout);
    // JDK JAX-WS properties
    ((BindingProvider) port).getRequestContext().put(“com.sun.xml.internal.ws.connect.timeout”, timeout);
    ((BindingProvider) port).getRequestContext().put(“com.sun.xml.internal.ws.request.timeout”, timeout);
    // JBOSS CXF JAX-WS properties, warning these might change in the future (CXF-5261)
    ((BindingProvider) port).getRequestContext().put(“javax.xml.ws.client.connectionTimeout”, timeout);
    ((BindingProvider) port).getRequestContext().put(“javax.xml.ws.client.receiveTimeout”, timeout);
    小节,对于JAX-WS的超时配置,需要依据自身的环境配置来决定。默认的超时时间是30s连接,响应超时是60s,这个可以参与apache cfx官网。未验证。
    参考
    http://cxf.apache.org/docs/client-http-transport-including-ssl-support.html#ClientHTTPTransport(includingSSLsupport)-Example   搜索一下timeout可以查找到配置说明。
    Attribute Description
    ConnectionTimeout Specifies the amount of time, in milliseconds, that the client will attempt to establish a connection before it times out. The default is 30000 (30 seconds). 
    0 specifies that the client will continue to attempt to open a connection indefinitely.
    ReceiveTimeout Specifies the amount of time, in milliseconds, that the client will wait for a response before it times out. The default is 60000. 
    0 specifies that the client will wait indefinitely.

  • WebService传奇故事 这是.Net、Java、C++语言的大战, 也是微软 与 IBM等厂商的PK,于是小白爬坑之路开始

    说到WebSerivce,会想到很久很久前的SOAP,第一次看到的时候,觉得就一个神马。在.Net环境下使用过,导入WebService,直接使用,似乎也是很实用的一种跨平台跨系统的操作体验。单纯在.net体系,是感受不到WebService的阵痛,在java下,才是WebService爬坑的最佳土壤。这个故事的主题在于java与.net两个平台实现的差异,在于厂商实现的异常。

    一、.Net vs Java

    相比较于java,.net体系下的WebService,选择更单一,用ms的就好,直接用ide导入webservice。玩java的话,axis1,axis2,ide导入,wsimport命令生成,还有wsdl2java命令。

    二、厂商之争

    就实战经验来看,不同的厂商对soap的实现,还有差异。.net发起的soap报文是<soap>开头,而java发起soap发起了soapenv报文。导致跨平台调用的时候出现问题。

    方案一 ide导入

    直接使用eclipse导入WebService,同样的方式导入,STS却导入不了。所以实操过程中,选择eclipse导入。针对java平台的WebService调用,调用正常。但是调用一个神秘的WebService,一直报soap报文格式不对。如果没有记错的话,当时eclipse导入WebService,生成的是axis1的实现。网查axis1对于soap请求头处理,就是一个Bug。所以方案一,被丢掉了。

    方案二 前辈方案+axis2

    想着axis1搞不了的事情,兴许axis2能做。当被告之有方案借鉴时,感觉看到了希望。不过,没有看到操作手册,也不知道代码是怎么生成的。从包引用上来讲,用的是axis2,这个就是为什么有axis2方案尝试的原因了。也是迷惑人的地方。因为引入的包,压根没有使用到。但是从代理类的生成风格上来讲,还是具备排版精良的影响。使用axis2的代理类生成工具,生成完代理类之后,吓死了,感觉生成的代码就是一团芝麻糊,于是,直接丢掉了。为什么别人生成的axis2代理类这么优秀,而我生成的惨不忍睹?

    方案三 wsimport方案

    绕了半圈,回到了java sdk自带的wsimport,直接在命令行输入wsimport,会有提示。存放代理类的文件夹不存在的话,还不给生成,这个有点小小的坑!

    D:\>wsimport缺少 WSDL_URI​​用法: wsimport [options] <WSDL_URI>​\其中 [options] 包括:  -b <path>                 指定 jaxws/jaxb 绑定文件或附加模式                            (每个 <path> 都必须具有自己的 -b)  -B<jaxbOption>            将此选项传递给 JAXB 模式编译器  -catalog <file>           指定用于解析外部实体引用的目录文件                            支持 TR9401, XCatalog 和 OASIS XML 目录格式。  -d <directory>            指定放置生成的输出文件的位置  -encoding <encoding>      指定源文件所使用的字符编码  -extension                允许供应商扩展 - 不按规范                            指定功能。使用扩展可能会                            导致应用程序不可移植或                            无法与其他实现进行互操作  -help                     显示帮助  -httpproxy:<host>:<port>  指定 HTTP 代理服务器 (端口默认为 8080)  -keep                     保留生成的文件  -p <pkg>                  指定目标程序包  -quiet                    隐藏 wsimport 输出  -s <directory>            指定放置生成的源文件的位置  -target <version>         按给定的 JAXWS 规范版本生成代码                            默认为 2.2, 接受的值为 2.0, 2.1 和 2.2                            例如, 2.0 将为 JAXWS 2.0 规范生成兼容的代码  -verbose                  有关编译器在执行什么操作的输出消息  -version                  输出版本信息  -wsdllocation <location>  @WebServiceClient.wsdlLocation 值  -clientjar <jarfile>      创建生成的 Artifact 的 jar 文件以及                            调用 Web 服务所需的 WSDL 元数据。  -generateJWS              生成存根 JWS 实现文件  -implDestDir <directory>  指定生成 JWS 实现文件的位置  -implServiceName <name>   生成的 JWS 实现的服务名的本地部分  -implPortName <name>      生成的 JWS 实现的端口名的本地部分​\扩展:  -XadditionalHeaders              映射标头不绑定到请求或响应消息不绑定到                                   Java 方法参数  -Xauthfile                       用于传送以下格式的授权信息的文件:                                   http://username:password@example.org/stock?wsdl  -Xdebug                          输出调试信息  -Xno-addressing-databinding      允许 W3C EndpointReferenceType 到 Java 的绑定  -Xnocompile                      不编译生成的 Java 文件  -XdisableAuthenticator           禁用由 JAX-WS RI 使用的验证程序,                                   将忽略 -Xauthfile 选项 (如果设置)  -XdisableSSLHostnameVerification 在提取 wsdl 时禁用 SSL 主机名                                   验证​\示例:  wsimport stock.wsdl -b stock.xml -b stock.xjb  wsimport -d generated http://example.org/stock?wsdl

    照着命令行的提示来,就能生成代理类了。

    采用wsimport生成的代理类竟然跟4年前同事留下的对接项目代码是一样的,于是修改<soapenv>就有着落了。实战证明,前辈们留下的代码管用。关键的代码就是自己实现一个报文处理的Handler,然后在Soap代理类调用时,先设置Handler!

    wsInstance = new WS();        wsInstance.setHandlerResolver(portInfo -> {          List<Handler> handlerList = new ArrayList<>();          handlerList.add(new SOAPEnvelopeHandler());          return handlerList;        });

    关注本公众号,输入soap获得SOAPEnvelopeHandler详细讲解。

    方案不足之处

    采用wsimport生成的代理类指定了wsdl位置,这个看起来怪怪,但是这种方案能修改soap请求报文,可以默认接受了这个让人心头有点痒痒的方案。

    WebService优化

    采用单例优先代练类的创建,能提升压测值。在未使用单例优化时,空接口也无法通过5000/min压测,采用单例优化后,可以通过。最终的优化方案为:

    1. 能缓存的,使用redis缓存60秒。过压测。
    2. 不能缓存的,过不了压测,限制每分钟调用频率。

    受控环境下的WebService联调技术

    如果开发机器不能直接调用对方的WebService,如何进行快速联调呢?关注本公众号,回复信息wsdebug,获取实战经验分享。

    WebService与区服切换

    回复信息switcharea,获取实战经验分享。

    思考

    今天的思考题:sonarqube报很多漏洞很多bug的代码是不是好代码?请留下您的思考答案。

    结束语

    WebService从诞生到现在,越来越不受待见了,越来越多的人喜欢采用更轻量级的WebAPI来代替WebService,采用JSON,采用更加透明的跨平台方案。但是WebService并没有死,因为生成代码还是一个优点。如果再次在java平台下对接WebService,请优先考虑jdk自带的wsimport进行代理类生成,可通过自定义SOAPHandler达到更好的兼容性。如有更好的方法,请留言告之。

    关注公众号 看同行经验分享